arrow
Return

Cross-modality-enhanced visual Scene Graph Generation

delete2025-07-27
delete0
PRE
AI
F
Fei Yu
H
Hui Ji
Y
Yuehua Li *
DOI:10.1016/j.inffus.2025.103430delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
• We propose audio-enhanced scene graphs by integrating auditory information. • We design an audio-guided detector to improve entity recognition in scenes. • We fuse visual and audio features to enhance entity relationship modeling. • We introduce the VALM dataset for multimodal visual-auditory scene analysis.
Keywords:
audio-enhanced scene graphs
audio-guided detector
visual-audio feature fusion
multimodal analysis
VALM dataset

Journal

Information Fusion cover
Information Fusion
IF:
15.5
Papers:
4.1K
Citations:
2.7W

Organization

Z
Zhejiang Lab
Scholars:
335
Papers: 165
Citations: 8.0K
J
Jiangsu University
Scholars:
4.0W
Papers: 2.8W
Citations: 5.5W
L
liaoning university of technology
Scholars:
2.2K
Papers: 1.5K
Citations: 1
researcher View more organizations