Return
Cross-modality-enhanced visual Scene Graph Generation
DOI:10.1016/j.inffus.2025.103430.png)
Abstract
En 中文
• We propose audio-enhanced scene graphs by integrating auditory information. • We design an audio-guided detector to improve entity recognition in scenes. • We fuse visual and audio features to enhance entity relationship modeling. • We introduce the VALM dataset for multimodal visual-auditory scene analysis.
Keywords:
audio-enhanced scene graphs
audio-guided detector
visual-audio feature fusion
multimodal analysis
VALM dataset
Journal
IF:
15.5
Papers:
4.1K
Citations:
2.7W

