Return
Multi-level vision language interaction learning for cross-modal retrieval
DOI:10.1016/j.inffus.2025.103481.png)
Abstract
En 中文
• Multi-Level Vision Language Interaction is proposed. • Parameter-free Frame-aware Token-wise Interaction Mechanism is introduced. • Flawed Mask Fixing Algorithm is designed to correct incorrect negative pairs.
Keywords:
Multi-Level Vision Language Interaction
Frame-aware Token-wise Interaction
Mask Fixing Algorithm
Journal
IF:
15.5
Papers:
4.1K
Citations:
2.7W
Organization
No organization information available

