arrow
Return

Multi-level vision language interaction learning for cross-modal retrieval

delete2025-07-15
delete0
PRE
AI
H
Hao Wang
F
Fang Liu *
L
Licheng Jiao
J
Jiahao Wang
S
Shuo Li
L
Lingling Li
陈璞花 (Puhua Chen)
刘旭 (Xu Liu)
W
Wenping Ma
DOI:10.1016/j.inffus.2025.103481delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
• Multi-Level Vision Language Interaction is proposed. • Parameter-free Frame-aware Token-wise Interaction Mechanism is introduced. • Flawed Mask Fixing Algorithm is designed to correct incorrect negative pairs.
Keywords:
Multi-Level Vision Language Interaction
Frame-aware Token-wise Interaction
Mask Fixing Algorithm

Journal

Information Fusion cover
Information Fusion
IF:
15.5
Papers:
4.1K
Citations:
2.7W

Organization

No organization information available