arrow
Return

Enhancing vision–language contrastive representation learning using domain knowledge

delete2025-06-10
delete0
delete
OA
AI
X
Xiaoyang Wei
C
Camille Kurtz
F
Florence Cloppet
DOI:10.1016/j.cviu.2025.104403delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
• Rich semantics can be developed in representation learning by leveraging. • The inter-data relationships can be modeled using external knowledge. • Additional cross-modal alignment leads to better visual understanding. • Fine-grained inter-data similarity can serve as soft targets for cross-modal alignment.
Keywords:
Visual representation
Knowledge graph
Vision–language contrastive learning

Journal

Computer Vision and Image Understanding cover
Computer Vision and Image Understanding
IF:
3.5
Papers:
428
Citations:
7.3K

Organization

No organization information available