Return
Enhancing vision–language contrastive representation learning using domain knowledge
DOI:10.1016/j.cviu.2025.104403.png)
Abstract
En 中文
• Rich semantics can be developed in representation learning by leveraging. • The inter-data relationships can be modeled using external knowledge. • Additional cross-modal alignment leads to better visual understanding. • Fine-grained inter-data similarity can serve as soft targets for cross-modal alignment.
Keywords:
Visual representation
Knowledge graph
Vision–language contrastive learning
Journal
IF:
3.5
Papers:
428
Citations:
7.3K
Organization
No organization information available

