arrow
返回

Scale Up Composed Image Retrieval Learning via Modification Text Generation

delete2025-01-01
delete0
PRE
AI
Y
Yinan Zhou
Y
Yaxiong Wang
H
Haokun Lin
C
Chen Ma
L
Li Zhu
Z
Zhedong Zheng
DOI:10.1109/TMM.2025.3599088delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
合成图像检索(CIR)旨在通过结合参考图像和修改文本作为查询来搜索目标图像。尽管取得了近期进展,但由于训练数据有限和三元组标注过程繁琐,该任务仍然具有挑战性。为解决此问题,本文提出合成训练三元组以增强CIR问题的训练资源。具体而言,我们首先利用大规模多模态模型训练一个修改文本生成器,并通过预训练和微调阶段扩大CIR学习。在预训练期间,我们利用训练好的生成器直接基于图像对创建面向修改文本的合成三元组(MTST)。对于微调,我们首先合成反向修改文本以将目标图像连接回参考图像。随后,我们设计了一种两跳对齐策略,以逐步缩小多模态对与目标图像之间的语义差距。我们首先利用原始三元组及其反向版本以循环方式学习一个隐式原型,然后结合隐式原型特征与修改文本,以促进与目标图像的精确对齐。大量实验验证了生成三元组的有效性,并确认我们提出的方法在CIRR和FashionIQ基准上均达到了有竞争力的召回率。
Keyword:
Composed image retrieval
text generation
metric learning
information retrieval

期刊

IEEE Transactions on Multimedia 封面图
IEEE Transactions on Multimedia
IF:
9.7
论文数:
4.5K
被引数:
2.4W

机构

H
hefei university of technology
学者数:
2.5W
论文数: 1.7W
被引数: 35
X
xi’an jiaotong university
学者数:
7.7K
论文数: 2.4K
被引数: 1
U
university of the chinese academy of sciences
学者数:
109
论文数: 60
被引数: 1
C
City University of Hong Kong
学者数:
2.3W
论文数: 3.0W
被引数: 6.1W
U
University of Macau
学者数:
1.1W
论文数: 1.3W
被引数: 2.0W
学者 查看更多机构
引用论文

引用论文

暂无论文信息