返回
Scale Up Composed Image Retrieval Learning via Modification Text Generation
DOI:10.1109/TMM.2025.3599088.png)
摘要
En 中文
合成图像检索(CIR)旨在通过结合参考图像和修改文本作为查询来搜索目标图像。尽管取得了近期进展,但由于训练数据有限和三元组标注过程繁琐,该任务仍然具有挑战性。为解决此问题,本文提出合成训练三元组以增强CIR问题的训练资源。具体而言,我们首先利用大规模多模态模型训练一个修改文本生成器,并通过预训练和微调阶段扩大CIR学习。在预训练期间,我们利用训练好的生成器直接基于图像对创建面向修改文本的合成三元组(MTST)。对于微调,我们首先合成反向修改文本以将目标图像连接回参考图像。随后,我们设计了一种两跳对齐策略,以逐步缩小多模态对与目标图像之间的语义差距。我们首先利用原始三元组及其反向版本以循环方式学习一个隐式原型,然后结合隐式原型特征与修改文本,以促进与目标图像的精确对齐。大量实验验证了生成三元组的有效性,并确认我们提出的方法在CIRR和FashionIQ基准上均达到了有竞争力的召回率。
Keyword:
Composed image retrieval
text generation
metric learning
information retrieval
期刊
IF:
9.7
论文数:
4.5K
被引数:
2.4W
机构
引用论文
暂无论文信息

