arrow
返回

Soft-Label Guided Composed Image Retrieval Based on Modified Semantic Text Encoder

delete2026-01-01
delete0
PRE
AI
N
Ni, Yifei
N
Ning, Bo *
Z
Zhou, Xin
L
Li, Guanyu
Z
Zou, Wen
DOI:10.1007/978-981-95-3462-3_29delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
与传统仅允许用户通过文本或图像查询来表达搜索意图的图像检索方法不同,组合图像检索(CIR)使用户能够利用多模态查询,将参考图像与修改文本结合以检索目标图像。近年来,组合图像检索(CIR)的主流研究通常采用大型预训练的视觉-语言模型作为特征提取骨干,随后通过非线性特征级多模态查询融合进行目标图像检索。此外,还提出了原始数据级多模态特征融合的解决方案,以防止融合特征偏离原始嵌入空间,这可能损害检索性能。尽管这种方法在一定程度上缓解了特征偏差问题,但我们认为直接处理融合的原始数据可能导致特征损失和多模态匹配问题。为此,我们提出了文本编码器的预训练阶段,通过结合候选图像描述、修改文本和目标文本学习语义修改策略。对于每个查询,我们预先选择最相似的Top-K目标图像作为全局软标签,而批次内的目标图像概率分布作为局部软标签。这种方法引导查询与目标之间的相似度概率分布,推动细化的查询特征和假阴性样本特征在潜在空间中更接近,从而缓解多模态匹配损失。我们通过在三个公开数据集上的实验验证了改进的有效性。
Keyword:
Composed Image Retrieval
Raw-data Fusion
Soft Label Alignment

期刊

A
ADVANCED DATA MINING AND APPLICATIONS, ADMA 2025, PT IV
IF:
0
论文数:
29
被引数:
0

机构

D
Dalian Maritime University
学者数:
1.2W
论文数: 7.8K
被引数: 6.3K