返回
Semi-Supervised Text-Based Person Search
DOI:10.1109/TIP.2025.3607637.png)
摘要
En 中文
基于文本的人体搜索(TBPS)旨在根据自然语言描述,从大规模图像库中检索特定人体的图像。现有方法依赖于大量标注的图像-文本数据,以在完全监督学习下实现令人满意的效果。鉴于获取人体图像标注文本的难度,这构成了重大的实际挑战。本研究开展了一项开创性工作,探索半监督设置下的TBPS,其中仅有少量人体图像带有文本描述标注,而大部分图像缺乏标注。我们提出了一种基于生成-检索的两阶段基本解决方案,用于半监督TBPS。生成阶段通过应用图像标题生成模型为未标注图像生成伪文本,以丰富标注数据。随后,检索阶段使用增强数据进行完全监督的检索学习。关键在于,考虑到伪文本对检索学习的噪声干扰,我们提出了一种抗噪声检索框架,以增强检索模型处理噪声数据的能力。该框架整合了两种关键策略:混合块-通道掩码(PC-Mask)用于优化模型架构,以及噪声引导的渐进训练(NP-Train)用于改进训练过程。PC-Mask在输入数据上进行块级和通道级的掩码操作,以防止过拟合噪声监督。NP-Train根据伪文本的噪声水平引入渐进式训练计划,以促进抗噪声学习。在多个TBPS基准上的广泛实验表明,所提出的框架在半监督设置下取得了有前景的性能。
Keyword:
Text-based person search
semi-supervised learning
noise-robust learning
期刊
IF:
13.7
论文数:
1.0W
被引数:
8.4W
机构
引用论文
暂无论文信息

