返回
Enhancing visual representation for text-based person searching
DOI:10.1016/j.knosys.2024.112893.png)
摘要
En 中文
基于文本的人体搜索旨在根据文本描述从大规模图像数据库中检索出匹配的行人。该任务的核心难点在于如何从行人图像和文本中提取有效细节,并在共同潜在空间中实现跨模态对齐。现有工作采用在单模态数据上预训练的图像和文本编码器,分别从图像和文本中提取全局和局部特征,然后显式实现全局-局部对齐。然而,这些方法仍缺乏理解视觉细节的能力,且检索精度受限于身份混淆。为缓解上述问题,我们重新思考了视觉特征对基于文本的人体搜索的重要性,并提出了VFE-TPS(Visual Feature Enhanced Text-based Person Search)模型。该模型引入预训练的多模态骨干网络CLIP以学习基础跨模态特征,并构建文本引导的掩码图像建模任务,以增强模型学习局部视觉细节的能力,而无需显式标注。此外,我们设计了身份监督的全局视觉特征校准任务,以引导模型学习具备身份感知能力的全局视觉特征。本研究的关键发现是:借助我们提出的辅助任务,预训练CLIP模型中的知识能够成功适配到基于文本的人体搜索任务中,且模型的视觉理解能力得到显著增强。在三个基准数据集上的实验结果表明,我们提出的模型超越了现有方法,且Rank-1准确率显著提升,改进幅度约为1%~9%。我们的代码可在https://github.com/zhangweifeng1218/VFE_TPS找到。
Keyword:
Pedestrian re-identification
Cross-modal retrieval
Vision-language model
期刊
K
IF:
7.6
论文数:
1.3W
被引数:
4.5W
机构
暂无机构信息

