arrow
返回

Enhancing visual representation for text-based person searching

delete2025-01-01
delete2
PRE
AI
S
Shen, Wei
方明 封面图
方明 (Ming Fang)
Y
Yuxia Wang
J
Jiafeng Xiao
D
Diping Li
H
Huangqun Chen
L
Ling Xu
DOI:10.1016/j.knosys.2024.112893delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
基于文本的人体搜索旨在根据文本描述从大规模图像数据库中检索出匹配的行人。该任务的核心难点在于如何从行人图像和文本中提取有效细节,并在共同潜在空间中实现跨模态对齐。现有工作采用在单模态数据上预训练的图像和文本编码器,分别从图像和文本中提取全局和局部特征,然后显式实现全局-局部对齐。然而,这些方法仍缺乏理解视觉细节的能力,且检索精度受限于身份混淆。为缓解上述问题,我们重新思考了视觉特征对基于文本的人体搜索的重要性,并提出了VFE-TPS(Visual Feature Enhanced Text-based Person Search)模型。该模型引入预训练的多模态骨干网络CLIP以学习基础跨模态特征,并构建文本引导的掩码图像建模任务,以增强模型学习局部视觉细节的能力,而无需显式标注。此外,我们设计了身份监督的全局视觉特征校准任务,以引导模型学习具备身份感知能力的全局视觉特征。本研究的关键发现是:借助我们提出的辅助任务,预训练CLIP模型中的知识能够成功适配到基于文本的人体搜索任务中,且模型的视觉理解能力得到显著增强。在三个基准数据集上的实验结果表明,我们提出的模型超越了现有方法,且Rank-1准确率显著提升,改进幅度约为1%~9%。我们的代码可在https://github.com/zhangweifeng1218/VFE_TPS找到。
Keyword:
Pedestrian re-identification
Cross-modal retrieval
Vision-language model

期刊

K
Knowledge-Based Systems
IF:
7.6
论文数:
1.3W
被引数:
4.5W

机构

暂无机构信息
引用论文

引用论文

CLIP-Driven Fine-Grained Text-Image Person Re-Identification
err2023-01-01
err29
errOAAI
errYan, Shuanglin; Dong, Neng; Zhang, Liyan; Tang, Jinhui
err分享
err收藏
Person Search with Natural Language Description
err2017-07-01
err0
errOAAI
errShuang Li; Tong Xiao; Hongsheng Li; Bolei Zhou; Dayu Yue; Xiaogang Wang
err分享
err收藏
err分享
err收藏
In defense and revival of Bayesian filtering for thermal infrared object tracking
err2024-06-01
err6
errOAAI
errGao, Peng; Li, Shi-Min; Gao, Feng; Wang, Fei; Yuan, Ru-Yue; Fujita, Hamido
err分享
err收藏
Text-based person search via local-relational-global fine grained alignment
err2023-02-01
err6
PREAI
errZhou, Junfeng; Huang, Baigang; Fan, Wenjiao; Cheng, Ziqian; Zhao, Zhuoyi; Zhang, Weifeng
err分享
err收藏
A Simple and Robust Correlation Filtering Method for Text-Based Person Search
err2022-11-04
err0
PREAI
errWei Suo; Mengyang Sun; Kai Niu; Yiqi Gao; Peng Wang; Yanning Zhang; Qi Wu
err分享
err收藏
err分享
err收藏
学者 查看更多内容