arrow
返回

Frequency-Based Comprehensive Prompt Learning for Vision-Language Models

delete2025-08-19
delete0
PRE
AI
L
Liangchen Liu
王南南 封面图
王南南 (Nannan Wang)
C
Chen Chen
D
Decheng Liu
X
Xi Yang
X
Xinbo Gao
T
Tongliang Liu
DOI:10.1109/TPAMI.2025.3599830delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
本文旨在学习多个全面的文本提示,以从粗到细描述视觉概念,从而赋予预训练的VLMs(视觉语言模型)更好的下游任务迁移能力。我们重点关注在基于Transformer的VLMs上探索这一思路,因为这类架构相较于基于CNN的模型取得了更具说服力的性能。然而,不幸的是,与CNN不同,预训练VLMs的Transformer视觉编码器无法自然地提供具有区分性和代表性的局部视觉信息。为解决此问题,我们提出了基于频率的全面提示学习(FCPrompt),以从视觉编码器的冗余输出特征中挖掘代表性的局部视觉信息。FCPrompt通过离散余弦变换(DCT)将这些特征转换到频率域。利用DCT的能量集中和信息正交性优势,我们可以通过利用转换后的频率特征的特定频率分量,获得紧凑、信息丰富且解耦的局部视觉信息。为更好地适配Transformer架构,FCPrompt进一步采用并优化了不同的文本提示,通过双分支框架分别与全局和基于频率的局部视觉信息对齐。最终,所学的文本提示能够全面地从粗到细描述整个视觉概念。广泛的实验表明,FCPrompt在多个基准上取得了最先进的性能。
Keyword:
Parameter-efficient fine-tuning
prompt learning
vision-language model
transfer learning

期刊

IEEE Transactions on Pattern Analysis and Machine Intelligence 封面图
IEEE Transactions on Pattern Analysis and Machine Intelligence
IF:
18.6
论文数:
864
被引数:
9.8W

机构

T
The University of Sydney
学者数:
2.6K
论文数: 1.1K
被引数: 7.9W
X
Xidian University
学者数:
2.4W
论文数: 1.9W
被引数: 9.7K
引用论文

引用论文

暂无论文信息