返回
Frequency-Based Comprehensive Prompt Learning for Vision-Language Models
DOI:10.1109/TPAMI.2025.3599830.png)
摘要
En 中文
本文旨在学习多个全面的文本提示,以从粗到细描述视觉概念,从而赋予预训练的VLMs(视觉语言模型)更好的下游任务迁移能力。我们重点关注在基于Transformer的VLMs上探索这一思路,因为这类架构相较于基于CNN的模型取得了更具说服力的性能。然而,不幸的是,与CNN不同,预训练VLMs的Transformer视觉编码器无法自然地提供具有区分性和代表性的局部视觉信息。为解决此问题,我们提出了基于频率的全面提示学习(FCPrompt),以从视觉编码器的冗余输出特征中挖掘代表性的局部视觉信息。FCPrompt通过离散余弦变换(DCT)将这些特征转换到频率域。利用DCT的能量集中和信息正交性优势,我们可以通过利用转换后的频率特征的特定频率分量,获得紧凑、信息丰富且解耦的局部视觉信息。为更好地适配Transformer架构,FCPrompt进一步采用并优化了不同的文本提示,通过双分支框架分别与全局和基于频率的局部视觉信息对齐。最终,所学的文本提示能够全面地从粗到细描述整个视觉概念。广泛的实验表明,FCPrompt在多个基准上取得了最先进的性能。
Keyword:
Parameter-efficient fine-tuning
prompt learning
vision-language model
transfer learning
期刊
IF:
18.6
论文数:
864
被引数:
9.8W
机构
引用论文
暂无论文信息

