返回
Self-generated Cross-Modal Prompt Tuning
DOI:10.1007/978-3-032-06066-2_22.png)
摘要
En 中文
在任务特定数据上训练提示调优模型是适应视觉-语言模型知识以用于图像识别下游任务的一种常见方法。尽管提示调优技术取得了近期进展,但实现跨越广泛视觉特性(包括风格、格式和来源)的异构图像上的优越泛化能力仍然是一个重大挑战。为此,我们提出了一种新颖方法,即自生成跨模态提示调优(SCP),该方法在初始化和优化阶段应用冻结知识生成伪提示以指导训练。因此,模型可以在可用数据集上进行训练,同时有效泛化到具有广泛文本类别和视觉特性的异构图像数据。在四个基准测试中的大量实验表明,我们提出的SCP在广泛的下游任务泛化性能上显著优于知名基线方法。值得注意的是,我们提出的SCP在跨数据集和领域漂移泛化方面均表现出显著提升,性能提升分别至少为3.63%和11.71%。我们的代码可在https://github.com/Ghosttimber/Academic获取。
Keyword:
Computer Vision
Multi-Modal
Prompt Tuning
期刊
机构
引用论文
Learning Generative Visual Models from Few Training Examples: An Incremental Bayesian Approach Tested on 101 Object Categories从少数训练示例中学习生成的视觉模型: 在101对象类别上测试的增量贝叶斯方法
EuroSAT: A Novel Dataset and Deep Learning Benchmark for Land Use and Land Cover ClassificationEuroSAT: 用于土地利用和土地覆盖分类的新型数据集和深度学习基准
The Many Faces of Robustness: A Critical Analysis of Out-of-Distribution Generalization健壮性的多面: 分布外泛化的批判性分析

