返回
Prompting without Panic: Attribute-Aware, Zero-Shot, Test-Time Calibration
DOI:10.1007/978-3-032-06106-5_17.png)
摘要
En 中文
视觉语言模型(VLMs)已成为图像识别的有效工具,这主要得益于它们在大数据集上的自监督训练。其性能可以通过测试时提示调整(TPT)进一步提升。然而,TPT过于关注准确率提升往往导致置信度校准下降,限制了其在安全关键应用中的使用。本研究做出两项贡献:(1)我们提出,提示的随机或简单初始化会导致对特定测试样本的过拟合,这是TPT后VLMs校准失效的原因之一。为缓解此问题,我们提出利用大型语言模型(LLM)关于目标标签属性的先验知识,对测试时提示进行谨慎初始化。(2)我们提出一种新型正则化技术,以在测试时提示调整(TPT)过程中保持提示校准。该方法在最小化类内提示距离的同时,最大化类间提示距离。我们的方法在多种CLIP架构和15个多样化数据集上实现了显著的校准改进,证明了其对TPT的有效性。我们报告,采用我们的方法TCA,预期校准误差(ECE)平均为4.11,而原始TPT[29]为11.7,C-TPT[55](ICLR'24)为6.12,DiffTPT[8](CVPR'23)为6.78,PromptAlign[44](NeurIPS'23)为8.43。代码可公开获取于https://github.com/rhebbalaguppe/TCA_PromptWithoutPanic。
Keyword:
Vision language models
Test-time prompt tuning
Confidence calibration
Prompt initialization
Regularization techniques
期刊
机构
引用论文
EuroSAT: A Novel Dataset and Deep Learning Benchmark for Land Use and Land Cover ClassificationEuroSAT: 用于土地利用和土地覆盖分类的新型数据集和深度学习基准
The Many Faces of Robustness: A Critical Analysis of Out-of-Distribution Generalization健壮性的多面: 分布外泛化的批判性分析

