返回
Leveraging Concise Concepts With Probabilistic Modeling for Interpretable Visual Recognition
DOI:10.1109/TMM.2025.3557677.png)
摘要
En 中文
可解释的视觉识别对高风险情境下的决策制定至关重要。近期进展通过利用视觉语言模型(VLMs)和大型语言模型(LLMs)与概念瓶颈模型(CBMs)相结合,实现了可解释模型的自动化构建,这些模型处理与人类可理解概念相关联的瓶颈层。然而,现有方法存在两个主要问题:a) 从LLMs收集的概念可能与任务无关的描述冗余,导致概念空间质量低下并可能存在不匹配;b) VLMs将全局确定性图像嵌入直接映射到精细概念,导致过程模糊且映射结果不精确。为解决上述两个问题,我们提出了一种针对CBMs的新型解决方案——简洁概念与概率建模(CCPM),可通过高质量概念和精确映射策略实现卓越的分类性能。首先,我们利用上下文示例作为类别相关线索来指导LLM的概念生成过程。为缓解概念空间中的冗余,我们提出了关系感知选择(RAS)模块,基于图像-概念和概念间关系获取简洁且具有区分性和相关性的概念集。其次,为精确映射,我们采用概率分布适配器(PDA),该适配器估计预训练VLMs图像嵌入的固有模糊性,以捕捉与概念的复杂关系。大量实验表明,我们的模型在八个主流识别基准上实现了最佳结果,分类准确率提高了6.18%,并通过可解释性分析提供了可靠的解释能力。
Keyword:
Concept bottleneck model
vision-language model
probabilistic modeling
期刊
IF:
9.7
论文数:
4.5K
被引数:
2.4W
机构
引用论文
Stop explaining black box machine learning models for high stakes decisions and use interpretable models instead停止解释高风险决策的黑盒机器学习模型,而改用可解释的模型

