返回
Linearly-interpretable concept embedding models for text analysis
DOI:10.1007/s10994-025-06839-5.png)
摘要
En 中文
尽管取得了成功,大型语言模型(LLMs)仍因其可解释性不足而受到批评。基于注意力和梯度分析的传后续解释方法仅能近似模型决策过程,已被证明并不可靠。因此,概念瓶颈模型(CBMs)近期在文本领域被提出,旨在基于人类可理解的概念提供可解释的预测。然而,CBMs仍存在局限性,包括其架构约束限制了表达力、使用非线性任务预测器时缺乏任务可解释性,以及需要大量标注数据,这在现实文本数据中不切实际。本文通过提出一种新颖的线性可解释概念嵌入模型(LICEM)来解决这些挑战,超越了当前的准确率-可解释性权衡。LICEM的分类准确率优于现有可解释模型,并与黑箱模型相当。我们证明,我们模型提供的解释比现有方案更具干预性和因果一致性。最后,我们表明LICEM可以在无需任何概念监督的情况下训练,因为使用LLM骨干网络时概念可以自动预测。
Keyword:
Concept-XAI
Text analysis
Linear concept attribution
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

