arrow
返回

Linearly-interpretable concept embedding models for text analysis

delete2025-09-04
delete0
delete
OA
AI
F
Francesco De Santis *
P
Philippe Bich
G
Gabriele Ciravegna
P
Pietro Barbiero
D
Danilo Giordano
T
Tania Cerquitelli
DOI:10.1007/s10994-025-06839-5delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
尽管取得了成功,大型语言模型(LLMs)仍因其可解释性不足而受到批评。基于注意力和梯度分析的传后续解释方法仅能近似模型决策过程,已被证明并不可靠。因此,概念瓶颈模型(CBMs)近期在文本领域被提出,旨在基于人类可理解的概念提供可解释的预测。然而,CBMs仍存在局限性,包括其架构约束限制了表达力、使用非线性任务预测器时缺乏任务可解释性,以及需要大量标注数据,这在现实文本数据中不切实际。本文通过提出一种新颖的线性可解释概念嵌入模型(LICEM)来解决这些挑战,超越了当前的准确率-可解释性权衡。LICEM的分类准确率优于现有可解释模型,并与黑箱模型相当。我们证明,我们模型提供的解释比现有方案更具干预性和因果一致性。最后,我们表明LICEM可以在无需任何概念监督的情况下训练,因为使用LLM骨干网络时概念可以自动预测。
Keyword:
Concept-XAI
Text analysis
Linear concept attribution
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

Machine Learning 封面图
Machine Learning
IF:
2.9
论文数:
2.7K
被引数:
3.4W

机构

F
Faculty of Informatics
学者数:
80
论文数: 54
被引数: 0
C
centai institute
学者数:
6
论文数: 4
被引数: 0