返回
Consistent attributions for transformer-based reversible comparison classifiers
DOI:10.1007/s10618-026-01205-y.png)
摘要
En 中文
比较任务在产品评估、观点比较和决策支持等多个领域扮演着至关重要的角色。这些任务涉及基于文本输入判断一个对象是否优于另一个。尽管基于Transformer的模型在此类任务中表现出色,但其可解释性仍然有限。现有解释方法常缺乏可逆性和上下文一致性,这意味着当输入顺序反转时,解释可能显著不同,尽管比较的语义意义保持不变。这种不一致性导致解释出现偏差、不稳定且不可靠,从而降低透明度和可信度。为解决此问题,我们提出统一上下文可逆性归因(URAttr)框架,为基于Transformer的比较模型提供一致且忠实的词元级归因。URAttr明确利用两种输入配置(原始和反转)来确保比较任务中Transformer的一致且稳健的词元级解释。在五个比较数据集上的广泛实验表明,URAttr在一致性地优于基于注意力、梯度和相关性的基线方法。具体而言,URAttr相较于次优方法,在Bi-AOPC上最高提升0.060,Bi-LOdds上降低0.497,表明其归因一致性更强且词元选择更忠实。定性可视化进一步显示,URAttr突出语义有意义的词语,并在原始和反转输入间保持相同的词元排序。
Keyword:
Explainable AI
Transformer interpretability
Reversible comparison tasks
Attribution consistency
期刊
IF:
4.3
论文数:
202
被引数:
6.0K

