arrow
返回

Explainability of machine learning models under missing data

delete2026-03-23
delete0
PRE
AI
T
Tuan L. Vo *
T
Thu Nguyen
L
Luis M. López-Ramos
H
Hugo L. Hammer
M
Michael A. Riegler
P
Pål Halvorsen
DOI:10.1016/j.asoc.2026.115105delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
• 插补对模型可解释性的影响:不同的插补方法显著影响Shapley值,进而影响机器学习模型中特征重要性和交互作用的解释。 • 预测准确性与可解释性之间的权衡:测试预测的均方误差(MSE)降低并不必然对应Shapley值的均方误差降低,凸显了插补准确性与可解释性保留之间的权衡。 • 数据集和缺失率依赖性:插补方法对Shapley值的影响因数据集而异,且随着缺失数据率的增加而更加显著,强调了需要针对具体情境的插补策略。 • XGBoost直接处理缺失数据的局限性:尽管XGBoost能够直接处理缺失数据,但相较于使用插补数据,其通常会导致Shapley值更显著的扭曲,引发了可解释性的担忧。 • 插补方法选择的实践指导:本研究为基于数据集特征、缺失率以及准确性与可解释性权衡选择插补方法提供了见解和建议。
Keyword:
Imputation methods
Shapley values
Model explainability
Missing data
Feature importance

期刊

Applied Soft Computing 封面图
Applied Soft Computing
IF:
6.6
论文数:
1.4W
被引数:
4.8W

机构

S
simulamet
学者数:
17
论文数: 8
被引数: 0
T
telecom paris
学者数:
316
论文数: 259
被引数: 0