返回
Explainability of machine learning models under missing data
DOI:10.1016/j.asoc.2026.115105.png)
摘要
En 中文
• 插补对模型可解释性的影响:不同的插补方法显著影响Shapley值,进而影响机器学习模型中特征重要性和交互作用的解释。
• 预测准确性与可解释性之间的权衡:测试预测的均方误差(MSE)降低并不必然对应Shapley值的均方误差降低,凸显了插补准确性与可解释性保留之间的权衡。
• 数据集和缺失率依赖性:插补方法对Shapley值的影响因数据集而异,且随着缺失数据率的增加而更加显著,强调了需要针对具体情境的插补策略。
• XGBoost直接处理缺失数据的局限性:尽管XGBoost能够直接处理缺失数据,但相较于使用插补数据,其通常会导致Shapley值更显著的扭曲,引发了可解释性的担忧。
• 插补方法选择的实践指导:本研究为基于数据集特征、缺失率以及准确性与可解释性权衡选择插补方法提供了见解和建议。
Keyword:
Imputation methods
Shapley values
Model explainability
Missing data
Feature importance

