返回
DemandClean: A Multi-Objective Learning Framework for Balancing Model Tolerance to Data Authenticity and Diversity
DOI:10.14778/3750601.3750666.png)
摘要
En 中文
现实世界的数据集通常存在多种质量问题,阻碍下游模型性能并增加清洗成本。为解决此问题,我们提出了DemandClean,一种基于强化学习的自适应数据清洗框架,该框架动态平衡清洗效果和运营成本。DemandClean明确考虑了数据真实性(与真实世界事实的一致性)、多样性(特征值的丰富性)以及下游模型的噪声容忍度。我们将数据错误分为缺失类(降低真实性和多样性)、语义类(仅影响真实性)和语法类(影响真实性但可能增加多样性)。基于这些错误,DemandClean根据错误率和模型鲁棒性智能选择修复、删除或无操作。为增强可解释性,该框架通过可视化区分真实性、多样性和容忍度。大量实验证实,DemandClean在显著降低预处理成本的同时达到近最优精度。具体而言,与“全部修复”策略相比,它将修复操作减少80.0%,删除操作减少80.7%,同时保持甚至超越其预测性能,从而为实际应用提供了一个可解释、低成本且可扩展的解决方案。

