返回
Multi-view self-supervised learning for label-flipping robustness in tabular data: a comparative study
DOI:10.1007/s10489-026-07452-2.png)
摘要
En 中文
表格机器学习模型广泛应用于金融、医疗和网络入侵检测等高风险领域,其可靠性高度依赖于准确的训练标签。然而,恶意或意外的标签翻转会破坏训练数据并降低下游模型性能。近期攻击进一步针对决策边界或脆弱局部区域,而非随机翻转标签。本文提出了一种基于BYOL的多视图KNN净化方法,用于识别表格数据中可疑的标签翻转样本。该方法学习标签无关的表示,并检查原始和扰动SSL嵌入视图中的KNN标签分歧模式。我们在六个跨领域表格基准上评估了该方法,在大型和小型标签翻转攻击下,并与现有的净化基线和基于SCARF的表示基线进行了比较。结果表明,多视图邻域探测提高了可疑标签检测效果,并提供了一种实用的F1导向权衡,而下游恢复仍取决于攻击和目标模型。这些发现为提高表格机器学习系统在标签翻转攻击下的鲁棒性和标签完整性提供了可操作的见解。
Keyword:
Label flipping attack
Data poisoning
Self-supervised learning
Data sanitization
Tabular learning
期刊
IF:
3.5
论文数:
7.6K
被引数:
1.7W
机构
引用论文
Statistical and machine learning models in credit scoring: A systematic literature survey信用评分中的统计和机器学习模型: 系统的文献综述
Imbalanced classification with label noise: A systematic review and comparative analysis类别不平衡与标签噪声下的分类:系统综述与比较分析
ICT Express
IF4.2
没有更多内容

