arrow
返回

A complexity-driven resampling approach for imbalanced learning

delete2026-09-07
delete0
delete
OA
AI
M
Muhammad Asim Ali *
刘军 (Jun Liu)
S
Samuel Moore
O
Omar Nibouche
DOI:10.1016/j.asoc.2026.116355delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
不平衡数据集对机器学习(ML)模型构成重大挑战,常导致少数类偏向决策和预测性能不佳。现有重采样方法虽解决类别不平衡问题,但有时忽略数据复杂性,可能造成复杂分布下的次优性能。为解决此问题,我们提出一种基于复杂度的两阶段聚类重采样方法。对于多数类,K-Means和层次聚类根据复杂度指标识别并移除极难分类样本;对于少数类,先应用K-Means聚类,再基于各簇复杂度在簇内生成新样本。该方法的目的是平衡数据集同时保留其固有分布。通过不同阶段采用不同聚类方法,有效捕获形状和规模各异的簇,从而提升复杂数据集上的聚类性能。该方法在KEEL的27个公开数据集和Kaggle的4个数据集上,通过严格的5折交叉验证协议,使用3种流行ML模型进行评估。结果显示,该方法显著提升不平衡数据集上ML分类器的性能,相比传统基线和最新重采样技术,实现最佳平均F1-分数和召回率,以及极具竞争力的G-Mean和AUC分数。研究表明,数据集复杂性显著影响多数ML模型的性能,表明在数据集复杂时选择重采样策略需谨慎。该方法最终为具有严重类别重叠和噪声特征空间的现实场景提供了高可靠性框架,确保重采样过程中保留底层数据结构。
Keyword:
Machine learning
Data complexity
Imbalanced data
Instance-level complexity
Data balancing

期刊

Applied Soft Computing 封面图
Applied Soft Computing
IF:
6.6
论文数:
1.4W
被引数:
4.8W

机构

暂无机构信息
引用论文

引用论文

暂无论文信息