返回
Dynamic self-paced undersampling ensemble for imbalanced classification
DOI:10.1007/s11227-025-07633-9.png)
摘要
En 中文
大规模不平衡数据的分类是机器学习中的一个具有挑战性的任务。基于欠采样的集成方法被认为是解决这一任务的最有效方法之一。然而,大多数现有的欠采样集成方法容易受到不恰当欠采样策略的影响,这可能导致多数类中有用信息的丢失,从而影响模型的泛化能力。为了解决这一问题,本文提出了一种新颖的动态自定步调欠采样集成(DSUE)方法。该方法首先实施自适应自定步调欠采样,根据样本的难度分布选择最具信息量的多数类样本,为每个基分类器创建平衡的数据子集。其次,采用样本加权策略来识别类别重叠区域中的关键样本,从而提高模型的预测性能并减少噪声数据的影响。最后,引入了一种基于基分类器在原始数据集上的Gmean得分的加权集成策略,在最终决策过程中为在原始数据集上表现更好的基分类器分配更高的权重。我们在30个小规模数据集和5个大规模数据集上进行了对比实验,将我们的方法与9种相关方法进行比较。实验结果表明,所提出的DSUE方法在F1、Gmean和AUC等评估指标上显著优于比较方法,特别是在大规模不平衡数据集上,显示出其卓越的有效性和竞争力。
Keyword:
Imbalanced classification
Ensemble methods
Undersampling
Sample difficulty
Weighting strategy
期刊
IF:
2.7
论文数:
1.1K
被引数:
1.0W
机构
引用论文
A study of the behavior of several methods for balancing machine learning training data平衡机器学习训练数据的几种方法的行为研究
A survey on imbalanced learning: latest research, applications and future directions不平衡学习: 最新研究、应用与未来方向

