返回
A novel convex-hull-based algorithm for classification problems with imbalanced and overlapping data
DOI:10.1016/j.eswa.2025.129691.png)
摘要
En 中文
分类是监督式机器学习中的基本任务。当处理不平衡和重叠数据集时,这一问题变得具有挑战性。在这种情况下,学习算法通常在识别多数类数据点的标签方面表现良好,但在预测少数类时表现出高错误率。本文提出了一种基于凸包概念的创新方法,旨在增强对不平衡和重叠数据集的分类效果。与可能导致有价值信息丢失的欠采样方法不同,我们的方法专注于保留数据。该过程首先分别对每类数据点进行聚类,使得没有来自对立类的点落在每个聚类的凸包内。然后,使用支持向量机(SVM)将给定类的每个聚类与对立类的数据点分离。随后,位于SVM边界内的数据点被视为非重叠数据,而位于SVM边界外的数据点被识别为重叠数据。接着,采用XGBoost算法对重叠区域内的数据点进行分类。在多种模拟和真实数据集上的广泛实验证实,与现有用于处理不平衡和重叠数据集的相关算法相比,所提出的方法在各项评估指标上均显示出有效性。

