返回
A Data-Driven Framework for Class Overlap Reduction to Improve Soft Sensor Performance
DOI:10.3390/s26154826.png)
摘要
En 中文
在数据驱动的应用中,类别重叠和类别不平衡是降低机器学习性能的主要因素。尽管现有的重采样方法通常独立解决这些问题,但它们在清理后往往无法保留多数类的底层分布。本研究提出了两阶段聚类增强(Two-Phase Clustering Plus)框架,该框架独特地利用重叠检测来指导欠采样过程。与常规方法随意移除样本不同,该框架整合了编辑最近邻(Edited Nearest Neighbors)技术以隔离重叠区域,严格对多数类应用数据清理。为平衡重叠减少与信息边界样本的保留,该局部清理策略结合了两阶段聚类策略以保留安全的多数类数据。这种协同作用确保有针对性地消除模糊的多数类实例,同时避免过度信息损失,系统性地选择能维持关键边界和全局数据结构的代表性样本。在五个基于客户行为数据生成的虚拟传感环境的服务行业数据集上进行评估,实验结果表明,所提方法使几何均值提升了1.45%,并显著增强了类别可分性。通过明确关联重叠移除与策略性聚类,该方法为复杂不平衡数据集提供了稳健且分布感知的解决方案。
Keyword:
data-driven
machine learning
resampling methods
class imbalance
class overlap
service industry
期刊
IF:
3.5
论文数:
7.2W
被引数:
20.9W
机构
引用论文
A study of the behavior of several methods for balancing machine learning training data平衡机器学习训练数据的几种方法的行为研究
CTGAN-ENN: a tabular GAN-based hybrid sampling method for imbalanced and overlapped data in customer churn predictionCtgan-enn: 一种基于表格的GAN混合抽样方法,用于客户流失预测中的不平衡和重叠数据
JOURNAL OF BIG DATA
IF6.4
Market Regime Detection in Bitcoin Time Series Using K-Means Clustering and Hidden Markov Models哈里亚尼, C.A.; 钱德拉; 塔里安, R.E. 使用K-均值聚类和隐马尔可夫模型检测比特币时间序列中的市场模式。J. Digit. Mark. Digit. Curr. 2026, 3, 75–95. [Google Scholar] [CrossRef]

