返回
Sequence-based undersampling: an algorithm for managing imbalanced datasets
DOI:10.7717/peerj-cs.3078.png)
摘要
En 中文
数据不平衡在机器学习(ML)中构成重大挑战,往往导致对统计特性不敏感的模型出现灾难性失败。在基于神经网络的(NN)回归中,不平衡尤为棘手,因为可能对极端但重要的值造成欠采样。传统的分类方法对不平衡数据集效果不佳,且无法捕捉问题的结构。本文提出了一种处理一般回归中不平衡数据的新方法。该新的预处理技术称为基于序列的欠采样(Sequence-Based Undersampling),利用数据的时空结构有选择地移除过代表实例。该方法使用定量降水估计(QPE)进行测试,这是地球物理学中不平衡分布的典型实例。该技术与现有方法相比,在模型性能上显示出一致的改进。结果表明,具有序列感知的欠采样可提升回归模型和机器学习算法的性能,为数据驱动研究中的普遍问题提供了一种实用解决方案。该方法可增强当前的卫星降水算法,因为卫星观测通常呈尖峰分布,表现为少数高降水率、大量低降水率及众多无降水情况——这是通过雷达和辐射计测量序列构建的不平衡数据集的典型范例。
Keyword:
Imbalance
ML
IA
Regression
Earth sciences
Undersampling
期刊
IF:
2.5
论文数:
3.4K
被引数:
6.9K

