返回
A similarity-based oversampling method for multi-label imbalanced text data
DOI:10.1007/s41060-025-00966-x.png)
摘要
En 中文
在实际应用中,随着数据可用性的增加,由于数据标注所需的高成本和密集工作量,为机器学习(ML)项目获取标注数据仍然具有挑战性。许多机器学习项目,尤其是专注于多标签分类的项目,也面临着数据不平衡问题,其中某些类别可能缺乏足够的数据来训练有效的分类器。本研究介绍并考察了一种新颖的多标签文本分类过采样方法,旨在解决与数据不平衡相关的性能挑战。所提出的方法通过利用实例间的相似度度量,从无标签数据中识别潜在的新样本。通过迭代搜索无标签数据集,该方法定位与少数类相似的实例,并评估其对分类器性能提升的贡献。表现出性能改进的实例随后被添加到标注数据集中。实验结果表明,所提出的方法在过采样后有效提升了分类器的性能。
Keyword:
Oversampling
Text classification
Multi-label classification
Imbalanced classification
Text similarity
期刊
I
IF:
2.8
论文数:
1.1K
被引数:
1.3K
机构
引用论文
SMOTE for Learning from Imbalanced Data: Progress and Challenges, Marking the 15-year Anniversary《从不平衡数据中学习: 进步与挑战,纪念15周年》
GQEO: Nearest neighbor graph-based generalized quadrilateral element oversampling for class-imbalance problem
NEURAL NETWORKS
IF6.3

