arrow
返回

A similarity-based oversampling method for multi-label imbalanced text data

delete2025-12-03
delete0
PRE
AI
I
Ismail Hakki Karaman *
G
Gülser Köksal
L
Levent Erişkin
S
Salih Salihoglu
DOI:10.1007/s41060-025-00966-xdelete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
在实际应用中,随着数据可用性的增加,由于数据标注所需的高成本和密集工作量,为机器学习(ML)项目获取标注数据仍然具有挑战性。许多机器学习项目,尤其是专注于多标签分类的项目,也面临着数据不平衡问题,其中某些类别可能缺乏足够的数据来训练有效的分类器。本研究介绍并考察了一种新颖的多标签文本分类过采样方法,旨在解决与数据不平衡相关的性能挑战。所提出的方法通过利用实例间的相似度度量,从无标签数据中识别潜在的新样本。通过迭代搜索无标签数据集,该方法定位与少数类相似的实例,并评估其对分类器性能提升的贡献。表现出性能改进的实例随后被添加到标注数据集中。实验结果表明,所提出的方法在过采样后有效提升了分类器的性能。
Keyword:
Oversampling
Text classification
Multi-label classification
Imbalanced classification
Text similarity

期刊

I
International Journal of Data Science and Analytics
IF:
2.8
论文数:
1.1K
被引数:
1.3K

机构

D
department of industrial engineering
学者数:
362
论文数: 201
被引数: 0
引用论文

引用论文

GQEO: Nearest neighbor graph-based generalized quadrilateral element oversampling for class-imbalance problem
err2025-04-01
err0
PREAI
errDai, Qi; Wang, Longhui; Zhang, Jing; Ding, Weiping; Chen, Lifang
err分享
err收藏
Mining Multi-label Data
err2010-07-07
err0
PREAI
errGrigorios Tsoumakas; Ioannis Katakis; Ioannis Vlahavas
err分享
err收藏
Effective Methods for Improving Naive Bayes Text Classifiers
err2002-08-21
err0
PREAI
errSang-Bum Kim; Hae-Chang Rim; DongSuk Yook; Heui-Seok Lim
err分享
err收藏
The Creation and Analysis of a Website Privacy Policy Corpus
err2016-01-01
err0
errOAAI
errShomir Wilson; Florian Schaub; Aswarth Abhilash Dara; Frederick Liu; Sushain Cherivirala; Pedro Giovanni Leon; Mads Schaarup Andersen; Sebastian Zimmeck; Kanthashree Mysore Sathyendra; N. Cameron Russell; Thomas B. Norton; Eduard Hovy; Joel Reidenberg; Norman Sadeh
err分享
err收藏
err分享
err收藏
err分享
err收藏
学者 查看更多内容