返回
Two novel feature selection methods for imbalanced text classification
DOI:10.1007/s11042-026-21273-y.png)
摘要
En 中文
文本数据在类别上的分布通常是不平衡的。这种情况对文本分类过程中的分类器性能产生负面影响。在文献中,许多研究已经针对不平衡文本分类进行了探讨,并且它仍然是一个热门的研究领域。特征选择阶段,作为文本分类过程中的一个关键阶段,在不平衡文本分类问题中也是至关重要的。针对不平衡文本分类,提出了两种新的特征选择方法(EFS_IMP1和EFS_IMP2)。这些方法源自一种称为广泛特征选择器(EFS)的近期特征选择方法。EFS_IMP1和EFS_IMP2方法的性能与基于过滤的特征选择方法(包括GSS、Class-Index Corpus-Index度量、最大-最小比率、综合度量特征选择、区分性和语义特征选择、广泛特征选择器方法)进行了比较。使用了三个基准不平衡文本数据集,并采用支持向量机(SVM)、决策树(DT)、随机森林(RF)和k近邻(kNN)分类器。实验结果表明,在Enron1数据集上使用RF分类器时,EFS_IMP2获得94.441;在Spam SMS数据集上使用SVM分类器时,EFS_IMP1获得95.376;在Reuters 21578 TOP8 MM数据集上使用RF分类器时,EFS_IMP1获得99.695,这些是最高的宏观-F1分数。因此,根据宏观-F1,EFS_IMP1和EFS_IMP2在不平衡文本分类中提供了优于或相当于其他特征选择方法的性能。
Keyword:
Imbalanced text classification
Dimension reduction
Feature selection
Term selection
期刊
IF:
3
论文数:
2.0W
被引数:
3.2W
机构
引用论文
An ensemble deep learning model for author identification through multiple features基于多特征的作者识别集成深度学习模型
Scientific Reports
IF3.9

