arrow
返回

Optimizing the Undersampling Technique by Feature Weighting for Software Defect Prediction

delete2026-03-05
delete0
PRE
AI
Z
Zhao, Xiaowei
S
S. Wang *
Q
Qiu, Shaojian
S
Suo, Siliang
L
Lu Lu
DOI:10.1007/s44196-026-01174-6delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
类别不平衡问题显著阻碍了软件缺陷预测模型区分缺陷(少数类)软件实例与非缺陷(多数类)实例的能力。传统缺陷预测模型的欠采样技术存在丢弃多数类样本导致信息损失以及数据分布改变引发模型偏差等缺点。近期,研究人员试图通过引入加权实例特征的技术来解决不平衡问题。利用这些加权特征,样本可根据其相关性进行排序,从而移除对预测任务不那么关键的样本。然而,当前的特征加权方法往往侧重于单个特征的重要性,忽视了高特征和样本的整体贡献,这些样本可能携带分类任务的关键信息,且存在被不成比例移除的风险,进而导致性能下降。这一局限性反映了一种以特征为中心的视角,将特征重要性视为独立因素,而忽略了实例对预测任务的集体贡献。为应对这一挑战,本文提出了一种学习排序特征加权(LTRFW)框架,该框架通过将学习排序模型与差分进化(DE)算法相结合,用于特征权重优化,将关注点从单个特征转向实例。差分进化算法通过结合网格搜索和皮尔逊相关分析对多数类实例进行排序并执行选择性欠采样,使模型在保留信息样本的同时有效缓解类别不平衡。在四个分类器和21个数据集上的实验结果表明,LTRFW在平均性能上持续优于现有的欠采样方法,与LSTRUS和COSTE等最先进基线相比,F1分数提升了14.8%,AUC提升了21.9%。尽管平均Cliff's delta约为0.12,表明效应量较小,但其p < 0.05的持续统计显著性表明LTRFW取得的改进是稳健、可复现且具有实际意义的。
Keyword:
Software defect prediction
Class imbalance
Learning-to-rank
Undersampling
Data resampling
Feature selection

期刊

International Journal of Computational Intelligence Systems 封面图
International Journal of Computational Intelligence Systems
IF:
3
论文数:
362
被引数:
2.7K

机构

P
Peng Cheng Laboratory
学者数:
1.7K
论文数: 1.8K
被引数: 2.0K
S
South China Agricultural University
学者数:
3.1W
论文数: 1.5W
被引数: 2.6W
S
south china university of technology
学者数:
6.8W
论文数: 5.1W
被引数: 85
学者 查看更多机构
引用论文

引用论文

暂无论文信息