返回
DIR-SMOTE: a density-influence resampling framework for imbalanced code smell detection
DOI:10.1007/s10515-026-00624-x.png)
摘要
En 中文
代码异味检测对于确保软件质量至关重要,但异味代码实例与非异味代码实例之间的不平衡会损害检测效果,尤其是对于少数异味(如数据类和特性嫉妒)。现有的过采样技术,如合成少数类过采样技术(SMOTE)、边界SMOTE(BL-SMOTE)和自适应合成(ADASYN),试图缓解这一问题,但通常会引入噪声或语义无关的样本。本研究提出了DIR-SMOTE(基于SMOTE的密度和影响力重采样),一种基于密度和解释的引导重采样框架,该框架整合了局部密度估计和基于SHapley加性解释(SHAP)的特征重要性,以提高少数类合成样本的质量。首先,DIR-SMOTE利用密度指标过滤掉噪声或孤立的少数类实例。然后,它使用SHAP识别每个实例的最具影响力的特征。合成样本通过在密集邻居之间插值生成,同时仅扰动排名靠前的SHAP特征,从而保持语义完整性。DIR-SMOTE在五个基准数据集(即Apache、jEdit、EDTForCSD、DesigniteJava和MLCQ)上进行了评估,涵盖了长方法、特性嫉妒和数据类等多种异味。与九种标准重采样方法相比,DIR-SMOTE在F1分数上最高提升6.7%,在精确率上提升5.1%,持续提升异味代码检测在二分类和多分类设置中的效果。DIR-SMOTE不依赖复杂的生成模型,而是专注于基于解释和密度感知的样本生成,保持透明性和计算效率。总体而言,它提供了一种轻量且鲁棒的解决方案,可以无缝集成到实际的质量保证工作流中,包括自动异味检测工具和基于IDE的分析器。
Keyword:
Code smell detection
Imbalanced data
Explainable artificial intelligence
Software quality assurance
期刊
A
IF:
3.1
论文数:
81
被引数:
0

