返回
A new feature selection method using deep learning and graph representation in high-dimensional datasets
DOI:10.1016/j.knosys.2025.114338.png)
摘要
En 中文
近年来,数据收集和存储技术的进步导致了包含大量(通常冗余)特征的高维数据集的出现,这可能对机器学习算法产生负面影响。特征选择已作为一种关键解决方案出现,用于降低数据集维度,从而提高计算效率并减少过拟合。传统特征选择模型在有效处理高维数据方面存在局限性,并且常常忽视特征之间的复杂关系。因此,它们可能无法完全优化模型性能,并且可能容易发生过拟合。为应对这些挑战,我们提出了一种基于深度学习的创新特征选择方法,能够更好地捕捉高维数据中特征之间的复杂模式和依赖关系。该方法采用深度相似度度量与图表示,包含三个阶段。首先,利用深度相似度度量将问题建模为图;其次,通过社区检测模型对主要特征进行聚类;最后,利用节点中心性及特征适用性度量在每个聚类中选择最具影响力的特征。值得注意的是,特征选择步骤采用了基于过滤的方法,而非依赖学习算法(这是包装器模型中常见的做法)。这种设计显著降低了计算复杂度,并减少了与先前方法相比的参数需求。通过避免依赖学习算法,所提出的方法克服了高计算成本等挑战,同时提高了准确性。在多个数据集上的实验结果表明,所提出的监督模型优于当前最先进的方法,在准确率上平均提升1.5%,在精确率、召回率和F1分数上分别平均提升1.77%、1.87%和1.81%。
Keyword:
deep learning
feature selection
high-dimensional data
graph representation
community detection
期刊
K
IF:
7.6
论文数:
1.3W
被引数:
4.5W
机构
引用论文
Benchmark for filter methods for feature selection in high-dimensional classification data高维分类数据中特征选择的过滤方法基准
MGFS: A multi-label graph-based feature selection algorithm via PageRank centralityMGFS: 一种基于PageRank中心性的多标签图特征选择算法
A bi-objective hybrid optimization algorithm to reduce noise and data dimension in diabetes diagnosis using support vector machines基于支持向量机的糖尿病诊断中降低噪声和数据维数的双目标混合优化算法
Predicting Water Quality Index (WQI) by feature selection and machine learning: A case study of An Kim Hai irrigation system通过特征选择和机器学习预测水质指数 (WQI): 以金海灌溉系统为例

