返回
ClusterSwarm: cluster-specific feature selection using binary particle swarm optimisation
DOI:10.1007/s00607-025-01534-8.png)
摘要
En 中文
特征选择已成为机器学习流程中的一个重要步骤,有助于提升模型的解释性和准确性。尽管研究重点很大程度上集中在全局特征选择技术,但这些方法无法支持将特征归属到数据集中不同的组,因为它们假设单个特征集足以正确执行分类任务。此外,与无监督学习不同,特征选择技术(无论是全局还是局部)在监督学习中已得到充分发展。基于上述原因,本文提出ClusterSwarm,一种基于聚类的特征选择新方法,结合二元粒子群优化(BPSO)和K-means算法,以识别特定于聚类的特征集。使用UCI仓库中的四个公开可用数据集进行评估,ClusterSwarm表现出优于标准K-means算法和凝聚层次聚类的性能,且与全局特征选择技术稀疏K-means性能相当。然而,在处理高维、多类和噪声环境时,ClusterSwarm优于稀疏K-means,同时通过将特征归属到每个聚类来提供可解释性。与稀疏K-means的聚类特定变体CS Sparse K-means相比,ClusterSwarm实现了更高的准确率和更高效的特征选择,避免了冗余特征,而CS Sparse K-means则没有做到这一点。除四个公开数据集外,我们还针对两个精心设计的合成数据集进行了实验,以代表噪声特征和重叠聚类的情形。这些数据集用于证明ClusterSwarm相对于稀疏K-means、CS Sparse K-means以及标准聚类技术的优越性。
Keyword:
Unsupervised learning
Feature selection
K-means
Particle swarm optimisation
Interpretability
Clustering
期刊
C
IF:
2.8
论文数:
2.3K
被引数:
3.5K

