返回
Clustering methods for high-dimensional data
DOI:10.5351/KJAS.2025.38.5.693.png)
摘要
En 中文
高维数据以其包含成千上万个特征的特征观测而著称,在基因表达数据分析、图像处理和自然语言处理等领域普遍存在。尽管提供了丰富的信息,但由于维度灾难、相似度度量退化和可解释性缺乏,这类数据给聚类带来了重大挑战。为此,目前已开发出多种方法,包括子空间聚类、降维、基于模型的方法和特征选择等。较新的进展将正则化技术和基于引导程序的聚类数量估计方法纳入其中。本文对针对高维数据的当代聚类方法进行了全面概述,批判性地评估了它们的优点、缺点和适用性。此外,它还概述了旨在开发高效、鲁棒、可扩展且可解释的聚类算法的有前景的研究方向。
Keyword:
cluster analysis
dimension reduction
feature selection
high-dimensional data
model-based clustering
subspace clustering

