返回
A Fast Grid-Block-Based Density Peak Clustering Algorithm
DOI:10.1016/j.neucom.2026.133822.png)
摘要
En 中文
密度峰值聚类(DPC)算法因其简单性和有效性近年来受到越来越多的关注。然而,它仍然存在一些缺点。例如,高计算复杂度使其难以处理大规模数据集。此外,局部密度需要依赖于截断距离参数,这影响了聚类性能。为解决这些挑战,我们提出了一种基于网格块的快速密度峰值聚类算法,称为FastGB-DPC。它首先引入网格聚类的思想,将数据集生成的网格空间划分为若干网格单元。然后,进一步设计了一种多级扩散邻域搜索策略,在网格单元上生成网格块,网格块是局部一致且高度相似的网格单元的集合。最后,通过将网格块视为基本聚类单元而非原始数据样本进行密度峰值聚类,这大大减少了数据规模并显著缩短了运行时间。此外,它进一步设计了一种新颖的双密度函数,使聚类结果独立于截断距离。在合成和真实数据集上的广泛实验表明,FastGB-DPC不仅实现了与当前最优算法相当甚至更好的有效性,而且运行时间显著减少。同时,统计测试结果也表明算法之间存在显著差异。总体而言,所提出的算法具有更好的聚类效果。
Keyword:
Density peak clustering
Grid-Block
Computational complexity
Local density
Clustering algorithm

