返回
Adaptive Graph K-Means
DOI:10.1016/j.patcog.2024.111226.png)
摘要
En 中文
大规模数据集的聚类近年来受到了越来越多的关注。然而,现有的算法在簇数量极多的场景下仍缺乏效率。为此,本研究提出了自适应图K-均值(AGKM)算法。其思想源自k-均值,但作用于自适应k近邻(k-NN)图而非数据特征。首先,AGKM在处理样本数和簇数均极大的数据集时效率极高。具体而言,其时间和空间复杂度均与样本数量呈线性关系,且更重要的是,与簇数量无关。其次,AGKM专为平衡簇设计。这一约束通过在损失函数中添加正则项以及在优化算法中对图进行简单修改实现,且不会增加计算负担。最后,指示矩阵和相异度矩阵被同时学习,使得所提出的AGKM能够直接以更高的效能和效率获得最终划分。在多个数据集上的实验验证了AGKM的优势。具体而言,在WebFace和CelebA两个大规模数据集上,其相较于k-均值分别实现了超过29倍和46倍的速度提升。
Keyword:
Machine learning
Clustering
Graph-based
k-means
Computational efficiency
期刊
IF:
7.6
论文数:
1.3W
被引数:
4.5W
机构
暂无机构信息

