返回
Accelerating Spherical K-Means Clustering for Large-Scale Sparse Document Data
DOI:10.1109/TKDE.2025.3608264.png)
摘要
En 中文
本文提出了一种针对大规模、高维稀疏文档数据集的加速球面K均值聚类算法。我们设计了一种在架构友好方式(AFM)下工作的算法,这是一种抑制计算机系统中CPU性能下降因素(如指令数量、分支误预测和缓存未命中)的方法。对于AFM操作,我们利用了数据普遍特性(UCs),即数据关系上的偏斜分布。UCs表明,相似度计算中大部分乘法操作是在高文档频率项上执行的,且相似度的大部分值来自于涉及少数高均值特征的乘法。为了提取上述特定区域的项和均值特征,我们构建了一个按两个结构参数分为三个区域的均值反向索引分区。我们的算法通过基于高效剪枝方法最小化与指令对应的乘法近似数量来优化参数,通过将索引结构与所有对象共享来减少条件分支,并保持上述特定区域中频繁使用的数据在缓存中。实验结果表明,与采用当前最先进技术的算法相比,我们的算法在大型文档数据集上高效地实现了更优的速度性能。
Keyword:
Algorithm
spherical k-means clustering
large-scale high-dimensional sparse data
data characteristics
data structure
inverted index
computer architecture
期刊
IF:
10.4
论文数:
6.8K
被引数:
3.2W

