返回
Distributed K-Means algorithm based on a Spark optimization sample
DOI:10.1371/journal.pone.0308993.png)
摘要
En 中文
为解决经典K-Means算法在处理大规模数据集时的不稳定性和性能问题,我们提出了一种基于Spark优化的改进K-Means算法SOSK-Means。SOSK-Means引入了多项关键改进以增强聚类过程。首先,引入了一种加权跳跃银行方法,以实现高效随机采样和预聚类。通过整合权重和跳跃指针,该方法提高了初始中心的质量,并降低了对初始中心选择的敏感性。其次,我们利用加权最大最小距离与方差来计算距离,同时考虑权重和方差信息。这使SOSK-Means能够识别更分散且更密集的聚类,提升聚类精度。最佳初始中心的选择采用均方误差准则,这确保初始中心能更好地代表数据集的分布和结构,从而改善聚类性能。在迭代过程中,采用了一种新颖的距离比较方法以减少计算时间,优化算法的整体效率。此外,SOSK-Means整合了有向无环图(DAG),通过分布式策略优化性能,并利用Spark框架的功能。实验结果表明,SOSK-Means在显著提升计算速度的同时保持了较高的计算精度。
期刊
IF:
2.6
论文数:
2.6W
被引数:
81.6W
机构
暂无机构信息
引用论文
K‐Plus anticlustering: An improved k‐means criterion for maximizing between‐group similarityK‐Plus抗聚类:一种改进的k‐means标准,用于最大化组间相似性

