返回
Nested Gaussian mixture model: clustering data from generalized mixture distributions
DOI:10.1007/s41060-025-00912-x.png)
摘要
En 中文
层次聚类和Gaussian mixture model是两种重要的聚类分析方法。作为一种生成模型,一个训练良好的Gaussian mixture model能够自然地表征由高斯簇组成的数据分布,从而具备处理增量数据的能力。然而,Gaussian mixture model的有效性依赖于数据分布与模型假设之间的一致性。也就是说,由于GMM无法对非高斯混合分布的数据进行建模,因此用户需要具备关于数据集先验分布的特定知识才能判断Gaussian mixture model是否适用。相比之下,agglomerative nesting是一种非参数的层次聚类算法,不需要先验知识。在实际应用中,agglomerative nesting的性能在不同相似度度量下波动剧烈,并且随着样本量的增长需要大量额外的计算资源。本文提出了一种任意混合模型来表征来自未知混合分布的数据。在缺乏关于簇先验分布的信息时,我们利用嵌套混合模型来近似未知混合分布。这是通过分解未知分布的簇并使用数量相等的Gaussian mixtures进行重塑来实现的。具体而言,我们使用带有不完全协方差的EM算法和压缩相似度矩阵上的SingleLink聚合来实现该方法的两个连续步骤。实验结果表明,与Gaussian mixture model和agglomerative nesting相比,我们的方法在运行时间和性能上均表现出明显优势,在标准评估指标上聚类准确率提高了12%至25%,并将聚类数量误差降低至12,而竞争的基于Gaussian mixture的方法分别为70和151。
Keyword:
Hierarchical clustering
Generative model
Agglomerative nesting
Gaussian mixture model
EM algorithm
Data Mining and Knowledge Discovery
Database Management
Artificial Intelligence
Computational Biology/Bioinformatics
Business Information Systems
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
I
IF:
2.8
论文数:
1.1K
被引数:
1.3K
机构
引用论文
Ward’s Hierarchical Agglomerative Clustering Method: Which Algorithms Implement Ward’s Criterion?Ward的层次凝聚聚类方法: 哪些算法实现了Ward的标准?

