arrow
返回

Nested Gaussian mixture model: clustering data from generalized mixture distributions

delete2025-12-02
delete0
delete
OA
AI
F
Fei Wang *
L
L. K. Li
P
Pasi Fränti
DOI:10.1007/s41060-025-00912-xdelete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
层次聚类和Gaussian mixture model是两种重要的聚类分析方法。作为一种生成模型,一个训练良好的Gaussian mixture model能够自然地表征由高斯簇组成的数据分布,从而具备处理增量数据的能力。然而,Gaussian mixture model的有效性依赖于数据分布与模型假设之间的一致性。也就是说,由于GMM无法对非高斯混合分布的数据进行建模,因此用户需要具备关于数据集先验分布的特定知识才能判断Gaussian mixture model是否适用。相比之下,agglomerative nesting是一种非参数的层次聚类算法,不需要先验知识。在实际应用中,agglomerative nesting的性能在不同相似度度量下波动剧烈,并且随着样本量的增长需要大量额外的计算资源。本文提出了一种任意混合模型来表征来自未知混合分布的数据。在缺乏关于簇先验分布的信息时,我们利用嵌套混合模型来近似未知混合分布。这是通过分解未知分布的簇并使用数量相等的Gaussian mixtures进行重塑来实现的。具体而言,我们使用带有不完全协方差的EM算法和压缩相似度矩阵上的SingleLink聚合来实现该方法的两个连续步骤。实验结果表明,与Gaussian mixture model和agglomerative nesting相比,我们的方法在运行时间和性能上均表现出明显优势,在标准评估指标上聚类准确率提高了12%至25%,并将聚类数量误差降低至12,而竞争的基于Gaussian mixture的方法分别为70和151。
Keyword:
Hierarchical clustering
Generative model
Agglomerative nesting
Gaussian mixture model
EM algorithm
Data Mining and Knowledge Discovery
Database Management
Artificial Intelligence
Computational Biology/Bioinformatics
Business Information Systems
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

I
International Journal of Data Science and Analytics
IF:
2.8
论文数:
1.1K
被引数:
1.3K

机构

S
School of Computing
学者数:
478
论文数: 300
被引数: 2
引用论文

引用论文

Clustering by fast search and find of density peaks
err2014-06-27
err0
PREAI
errAlex Rodriguez; Alessandro Laio
err分享
err收藏
Variational inference for Dirichlet process mixtures
err2006-03-01
err0
errOAAI
errDavid M. Blei; Michael I. Jordan
err分享
err收藏
Comparing partitions
err1985-12-01
err0
PREAI
errLawrence Hubert; Phipps Arabie
err分享
err收藏
学者 查看更多内容