返回
Unsupervised document and template clustering using multimodal embeddings
DOI:10.1007/s10032-026-00591-9.png)
摘要
En 中文
我们研究了使用冻结的多模态编码器和经典聚类算法在类别和模板级别上对文档进行无监督聚类。我们系统化了一个模型无关的流水线,该流水线(i)将文本-布局-视觉编码器的异构最后一层状态投影到考虑标记类型的文档向量中,并(ii)使用基于质心或密度的方法进行聚类,包括HDBSCAN + k-NN分配以消除未标记点。我们在五个语料库上评估了八种编码器(仅文本、布局感知、仅视觉和视觉语言)与k-Means、DBSCAN、HDBSCAN + k-NN和BIRCH,这些语料库涵盖干净的合成发票、其严重退化的打印和扫描对应物、扫描收据以及真实的身份和证书文档。研究发现存在模态特定的失效模式以及鲁棒性与准确性的权衡,视觉特征在干净页面上几乎解决了模板发现问题,而在协变量偏移下文本占主导地位,融合编码器提供了最佳平衡。我们详细阐述了一个可复现的、无先验知识的调优协议和精选的评估设置,以指导未来关于无监督文档组织的工作。
Keyword:
Multimodal Embeddings
Unsupervised Document Clustering
Template-Level Clustering
Document Layout Analysis
Intelligent Document Processing
期刊
I
IF:
2.5
论文数:
36
被引数:
826
机构
引用论文
暂无论文信息

