返回
Sub-document neural topic model
DOI:10.1016/j.knosys.2025.114762.png)
摘要
En 中文
神经网络主题模型(NTMs)通常分为两类:基于变分自编码器(VAE)和基于聚类的框架。尽管近期进展提高了主题质量和文档-主题关联性,但仍然存在重大挑战。许多当前最先进的模型通过利用外部上下文信息(如图结构和预训练语言模型(PLMs))来提升性能,这反过来又需要额外的资源和辅助组件。在本文中,我们提出了一种名为子文档神经网络主题模型(SubNTM)的新型框架,该框架通过将文档划分为子文档并在全文档和子文档两个层面上学习主题分布来增强主题建模。这种方法丰富了上下文理解并提高了主题连贯性。此外,双重推理机制有效提升了文档-主题分布的质量和粒度。在广泛使用的基准数据集上的实验评估表明,SubNTM在多个评估指标上始终优于当前最先进的话题建模方法。

