返回
Hyperspherical Supervised Topic Models
DOI:10.1007/s10618-026-01251-6.png)
摘要
En 中文
概率主题模型是发现文本文档中隐藏语义的常规标准。然而,当应用于短文本时,现有模型效果不佳,并因词汇共现信息有限而产生不连贯和重复的主题。已有若干尝试,其中一些方法提出将监督信息整合到学习过程中,但这些模型仍无法推断出与人类判断相关联的连贯主题。为解决此问题,我们提出了一种嵌入式监督主题模型,该模型在超球面上通过类别标签指导词嵌入和潜在主题表示的编码。与现有仅关注目标预测而忽略主题可解释性的监督主题模型不同,我们的模型整合预训练词嵌入以推断可解释的主题。所得球面表示可用于预测任务,因为推断的主题能指示文档标签。为进一步增强主题的可解释性,我们提出第二个框架,将知识图谱嵌入整合到我们的概率模型中,这对于缓解数据稀疏问题至关重要。在四个基准数据集上的实验结果表明,我们提出的模型在主题可解释性方面优于现有模型,同时具备有竞争力的标签预测能力。
Keyword:
Topic models
Short text modeling
Spherical embedding
Knowledge graphs
Word embedding
期刊
IF:
4.3
论文数:
196
被引数:
6.0K

