返回
A Structural Topic and Sentiment-Discourse Model for Text Analysis
DOI:10.1287/mnsc.2022.00261.png)
摘要
En 中文
我们考虑一个常见的场景,其中观察大量有观点的文本文档及相关协变量,例如在线评论的文本、评论日期以及作者的人口统计信息。在此场景下,理解协变量如何决定文本构成,以及不同讨论主题的普遍性、情感和/或话语,可能具有重要意义。然而,机器学习文献中的大多数主题建模方法旨在为探索性分析总结文本,而非执行此类正式统计推断。此外,主题建模方法通常不尝试估计各独立主题的讨论情感或话语,而这对商业应用(例如总结服务或产品质量)可能至关重要。我们开发了一种名为“结构主题与情感-话语”(structural topic and sentiment-discourse, STS)的主题模型,该模型引入了一个新的文档级潜在变量,用于捕捉每个主题的情感和/或话语(统称为“情感-话语”),并调节主题内的词频。这些潜在主题的情感-话语变量受文档级协变量控制,以实现实验控制和回归分析。我们还引入了新的计算方法,以解决以往模型因可扩展性问题而被迫限制分类协变量数量的情况。我们在来自调查、博客和Yelp餐饮评论(围绕COVID-19大流行)的三个真实数据集上对STS模型进行了基准测试。我们的模型获得了有意义的成果,包括关于COVID-19如何影响在线评论的丰富见解,表明STS模型不仅能用于传统的描述性分析,还能用于文本数据的回归分析。
Keyword:
topic prevalence
topic sentiment
topic discourse
text analysis
Laplace approximation
Poisson regression
nonnegative matrix factorization
machine learning
期刊
IF:
4.9
论文数:
794
被引数:
5.0W
机构
暂无机构信息

