返回
Zero-Inflated Text Data Analysis Using Imbalanced Data Sampling and Statistical Models
DOI:10.3390/computers14120527.png)
摘要
En 中文
文本数据通常表现出高稀疏性和零膨胀现象,其中文档-关键词矩阵中很大比例的条目为零。这一特性给传统的计数模型带来了挑战,这些模型在存在过多零值和过度离散的情况下,可能会出现预测准确性和可解释性下降的问题。为解决此问题,我们提出了一种有效的分析框架,该框架通过欠采样整合不平衡数据处理与经典概率计数模型。具体而言,我们应用泊松广义线性模型、零膨胀泊松模型和零膨胀负二项模型来分析零膨胀文本数据,同时保留词级计数的统计可解释性。该框架使用真实专利文档和模拟数据集进行评估。实证结果表明,基于欠采样的方法在不修改下游模型的情况下改善了模型拟合度。本研究为提升零膨胀文本分析贡献了一种实用的预处理策略,并就稀疏计数数据下的模型选择和数据平衡技术提供了见解。
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
C
IF:
4.2
论文数:
1.4K
被引数:
3.3K
机构
暂无机构信息
引用论文
Wanitjirattikal, P.; Shi, C. A Bayesian zero-inflated binomial regression and its application in dose-finding study. J. Biopharm. Stat. 2020, 30, 322–333. [Google Scholar] [CrossRef]Wanitjirattikal, P.; Shi, C. 一种贝叶斯零膨胀二项回归及其在剂量寻找研究中的应用。J. Biopharm. Stat. 2020, 30, 322–333. [Google Scholar] [CrossRef]
Zero-Inflated Text Data Analysis using Generative Adversarial Networks and Statistical Modeling使用生成对抗网络和统计建模进行零膨胀文本数据分析
Computers
IF0
A Bayesian approach for the zero-inflated cure model: an application in a Brazilian invasive cervical cancer database零膨胀治愈模型的贝叶斯方法:在巴西侵袭性宫颈癌数据库中的应用
A systematic approach for learning imbalanced data: enhancing zero-inflated models through boosting
MACHINE LEARNING
IF2.9

