arrow
返回

Zero-Inflated Text Data Analysis Using Imbalanced Data Sampling and Statistical Models

delete2025-12-02
delete0
delete
OA
AI
S
Sunghae Jun
DOI:10.3390/computers14120527delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
文本数据通常表现出高稀疏性和零膨胀现象,其中文档-关键词矩阵中很大比例的条目为零。这一特性给传统的计数模型带来了挑战,这些模型在存在过多零值和过度离散的情况下,可能会出现预测准确性和可解释性下降的问题。为解决此问题,我们提出了一种有效的分析框架,该框架通过欠采样整合不平衡数据处理与经典概率计数模型。具体而言,我们应用泊松广义线性模型、零膨胀泊松模型和零膨胀负二项模型来分析零膨胀文本数据,同时保留词级计数的统计可解释性。该框架使用真实专利文档和模拟数据集进行评估。实证结果表明,基于欠采样的方法在不修改下游模型的情况下改善了模型拟合度。本研究为提升零膨胀文本分析贡献了一种实用的预处理策略,并就稀疏计数数据下的模型选择和数据平衡技术提供了见解。
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

C
Computers
IF:
4.2
论文数:
1.4K
被引数:
3.3K

机构

暂无机构信息
引用论文

引用论文

synthpop: Bespoke Creation of Synthetic Data in R
err2016-01-01
err224
errOAAI
errNowok, Beata; Raab, Gillian M.; Dibben, Chris
err分享
err收藏
err分享
err收藏
A systematic approach for learning imbalanced data: enhancing zero-inflated models through boosting
err2024-07-08
err0
errOAAI
errJeong, Yeasung; Lee, Kangbok; Park, Young Woong; Han, Sumin
err分享
err收藏
Digital business foresight: Keyword-based analysis and CorEx topic modeling
errFUTURES
IF3.8
err2024-01-01
err6
PREAI
errBzhalava, Levan; Kaivo-oja, Jari; Hassan, Sohaib S.
err分享
err收藏
学者 查看更多内容