返回
On-Demand Augmentation for Long-Tail Data Through Subset- and Topic-Driven Sparsity Identification Framework
DOI:10.1007/s41019-025-00334-6.png)
摘要
En 中文
大规模、多维混合数据集的特征是普遍存在的“长尾分布”。这一现象导致由多维属性组合定义的子空间中出现数据稀疏。这种稀疏性严重阻碍了数据驱动的分析与洞察。现有的数据增强方法主要关注单一维度,忽略了真实世界中复杂、内在的多维相关性,从而导致生成的样本缺乏逻辑性和真实感。为应对这一挑战,我们提出了一种系统性、按需、细粒度的样本增强框架。我们的核心思想是从多维组合的角度精确定位并增强数据稀疏区域。对于文本数据,我们设计了两种灵活的增强模式。第一种“基于子集范围的增强”,采用模型融合与增量更新的策略;第二种“基于主题的增强”,提出了基于“探索-利用”范式的启发式搜索算法。对于数值数据,我们预先构建全局分布索引,以实现稀疏区间的有效识别。在样本生成阶段,我们结合大型语言模型、检索增强生成和思维链技术,确保生成的样本在语义逻辑和语境风格上达到高保真标准。在真实数据集上的广泛实验表明,我们的方法在查询响应速度和稀疏区域发现效率上优于基线方法,同时保持了主题一致性和准确性。
Keyword:
Long-tail distribution
Topic modeling
Sparsity identification
Sample augmentation
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
D
IF:
4.6
论文数:
249
被引数:
665
机构
引用论文
暂无论文信息

