arrow
返回

Doctopus: Budget-aware Structural Table Extraction from Unstructured Documents

delete2025-07-01
delete0
PRE
AI
柴成亮 封面图
柴成亮 (Chengliang Chai) *
J
Jiajun Li
Y
Yuhao Deng
Z
Zhong, Yuanhao
袁
袁野 (Ye Yuan)
G
Guoren Wang
L
Lei Cao
DOI:10.14778/3749646.3749647delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
为了实现非结构化文档的潜在巨大价值,关键在于从中提取结构化数据(例如属性),这可应用于分析型SQL查询和决策制定等多样化场景。针对此任务,可采用多种策略,如预训练语言模型(PLMs)。然而,这些方法在处理需要复杂推理或语义理解的属性提取时,往往难以获得高质量结果。近期研究表明,大型语言模型(LLMs)在属性提取方面效果显著,但其高昂的代币消耗成本使其难以应用于大规模文档集。为在质量和成本间实现最佳平衡,我们提出Doctopus系统,旨在满足用户指定成本约束下的非结构化文档精确属性提取。总体而言,Doctopus通过结合LLM与非LLM策略实现良好平衡:首先,系统采用基于索引的方法高效识别并处理相关文本片段,从而降低LLM成本;其次,进一步评估各属性的多策略质量;最后,基于成本与预估质量,通过预算感知优化动态选择最优策略。我们构建了一个包含4个特征各异的文档集的全面基准,并投入1000人工小时完成人工标注的基准真值。在基准上的广泛实验表明,与当前最优基线相比,在相同成本约束下,Doctopus可将提取质量提升11%。

期刊

P
Proceedings of the VLDB Endowment
IF:
3.3
论文数:
563
被引数:
1.2W

机构

B
Beijing Institute of Technology
学者数:
5.2K
论文数: 2.1K
被引数: 6.0W
U
University of Arizona
学者数:
3.6W
论文数: 3.2W
被引数: 980
引用论文

引用论文

err
IF0
err
err0
PREAI
err
err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
学者 查看更多内容