返回
Doctopus: Budget-aware Structural Table Extraction from Unstructured Documents
DOI:10.14778/3749646.3749647.png)
摘要
En 中文
为了实现非结构化文档的潜在巨大价值,关键在于从中提取结构化数据(例如属性),这可应用于分析型SQL查询和决策制定等多样化场景。针对此任务,可采用多种策略,如预训练语言模型(PLMs)。然而,这些方法在处理需要复杂推理或语义理解的属性提取时,往往难以获得高质量结果。近期研究表明,大型语言模型(LLMs)在属性提取方面效果显著,但其高昂的代币消耗成本使其难以应用于大规模文档集。为在质量和成本间实现最佳平衡,我们提出Doctopus系统,旨在满足用户指定成本约束下的非结构化文档精确属性提取。总体而言,Doctopus通过结合LLM与非LLM策略实现良好平衡:首先,系统采用基于索引的方法高效识别并处理相关文本片段,从而降低LLM成本;其次,进一步评估各属性的多策略质量;最后,基于成本与预估质量,通过预算感知优化动态选择最优策略。我们构建了一个包含4个特征各异的文档集的全面基准,并投入1000人工小时完成人工标注的基准真值。在基准上的广泛实验表明,与当前最优基线相比,在相同成本约束下,Doctopus可将提取质量提升11%。
期刊
P
IF:
3.3
论文数:
563
被引数:
1.2W
机构
引用论文
Chen, L., Zaharia, M., and Zou, J. (2023b). Frugalgpt: How to use large language models while reducing cost and improving performance. doi: 10.48550/arXiv.2305.05176陈, L., Zaharia, M., 和 Zou, J. (2023b). Frugalgpt: 如何在降低成本的同时使用大型语言模型并提高性能。doi: 10.48550/arXiv.2305.05176
Language Models Enable Simple Systems for Generating Structured Views of Heterogeneous Data Lakes语言模型实现了生成异构数据湖结构化视图的简单系统

