返回
DocDB: A Database for Unstructured Document Analysis
DOI:10.14778/3750601.3750678.png)
摘要
En 中文
近期研究已开发出基于LLM的数据系统,能够实现对非结构化文本文档的数据库式分析。尽管LLM在文档属性提取方面表现出色,但其高昂的计算成本和延迟使得提取操作成为主要的性能瓶颈。现有系统通常采用传统的关系数据库查询优化策略,但这些策略在减少LLM相关开销方面被证明效果不佳。为填补这一空白,我们提出了DocDB原型系统,该系统采用一系列针对非结构化文档分析的新型优化策略。首先,我们采用两级索引,通过选择性检索和处理仅与目标属性相关的文本片段来降低LLM提取成本。其次,DocDB采用自适应执行机制,根据各文档属性提取成本的变化生成文档特定的执行计划,以最小化LLM提取频率。通过真实场景的验证,我们展示了DocDB能够使用户通过类SQL查询准确且经济地分析非结构化文档。相关视频可在https://youtu.be/8yDIKOBHIOg获取。
期刊
P
IF:
3.3
论文数:
563
被引数:
1.2W
机构
引用论文
暂无论文信息

