arrow
返回

Parallel architectures for large-scale document processing: Integrating OCR and RAG pipelines

delete2026-08-01
delete0
PRE
AI
J
Jaime, Alejandro *
V
Verónica Gil-Costa
M
Marcelo Luis Errecalde
L
Leticia Cagnina
DOI:10.1016/j.jpdc.2026.105337delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
本文将大规模OCR处理作为并行系统设计问题进行研究,并表明通过开源OCR组件可在单台高端工作站上实现高吞吐量文档处理,从而减少对按页计费的云OCR服务的依赖。我们提出了三种用于大规模PDF文档处理的并行架构:(1) 基于Ray的分布式流水线,集成RAG能力,实现24.3倍加速比且具备容错性;(2) 使用ProcessPoolExecutor的本地多进程架构,实现69.9倍加速比,将11,368页的文档处理时间从5小时缩短至4.3分钟;(3) 结合Ray编排与优化本地工作进程的混合设计,其多GPU扩展为分析预测(估计三GPU可达199倍加速比,处理时间约1.5分钟)。使用Intel Core i9处理器搭配双RTX 4090 GPU的银行文档实验显示,CPU+GPU配置下的效率值超过100%(当效率分母中排除GPU时最高达1,531%)。与商业参考(Azure Document Intelligence)的质量评估表明,开源OCR流水线(PaddleOCR + 模糊重建)的字符错误率为24.78%,量化了100 DPI与300 DPI处理之间的速度-质量权衡。对比检索评估表明,该字符级降级在测试设置中并未影响语义检索。这些结果表明,组织可通过开源方案降低高吞吐量工作负载的每页云OCR成本及供应商依赖,且质量足以满足语义检索和RAG任务需求。对于精度关键型应用(法律、医疗、档案),300 DPI架构可保持完整保真度,而100 DPI选项则适用于高容量批处理场景,其中语义检索质量优先于字符级精度。
Keyword:
OCR
Ray orchestration
Parallel architectures
Distributed computing
RAG pipelines
High-performance computing

期刊

Journal of Parallel and Distributed Computing 封面图
Journal of Parallel and Distributed Computing
IF:
4
论文数:
3.8K
被引数:
4.8K

机构

N
national university of la plata
学者数:
62
论文数: 30
被引数: 0
U
universidad nacional de san luis
学者数:
33
论文数: 11
被引数: 0
引用论文

引用论文

暂无论文信息