arrow
Return

HiDReader: Human-Inspired Document Reading Agent via Reinforcement Learning

delete2026-01-01
delete0
PRE
AI
王长青 cover
王长青 (Changqing Wang)
H
Hao Wang *
P
Pinpin Zhu
张惠然 cover
张惠然 (Huiran Zhang)
DOI:10.1007/978-3-032-04614-7_14delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
Despite the remarkable progress made by large language models (LLMs) in natural language understanding, they still struggle to effectively comprehend visually-rich documents (VRDs) that demand complex semantic analysis. This paper introduces HiDReader, the first reinforcement learning-based framework designed to emulate human-like reading processes for visually-rich document comprehension. By integrating LLMs with specialized document understanding models, HiDReader leverages a self-optimizing, data-driven reading sequence mechanism that mimics human learning patterns rather than relying on traditional rule-based or fixed parsing strategies. Through iterative self-supervised learning, HiDReader dynamically adapts its reading path based on contextual cues and task-specific goals, refining its approach in a way that mirrors the adaptability of human cognition. Experimental results on two benchmark tasks demonstrate that HiDReader outperforms baseline methods in both document information extraction and question answering. Moreover, in cross-domain transfer learning scenarios, it showcases significant adaptability, autonomously extracting characteristic reading patterns from VRDs, thereby achieving superior performance in zero-shot domain adaptation tasks compared to conventional approaches.
Keywords:
Agent
Reinforcement learning
Visually rich documents

Journal

D
DOCUMENT ANALYSIS AND RECOGNITION-ICDAR 2025, PT I
IF:
0
Papers:
23
Citations:
0

Organization

S
shanghai university
Scholars:
3.9W
Papers: 2.7W
Citations: 52