返回
Active perception: Gaze-guided thinking for chart understanding
DOI:10.1016/j.neucom.2026.133935.png)
摘要
En 中文
• 我们发现当前VLMs在图表理解方面存在关键缺陷:推理过程过于抽象,缺乏精确的视觉锚定,导致难以从结构化可视化中准确提取数据。
• 我们提出了一种基于注视引导的思考模式(Gaze-Guided Thinking),通过坐标基元(定位、追踪、提取、比较)将抽象推理锚定到具体视觉位置,模拟人类的图表扫描行为。
• 我们引入了技能培育(Skill Cultivation)策略,通过两阶段训练结合ChartQAGaze-14K(含14K带坐标标注的推理链)的监督微调(SFT)与基于结果强化学习(RL),注入并内化空间锚定的推理能力。
• Active Perception模型在ChartQA数据集上达到82.44%的总体准确率(绝对提升3.48%),在Human子集上表现尤为突出(81.28%,提升5.52%),证明明确的视觉锚定能显著提升结构化视觉理解能力。
• 定性分析显示,模型涌现出类人图表阅读行为,系统性地利用坐标进行精确数值提取与空间推理。
Keyword:
Chart understanding
Vision-language models
Visual grounding
Coordinate-based reasoning
Reinforcement learning
Gaze-guided thinking
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

