返回
AtomThink: Multimodal Slow Thinking With Atomic Step Reasoning
DOI:10.1109/TPAMI.2026.3653573.png)
摘要
En 中文
本文将“慢思考”的概念融入多模态大语言模型(MLLMs),以应对多模态推理的挑战。我们的核心思想是模型能够学习自适应地运用不同层级的推理来处理不同复杂度的问題。我们提出了一种新的Self-structured Chain of Thought(SCoT)范式,其由最小的语义原子步骤组成。与依赖结构化模板或自由形式范式的现有方法不同,我们的方法不仅能针对各类复杂任务生成灵活的CoT结构,还能减轻简单任务中的过度思考现象。为将结构化推理引入视觉认知,我们设计了一个包含四个关键模块的AtomThink框架:(i) 一个生成高质量多模态推理路径的数据引擎;(ii) 配有串行推理数据的监督微调(SFT)过程;(iii) 一种策略引导的多轮推理方法;(iv) 一种评估单步利用率的原子能力指标。大量实验表明,所提出的AtomThink显著提升了基准MLLMs的性能,在MathVista和MathVerse上实现了超过10%的平均准确率提升。与当前最优的结构化CoT方法相比,我们的方法不仅在准确率上更高,还提升了5倍的数据利用率,并提高了85.3%的推理效率。
Keyword:
Generative AI
artificial general intelligence
vision language model
期刊
IF:
18.6
论文数:
864
被引数:
9.8W
机构
引用论文
MATHVERSE: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?MATHVERSE: 您的多模态LLM是否真正看到了视觉数学问题中的图表?
Intern VL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks实习生VL: 扩展视觉基础模型并调整通用视觉语言任务

