arrow
返回

AtomThink: Multimodal Slow Thinking With Atomic Step Reasoning

delete2026-01-13
delete0
PRE
AI
项坤 (Kun Xiang)
Z
Zhili Liu
T
Terry Jingchen Zhang
Y
Yinya Huang
Y
Yunshuang Nie
K
Kaixin Cai
R
Runhui Huang
H
Hanhui Li
Y
Yihan Zeng
Y
Yu-Jie Yuan
J
Jianhua Han
L
Lanqing Hong
H
Hang Xu
X
Xiaodan Liang
DOI:10.1109/TPAMI.2026.3653573delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
本文将“慢思考”的概念融入多模态大语言模型(MLLMs),以应对多模态推理的挑战。我们的核心思想是模型能够学习自适应地运用不同层级的推理来处理不同复杂度的问題。我们提出了一种新的Self-structured Chain of Thought(SCoT)范式,其由最小的语义原子步骤组成。与依赖结构化模板或自由形式范式的现有方法不同,我们的方法不仅能针对各类复杂任务生成灵活的CoT结构,还能减轻简单任务中的过度思考现象。为将结构化推理引入视觉认知,我们设计了一个包含四个关键模块的AtomThink框架:(i) 一个生成高质量多模态推理路径的数据引擎;(ii) 配有串行推理数据的监督微调(SFT)过程;(iii) 一种策略引导的多轮推理方法;(iv) 一种评估单步利用率的原子能力指标。大量实验表明,所提出的AtomThink显著提升了基准MLLMs的性能,在MathVista和MathVerse上实现了超过10%的平均准确率提升。与当前最优的结构化CoT方法相比,我们的方法不仅在准确率上更高,还提升了5倍的数据利用率,并提高了85.3%的推理效率。
Keyword:
Generative AI
artificial general intelligence
vision language model

期刊

IEEE Transactions on Pattern Analysis and Machine Intelligence 封面图
IEEE Transactions on Pattern Analysis and Machine Intelligence
IF:
18.6
论文数:
864
被引数:
9.8W

机构

H
hong kong university of science and technology
学者数:
925
论文数: 517
被引数: 1
U
university of hong kong
学者数:
3.6K
论文数: 1.7K
被引数: 0
S
sun yat-sen university
学者数:
1.9W
论文数: 6.4K
被引数: 14
N
noah's ark lab
学者数:
5
论文数: 1
被引数: 0
E
ETH Zurich
学者数:
3.0W
论文数: 2.4W
被引数: 8.4W
学者 查看更多机构
引用论文

引用论文

Improve Vision Language Model Chain-of-thought Reasoning
err2025-01-01
err0
PREAI
errZhang,Ruohong; Zhang,Bowen; Li,Yanghao; Zhang,Haotian; Sun,Zhiqing; Gan,Zhe; Yang,Yinfei; Pang,Ruoming; Yang,Yiming
err分享
err收藏
The Lessons of Developing Process Reward Models in Mathematical Reasoning
err2025-01-01
err0
PREAI
errZhang,Zhenru; Zheng,Chujie; Wu,Yangzhen; Zhang,Beichen; Lin,Runji; Yu,Bowen; Liu,Dayiheng; Zhou,Jingren; Lin,Junyang
err分享
err收藏
MATHVERSE: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?MATHVERSE: 您的多模态LLM是否真正看到了视觉数学问题中的图表?
err
IF0
err2024-10-29
err0
PREAI
errRenrui Zhang; Dongzhi Jiang; Yichi Zhang; Haokun Lin; Ziyu Guo; Pengshuo Qiu; Aojun Zhou; Pan Lu; Kai-Wei Chang; Yu Qiao; Peng Gao; Hongsheng Li
err分享
err收藏
Visual Instruction Tuning
err2023-01-01
err0
PREAI
errLee,Yong Jae; Li,Chunyuan; Liu,Haotian; Wu,Qingyang
err分享
err收藏
Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
err2024-01-01
err0
PREAI
errShi,Wenhao; Hu,Zhiqiang; Bin,Yi; Liu,Junhua; Yang,Yang; Ng,See-Kiong; Bing,Lidong; Lee,Roy Ka-Wei
err分享
err收藏
err分享
err收藏
Mathematical Language Models: A Survey数学语言模型: 一项调查
err2026-04-01
err0
PREAI
errLiu, Wentao; Hu, Hanglei; Zhou, Jie; Ding, Yuyang; Li, Junsong; Zeng, Jiayi; He, Mengliang; Chen, Qin; Jiang, Bo; Zhou, Aimin; He, Liang
err分享
err收藏
CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning
err2017-07-01
err0
errOAAI
errJustin Johnson; Bharath Hariharan; Laurens van der Maaten; Li Fei-Fei; C. Lawrence Zitnick; Ross Girshick
err分享
err收藏
Intern VL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks实习生VL: 扩展视觉基础模型并调整通用视觉语言任务
err2024-06-16
err0
PREAI
errZhe Chen; Jiannan Wu; Wenhai Wang; Weijie Su; Guo Chen; Sen Xing; Muyan Zhong; Qinglong Zhang; Xizhou Zhu; Lewei Lu; Bin Li; Ping Luo; Tong Lu; Yu Qiao; Jifeng Dai
err分享
err收藏
MMMU: A Massive Multi-Discipline Multimodal Understanding and Reasoning Benchmark for Expert AGIMMMU:一个面向专家AGI的大规模跨学科多模态理解与推理基准
err2024-06-16
err0
PREAI
errXiang Yue; Yuansheng Ni; Tianyu Zheng; Kai Zhang; Ruoqi Liu; Ge Zhang; Samuel Stevens; Dongfu Jiang; Weiming Ren; Yuxuan Sun; Cong Wei; Botao Yu; Ruibin Yuan; Renliang Sun; Ming Yin; Boyuan Zheng; Zhenzhu Yang; Yibo Liu; Wenhao Huang; Huan Sun; Yu Su; Wenhu Chen
err分享
err收藏
学者 查看更多内容