arrow
Return

MM-instruct: Generated visual instructions for large multimodal model alignment

delete2025-08-05
delete0
PRE
AI
X
Xin Huang
J
Jihao Liu
J
Jinliang Zheng
B
Boxiao Liu
J
Jia Wang
刘宇 cover
刘宇 (Yü Liu)
H
Hongsheng Li
O
Osamu Yoshie *
DOI:10.1016/j.neucom.2025.131164delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
• Introduces MM-Instruct: An automated pipeline generating diverse visual instruction data to improve LMM performance on real-world tasks beyond simple QA. • Demonstrates Improved Instruction Following: Models trained with MM-Instruct data significantly outperform prior models (e.g., LLaVA-1.5) in executing diverse visual instructions. • Releases Large-Scale Dataset: Contributes a new dataset with 293 diverse instructions and 234 k high-quality visual instruction pairs to advance LMM instruction-following research.
Keywords:
MM-Instruct
visual instruction data
large language models
instruction following
multimodal learning

Journal

Neurocomputing cover
Neurocomputing
IF:
6.5
Papers:
2.5W
Citations:
6.5W

Organization

S
sensetime research
Scholars:
33
Papers: 13
Citations: 0
W
Waseda University
Scholars:
1.0W
Papers: 8.7K
Citations: 8.3K
C
cuhk mmlab
Scholars:
2
Papers: 1
Citations: 0
researcher View more organizations