Return
MM-instruct: Generated visual instructions for large multimodal model alignment
DOI:10.1016/j.neucom.2025.131164.png)
Abstract
En 中文
• Introduces MM-Instruct: An automated pipeline generating diverse visual instruction data to improve LMM performance on real-world tasks beyond simple QA. • Demonstrates Improved Instruction Following: Models trained with MM-Instruct data significantly outperform prior models (e.g., LLaVA-1.5) in executing diverse visual instructions. • Releases Large-Scale Dataset: Contributes a new dataset with 293 diverse instructions and 234 k high-quality visual instruction pairs to advance LMM instruction-following research.
Keywords:
MM-Instruct
visual instruction data
large language models
instruction following
multimodal learning
Journal
IF:
6.5
Papers:
2.5W
Citations:
6.5W

