返回
Large multimodal models evaluation: a survey
DOI:10.1007/s11432-025-4676-4.png)
摘要
En 中文
随着大型多模态模型(LMMs)在多样化的多模态理解与生成任务中迅速发展,对系统化且可靠的评估框架的需求变得日益关键。为应对这一需求,本文综述对LMM评估提供了结构化概述,围绕两大核心轴线展开:多模态理解与生成评估。(1) 对于理解任务,引入了双重视角框架,以区分通用能力基准(强调常见任务)与专业能力基准(反映领域特定领域的专家级能力)。(2) 对于生成任务,评估按输出模态组织,包括图像、视频、音频及3D内容。(3) 从社区视角来看,本文进一步强调了权威排行榜和基础工具,这些工具在构建LMM综合评估生态系统中发挥了关键作用。通过统一通用-专业理解评估与模态特定生成评估,本文梳理了当前的研究现状,并为LMM评估领域的未来研究提供了指导。
Keyword:
large multimodal models
multimodal understanding
multimodal generation
期刊
IF:
7.6
论文数:
4.9K
被引数:
8.9K
机构
引用论文
NeRF-NQA: No-Reference Quality Assessment for Scenes Generated by NeRF and Neural View Synthesis MethodsNeRF-NQA:基于NeRF和神经视图合成方法的场景无参考质量评估
UDA: A Benchmark Suite for Retrieval Augmented Generation in Real-World Document AnalysisUda:一个用于检索增强生成在真实文档分析中的基准套件
DriVQA: A gaze-based dataset for visual question answering in driving scenariosDriVQA:一个基于注视的驾驶场景视觉问答数据集
SMILES, a chemical language and information system. 1. Introduction to methodology and encoding rules微笑,一种化学语言和信息系统。1.介绍方法和编码规则

