arrow
返回

Vision Generalist Model: A Survey

delete2025-06-18
delete0
PRE
AI
Z
Ziyi Wang
Y
Yongming Rao
S
Shuofeng Sun
X
Xinrun Liu
Y
Yi Wei
X
Xumin Yu
刘祖岩 (Zuyan Liu)
Y
Yanbo Wang
H
Hongmin Liu
周杰 (Jie Zhou)
J
Jiwen Lu *
DOI:10.1007/s11263-025-02502-7delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
近年来,我们在自然语言处理领域见证了通用模型取得的巨大成功。通用模型是一种通过大规模数据训练得到的通用框架,能够同时处理多种下游任务。受其出色性能的鼓舞,越来越多的研究人员开始探索将这些模型应用于计算机视觉任务。然而,视觉任务的输入和输出更加多样化,难以将其概括为统一的表示形式。本文对视觉通用模型进行了全面概述,深入探讨了它们在该领域的特征与能力。首先,我们回顾了相关背景,包括数据集、任务和基准。然后,我们深入分析了现有研究中提出的框架设计,同时介绍了用于提升其性能的技术。为帮助研究人员更好地理解该领域,我们简要探讨了相关领域,阐明其相互联系与潜在协同作用。最后,我们提供了一些实际应用场景,深入剖析了持续存在的挑战,并就未来研究方向提出了见解。
Keyword:
Foundation Model
Computer Vision
Multi-task Learning
Multimodality Data

期刊

International Journal of Computer Vision 封面图
International Journal of Computer Vision
IF:
9.3
论文数:
3.9K
被引数:
2.8W

机构

B
Beijing University of Posts and Telecommunications
学者数:
2.6K
论文数: 1.2K
被引数: 4.2K
D
Department of Automation
学者数:
148
论文数: 68
被引数: 1
U
university of science and technology beijing
学者数:
1.3W
论文数: 4.5K
被引数: 2
学者 查看更多机构
引用论文

引用论文

err分享
err收藏
Learning Internal Representations by Error Propagation
err
IF0
err1985-09-01
err0
PREAI
errDavid E. Rumelhart; Geoffrey E. Hinton; Ronald J. Williams
err分享
err收藏
Dynamic Task Prioritization for Multitask Learning
err2018-10-06
err0
PREAI
errMichelle Guo; Albert Haque; De-An Huang; Serena Yeung; Li Fei-Fei
err分享
err收藏
SEED-Bench: Benchmarking Multimodal Large Language Models
err2024-06-16
err0
PREAI
errBohao Li; Yuying Ge; Yixiao Ge; Guangzhi Wang; Rui Wang; Ruimao Zhang; Ying Shan
err分享
err收藏
InstructDiffusion: A Generalist Modeling Interface for Vision Tasks
err2024-06-16
err0
PREAI
errZigang Geng; Binxin Yang; Tiankai Hang; Chen Li; Shuyang Gu; Ting Zhang; Jianmin Bao; Zheng Zhang; Houqiang Li; Han Hu; Dong Chen; Baining Guo
err分享
err收藏
Latent Multi-Task Architecture Learning
err2019-07-17
err0
errOAAI
errSebastian Ruder; Joachim Bingel; Isabelle Augenstein; Anders Søgaard
err分享
err收藏
学者 查看更多内容