返回
Vision Generalist Model: A Survey
DOI:10.1007/s11263-025-02502-7.png)
摘要
En 中文
近年来,我们在自然语言处理领域见证了通用模型取得的巨大成功。通用模型是一种通过大规模数据训练得到的通用框架,能够同时处理多种下游任务。受其出色性能的鼓舞,越来越多的研究人员开始探索将这些模型应用于计算机视觉任务。然而,视觉任务的输入和输出更加多样化,难以将其概括为统一的表示形式。本文对视觉通用模型进行了全面概述,深入探讨了它们在该领域的特征与能力。首先,我们回顾了相关背景,包括数据集、任务和基准。然后,我们深入分析了现有研究中提出的框架设计,同时介绍了用于提升其性能的技术。为帮助研究人员更好地理解该领域,我们简要探讨了相关领域,阐明其相互联系与潜在协同作用。最后,我们提供了一些实际应用场景,深入剖析了持续存在的挑战,并就未来研究方向提出了见解。
Keyword:
Foundation Model
Computer Vision
Multi-task Learning
Multimodality Data
期刊
IF:
9.3
论文数:
3.9K
被引数:
2.8W

