返回
Spatial-ViLT: Enhancing Visual Spatial Reasoning Through Multi-task Learning
DOI:10.1007/978-3-032-14495-9_4.png)
摘要
En 中文
视觉-语言模型(VLMs)在多模态推理方面取得了进展,但在3D场景的空间推理和复杂物体配置方面仍面临挑战。为解决此问题,我们引入了SpatialViLT,这是一种通过多任务学习框架集成深度图、3D坐标和边缘图等空间特征的增强型VLM。该方法丰富了多模态嵌入中的空间理解。我们提出了两种变体:SpatialViLT和MaskedSpatialViLT,分别关注完整和掩码物体区域。此外,SpatialEnsemble结合了这两种方法,实现了最先进的精度。我们的模型在方向、拓扑和邻近关系等空间推理类别中表现出色,这在具有挑战性的视觉空间推理(VSR)数据集上得到了验证。这项工作代表了增强AI系统空间智能的重要一步,对于高级多模态理解和实际应用至关重要。
Keyword:
Vision-Language Models
Spatial Reasoning
Multi-task Learning
3D Scene Understanding
Visual-Spatial Features
期刊
A
IF:
0
论文数:
37
被引数:
0
机构
引用论文
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning CapabilitiesSpatialVLM: 赋予视觉语言模型空间推理能力
What’s “up” with vision-language models? Investigating their struggle with spatial reasoning视觉语言模型“问题”何在?——探究其空间推理能力的挑战


