arrow
返回

Spatial-ViLT: Enhancing Visual Spatial Reasoning Through Multi-task Learning

delete2026-01-01
delete0
PRE
AI
I
Islam, Chashi Mahiul *
M
Mamo, Oteo
C
Chacko, Samuel Jacob
L
Liu, Xiuwen
Y
Yu, Weikuan
DOI:10.1007/978-3-032-14495-9_4delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
视觉-语言模型(VLMs)在多模态推理方面取得了进展,但在3D场景的空间推理和复杂物体配置方面仍面临挑战。为解决此问题,我们引入了SpatialViLT,这是一种通过多任务学习框架集成深度图、3D坐标和边缘图等空间特征的增强型VLM。该方法丰富了多模态嵌入中的空间理解。我们提出了两种变体:SpatialViLT和MaskedSpatialViLT,分别关注完整和掩码物体区域。此外,SpatialEnsemble结合了这两种方法,实现了最先进的精度。我们的模型在方向、拓扑和邻近关系等空间推理类别中表现出色,这在具有挑战性的视觉空间推理(VSR)数据集上得到了验证。这项工作代表了增强AI系统空间智能的重要一步,对于高级多模态理解和实际应用至关重要。
Keyword:
Vision-Language Models
Spatial Reasoning
Multi-task Learning
3D Scene Understanding
Visual-Spatial Features

期刊

A
ADVANCES IN VISUAL COMPUTING, ISVC 2025, PT II
IF:
0
论文数:
37
被引数:
0

机构

State University System of Florida 封面图
State University System of Florida
学者数:
12.7W
论文数: 10.9W
被引数: 130
引用论文

引用论文

err分享
err收藏
err分享
err收藏
Mask R-CNN面具r-cnn
err2017-10-01
err0
PREAI
errKaiming He; Georgia Gkioxari; Piotr Dollar; Ross Girshick
err分享
err收藏
Visual Spatial Reasoning
err2023-06-20
err25
errOAAI
errLiu, Fangyu; Emerson, Guy; Collier, Nigel
err分享
err收藏
SpatialRGPT: Grounded Spatial Reasoning in Vision-Language ModelsSpatialRgpt:视觉语言模型中的定位空间推理
err2024-01-01
err0
PREAI
errCheng,An-Chieh; Fu,Yang; Guo,Qiushan; Kautz,Jan; Liu,Sifei; Wang,Xiaolong; Yang,Ruihan; Yin,Hongxu
err分享
err收藏
学者 查看更多内容