arrow
返回

Spatial Traces: Enhancing VLA Models with Spatial-Temporal Understanding

delete2025-12-01
delete0
PRE
AI
P
Patratskiy, M. A. *
K
Kovalev, A. K.
P
Panov, A. I.
DOI:10.3103/S1060992X25601654delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
视觉-语言-动作模型已展现出基于视觉观察和文本指令在虚拟环境和真实场景中预测智能体移动的显著能力。尽管近期研究侧重于分别提升空间与时间理解能力,但本文提出了一种新颖的方法,通过视觉提示整合这两个方面。我们引入了一种方法,将观察中的关键点视觉轨迹投影到深度图上,使模型能够同时捕捉空间和时间信息。SimplerEnv中的实验表明,成功解决任务的平均数量相较于SpatialVLA提升了4%,相较于TraceVLA提升了19%。此外,我们证明这种增强效果可以通过极少的训练数据实现,使其在数据收集困难的实际应用中具有特殊价值。项目页面可访问https://ampiromax.github.io/ST-VLA。
Keyword:
vision-language-action models
spatial-temporal understanding
visual prompting
embodied AI

期刊

O
Optical Memory and Neural Networks
IF:
0.8
论文数:
65
被引数:
233

机构

M
moscow institute of physics & technology
学者数:
4.5K
论文数: 3.0K
被引数: 3
引用论文

引用论文

RoboVQA: Multimodal Long-Horizon Reasoning for Robotics
err2024-05-13
err0
PREAI
errSermanet,Pierre; Ding,Tianli; Zhao,Jeffrey; Xia,Fei; Dwibedi,Debidatta; Gopalakrishnan,Keerthana; Chan,Christine; Dulac-Arnold,Gabriel; Maddineni,Sharath; Joshi,Nikhil J; Florence,Pete; Han,Wei; Baruch,Robert; Lu,Yao; Mirchandani,Suvir; Xu,Peng; Sanketi,Pannag; Hausman,Karol; Shafran,Izhak; Ichter,Brian; Cao,Yuan
err分享
err收藏
Fine-Tuning Multimodal Transformer Models for Generating Actions in Virtual and Real Environments
err2023-01-01
err2
errOAAI
errStaroverov, Aleksei; Gorodetsky, Andrey S.; Krishtopik, Andrei S.; Izmesteva, Uliana A.; Yudin, Dmitry A.; Kovalev, Alexey K.; Panov, Aleksandr I.
err分享
err收藏
RT-Affordance: Affordances are Versatile Intermediate Representations for Robot Manipulation
err2025-05-19
err0
PREAI
errNasiriany,Soroush; Kirmani,Sean; Ding,Tianli; Smith,Laura; Zhu,Yuke; Driess,Danny; Sadigh,Dorsa; Xiao,Ted
err分享
err收藏
err
IF0
err
err0
errOAAI
err
err分享
err收藏
SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Models
err
err0
PREAI
errQu,Delin; Song,Haoming; Chen,Qizhi; Yao,Yuanqi; Ye,Xinyi; Gu,Jiayuan; Wang,Zhigang; Ding,Yan; Zhao,Bin; Wang,Dong; Li,Xuelong
err分享
err收藏
CoTracker: It Is Better to Track Together
err2024-10-31
err0
PREAI
errNikita Karaev; Ignacio Rocco; Benjamin Graham; Natalia Neverova; Andrea Vedaldi; Christian Rupprecht
err分享
err收藏
Magma: A Foundation Model for Multimodal AI Agents
err2025-06-10
err0
PREAI
errYang,Jianwei; Tan,Reuben; Wu,Qianhui; Zheng,Ruijie; Peng,Baolin; Liang,Yongyuan; Gu,Yu; Cai,Mu; Ye,Seonghyeon; Jang,Joel; Deng,Yuquan; Gao,Jianfeng
err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
Common Sense Plan Verification with Large Language Models
err2025-01-01
err0
PREAI
errGrigorev,Danil S.; Kovalev,Alexey K.; Panov,Aleksandr I.
err分享
err收藏
学者 查看更多内容