返回
Spatial Traces: Enhancing VLA Models with Spatial-Temporal Understanding
DOI:10.3103/S1060992X25601654.png)
摘要
En 中文
视觉-语言-动作模型已展现出基于视觉观察和文本指令在虚拟环境和真实场景中预测智能体移动的显著能力。尽管近期研究侧重于分别提升空间与时间理解能力,但本文提出了一种新颖的方法,通过视觉提示整合这两个方面。我们引入了一种方法,将观察中的关键点视觉轨迹投影到深度图上,使模型能够同时捕捉空间和时间信息。SimplerEnv中的实验表明,成功解决任务的平均数量相较于SpatialVLA提升了4%,相较于TraceVLA提升了19%。此外,我们证明这种增强效果可以通过极少的训练数据实现,使其在数据收集困难的实际应用中具有特殊价值。项目页面可访问https://ampiromax.github.io/ST-VLA。
Keyword:
vision-language-action models
spatial-temporal understanding
visual prompting
embodied AI
期刊
O
IF:
0.8
论文数:
65
被引数:
233
机构
引用论文
Fine-Tuning Multimodal Transformer Models for Generating Actions in Virtual and Real Environments
IEEE ACCESS
IF3.6

