arrow
返回

Multimodal spatial language maps for robot navigation and manipulation

delete2025-07-27
delete0
PRE
AI
O
Oier Mees
A
Andy Zeng
W
Wolfram Burgard
DOI:10.1177/02783649251351658delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
将导航智能体的观察结果与语言进行关联,可以利用预训练的多模态基础模型将感知与物体或事件的描述相匹配。然而,现有方法与环境地图脱节,缺乏几何地图的空间精度,或忽略了除视觉以外的其他模态信息。为解决这一问题,我们提出多模态空间语言地图,这是一种空间地图表示方法,融合了预训练的多模态特征与环境的3D重建。我们通过标准探索自主构建这些地图。我们展示了两种地图实例,即视觉-语言地图(VLMaps)及其通过添加音频信息扩展得到的视听-语言地图(AVLMaps)。当与大型语言模型(LLMs)结合时,VLMaps可将自然语言指令转化为开放词汇的空间目标(例如“沙发和电视之间”),这些目标可直接在地图中定位,并可在不同机器人实体间共享,按需生成定制的障碍地图。基于上述能力,AVLMaps通过融合预训练多模态基础模型的特征,引入了一种统一的3D空间表示,整合了音频、视觉和语言线索。这使机器人能够将多模态目标查询(例如文本、图像或音频片段)定位到空间位置进行导航。此外,多样化的感官输入显著增强了模糊环境中的目标消歧。模拟和真实环境中的实验表明,我们的多模态空间语言地图支持零样本空间和多模态目标导航,并在模糊场景中提高了50%的召回率。这些能力适用于移动机器人和桌面操作器,支持由视觉、音频和空间线索引导的导航与交互。代码和视频可在https://mslmaps.github.io获取。
Keyword:
multimodal spatial language maps
visual-language maps
audio-visual-language maps
large language models
3D reconstruction

期刊

T
The International Journal of Robotics Research
IF:
0
论文数:
126
被引数:
0

机构

G
google research, princeton, nj, usa
学者数:
1
论文数: 1
被引数: 0
U
uc berkeley, berkeley, ca, usa
学者数:
2
论文数: 2
被引数: 0
U
University of Technology Nuremberg
学者数:
2
论文数: 2
被引数: 7
学者 查看更多机构
引用论文

引用论文

Open-vocabulary Queryable Scene Representations for Real World Planning
err2023-05-29
err0
errOAAI
errBoyuan Chen; Fei Xia; Brian Ichter; Kanishka Rao; Keerthana Gopalakrishnan; Michael S. Ryoo; Austin Stone; Daniel Kappler
err分享
err收藏
RT-1: Robotics Transformer for Real-World Control at Scale
err2023-07-10
err0
errOAAI
errAnthony Brohan; Noah Brown; Justice Carbajal; Yevgen Chebotar; Joseph Dabis; Chelsea Finn; Keerthana Gopalakrishnan; Karol Hausman; Alexander Herzog; Jasmine Hsu; Julian Ibarz; Brian Ichter; Alex Irpan; Tomas Jackson; Sally Jesmonth; Nikhil Joshi; Ryan Julian; Dmitry Kalashnikov; Yuheng Kuang; Isabel Leal; Kuang-Huei Lee; Sergey Levine; Yao Lu; Utsav Malla; Deeksha Manjunath; Igor Mordatch; Ofir Nachum; Carolina Parada; Jodilyn Peralta; Emily Perez; Karl Pertsch; Jornell Quiambao; Kanishka Rao; Michael Ryoo; Grecia Salazar; Pannag Sanketi; Kevin Sayed; Jaspiar Singh; Sumedh Sontakke; Austin Stone; Clayton Tan; Huong Tran; Vincent Vanhoucke; Steve Vega; Quan Vuong; Fei Xia; Ted Xiao; Peng Xu; Sichun Xu; Tianhe Yu; Brianna Zitkovich
err分享
err收藏
Hierarchical Open-Vocabulary 3D Scene Graphs for Language-Grounded Robot Navigation
err
IF0
err2024-07-15
err0
PREAI
errAbdelrhman Werby; Chenguang Huang; Martin Büchner; Abhinav Valada; Wolfram Burgard
err分享
err收藏
Learning your way around town: How virtual taxicab drivers learn to use both layout and landmark information
err2007-08-01
err0
errOAAI
errEhren L. Newman; Jeremy B. Caplan; Matthew P. Kirschen; Igor O. Korolev; Robert Sekuler; Michael J. Kahana
err分享
err收藏
LangSplat: 3D Language Gaussian Splatting
err2024-06-16
err0
PREAI
errMinghan Qin; Wanhua Li; Jiawei Zhou; Haoqian Wang; Hanspeter Pfister
err分享
err收藏
Airbert: In-domain Pretraining for Vision-and-Language Navigation
err2021-10-01
err0
errOAAI
errPierre-Louis Guhur; Makarand Tapaswi; Shizhe Chen; Ivan Laptev; Cordelia Schmid
err分享
err收藏
err分享
err收藏
LERF: Language Embedded Radiance Fields
err2023-10-01
err0
errOAAI
errJustin Kerr; Chung Min Kim; Ken Goldberg; Angjoo Kanazawa; Matthew Tancik
err分享
err收藏
err分享
err收藏
学者 查看更多内容