返回
Multimodal spatial language maps for robot navigation and manipulation
DOI:10.1177/02783649251351658.png)
摘要
En 中文
将导航智能体的观察结果与语言进行关联,可以利用预训练的多模态基础模型将感知与物体或事件的描述相匹配。然而,现有方法与环境地图脱节,缺乏几何地图的空间精度,或忽略了除视觉以外的其他模态信息。为解决这一问题,我们提出多模态空间语言地图,这是一种空间地图表示方法,融合了预训练的多模态特征与环境的3D重建。我们通过标准探索自主构建这些地图。我们展示了两种地图实例,即视觉-语言地图(VLMaps)及其通过添加音频信息扩展得到的视听-语言地图(AVLMaps)。当与大型语言模型(LLMs)结合时,VLMaps可将自然语言指令转化为开放词汇的空间目标(例如“沙发和电视之间”),这些目标可直接在地图中定位,并可在不同机器人实体间共享,按需生成定制的障碍地图。基于上述能力,AVLMaps通过融合预训练多模态基础模型的特征,引入了一种统一的3D空间表示,整合了音频、视觉和语言线索。这使机器人能够将多模态目标查询(例如文本、图像或音频片段)定位到空间位置进行导航。此外,多样化的感官输入显著增强了模糊环境中的目标消歧。模拟和真实环境中的实验表明,我们的多模态空间语言地图支持零样本空间和多模态目标导航,并在模糊场景中提高了50%的召回率。这些能力适用于移动机器人和桌面操作器,支持由视觉、音频和空间线索引导的导航与交互。代码和视频可在https://mslmaps.github.io获取。
Keyword:
multimodal spatial language maps
visual-language maps
audio-visual-language maps
large language models
3D reconstruction
期刊
T
IF:
0
论文数:
126
被引数:
0
机构
引用论文
Learning your way around town: How virtual taxicab drivers learn to use both layout and landmark information
Cognition
IF0
Catch Me if You Hear Me: Audio-Visual Navigation in Complex Unmapped Environments With Moving Sounds

