arrow
返回

Multimodal Pretrained Knowledge for Real-world Object Navigation

delete2025-06-26
delete0
PRE
AI
H
Hui Yuan
黄岩 (Yan Huang)
N
Naigong Yu *
张东波 (Dongbo Zhang)
Z
Zetao Du
Z
Ziqi Liu
K
Kun Zhang
DOI:10.1007/s11633-024-1537-xdelete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
大多数视觉-语言导航(VLN)研究集中于模拟环境,但将这些方法应用于真实场景具有挑战性,因为复杂环境中视觉与语言之间存在错位,导致路径偏离。为解决此问题,我们提出了一种新颖的视觉-语言物体导航策略,该策略利用多模态预训练知识作为跨模态桥梁,连接图像和文本中的语义概念。这提升了关键点处的导航监督效果并增强了鲁棒性。具体而言,我们1)在特定密度范围内随机生成关键点,并基于挑战性位置进行优化;2)利用预训练的多模态知识高效检索目标物体;3)结合深度信息与同步定位与建图(SLAM)地图数据,预测最优位置和姿态以实现精确导航;4)在物理机器人上实施该方法,成功进行了导航测试。我们的方法在真实环境中达到最高成功率为66.7%,优于现有的VLN方法。
Keyword:
Visual-and-language object navigation
key-points
multimodal pretrained knowledge
optimal positions and orientations
physical robot

期刊

Machine Intelligence Research 封面图
Machine Intelligence Research
IF:
8.7
论文数:
303
被引数:
882

机构

S
School of Automation and Electronic Information
学者数:
23
论文数: 11
被引数: 0
S
School of Information Science and Technology
学者数:
447
论文数: 158
被引数: 0
学者 查看更多机构
引用论文

引用论文

err分享
err收藏
Active Visual Information Gathering for Vision-Language Navigation
err2020-11-17
err0
PREAI
errHanqing Wang; Wenguan Wang; Tianmin Shu; Wei Liang; Jianbing Shen
err分享
err收藏
err分享
err收藏
Large-Scale Few-Shot Learning via Multi-modal Knowledge Discovery
err2020-11-07
err0
PREAI
errShuo Wang; Jun Yue; Jianzhuang Liu; Qi Tian; Meng Wang
err分享
err收藏
RoboTHOR: An Open Simulation-to-Real Embodied AI Platform
err2020-06-01
err0
errOAAI
errMatt Deitke; Winson Han; Alvaro Herrasti; Aniruddha Kembhavi; Eric Kolve; Roozbeh Mottaghi; Jordi Salvador; Dustin Schwenk; Eli VanderBilt; Matthew Wallingford; Luca Weihs; Mark Yatskar; Ali Farhadi
err分享
err收藏
Improved techniques for grid mapping with Rao-Blackwellized particle filters
err2007-02-01
err1.8K
errOAAI
errGrisetti, Giorgio; Stachniss, Cyrill; Burgard, Wolfram
err分享
err收藏
Skill-Based Hierarchical Reinforcement Learning for Target Visual Navigation
err2023-01-01
err9
PREAI
errWang, Shuo; Wu, Zhihao; Hu, Xiaobo; Lin, Youfang; Lv, Kai
err分享
err收藏
学者 查看更多内容