返回
Multimodal Pretrained Knowledge for Real-world Object Navigation
DOI:10.1007/s11633-024-1537-x.png)
摘要
En 中文
大多数视觉-语言导航(VLN)研究集中于模拟环境,但将这些方法应用于真实场景具有挑战性,因为复杂环境中视觉与语言之间存在错位,导致路径偏离。为解决此问题,我们提出了一种新颖的视觉-语言物体导航策略,该策略利用多模态预训练知识作为跨模态桥梁,连接图像和文本中的语义概念。这提升了关键点处的导航监督效果并增强了鲁棒性。具体而言,我们1)在特定密度范围内随机生成关键点,并基于挑战性位置进行优化;2)利用预训练的多模态知识高效检索目标物体;3)结合深度信息与同步定位与建图(SLAM)地图数据,预测最优位置和姿态以实现精确导航;4)在物理机器人上实施该方法,成功进行了导航测试。我们的方法在真实环境中达到最高成功率为66.7%,优于现有的VLN方法。
Keyword:
Visual-and-language object navigation
key-points
multimodal pretrained knowledge
optimal positions and orientations
physical robot
期刊
IF:
8.7
论文数:
303
被引数:
882

