返回
Knowledge Graph-Driven Reinforcement Learning for Zero-Shot Vision-Language Navigation
DOI:10.3390/math14091485.png)
摘要
En 中文
为解决视觉-语言导航(VLN)中零样本泛化能力的局限性,本文提出了一种新颖的知识图谱驱动的强化学习方法。该方法在智能体与环境进行实时交互时,在线构建层次化、动态更新的知识图谱,将外部语义先验与连续视觉感知无缝对齐。通过利用思维链(CoT)提示机制,智能体执行多跳推理以精确定位目标物体。此外,我们设计了一个端到端优化的强化学习框架,融合多模态特征并采用任务导向的复合奖励函数。在AI2-THOR仿真环境中的大量实验表明,所提出的方法显著提高了零样本设置下的导航成功率。结果表明其具有良好的泛化能力,尤其适用于未见过的物体类别和复杂场景布局。
Keyword:
embodied AI
Vision-Language Navigation
reinforcement learning
knowledge graph
Chain-of-Thought
期刊
IF:
2.2
论文数:
3.1K
被引数:
3.6W
机构
引用论文
PONI: Potential Functions for ObjectGoal Navigation with Interaction-free LearningPONI: 具有无交互学习的对象目标导航的潜在功能

