返回
Visual Navigation for Embodied Agents Using Semantic-Based Multi-Modal Cognitive Graph
DOI:10.1109/TIP.2025.3637722.png)
摘要
En 中文
视觉导航是对于在广阔工作空间中运行的具身智能体而言的基础。这些智能体的认知能力构成了创建智能行为模式的基本基础。记忆和推理是这些能力中的关键组成部分。前者通过保存广泛的事件时空感知线索来增强决策能力,而后者则允许基于长期经验进行前瞻性和高级的概率推断任务分布。尽管已有针对这两种认知模态的独立研究,但由于它们在表示和行为特征上的显著差异,它们的整合以增强决策能力仍面临重大挑战。在本文中,我们引入了基于语义的多模态认知图(SMCG)用于智能视觉导航。该框架的特点在于对记忆和推理能力进行了统一的语义级表示。具体而言,SMCG并非像先前方法那样直接记忆感知特征,而是记录观察到的物体序列。同时,推理基于表示物体间相关性的语义关系图。此外,我们开发了一个层次化认知提取(HCE)管道,并利用它来解码SMCG和情境感知子图中的认知线索,从而增强智能导航行为。图像目标导航的实验结果表明了显著的性能提升,这归功于异构认知模态的有效诱导和合理应用。
Keyword:
Visual navigation
embodied agents
cognitive ability
memory
reasoning
期刊
IF:
13.7
论文数:
1.0W
被引数:
8.4W
机构
引用论文
Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations视觉基因组: 使用众包密集图像注释连接语言和视觉

