arrow
返回

3D visual grounding based on active perception

delete2026-09-10
delete0
delete
OA
AI
L
Liang Geng *
DOI:10.1007/s40747-026-02514-xdelete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
3D视觉定位(3DVG)是具身智能体的关键能力,要求机器人能够在3D空间中将自由形式的语言表达所指的对象进行定位。现有的基于LLM/VLM的方法通常基于不完整的观测进行单次决策,或对整个场景调用昂贵的多模态推理,导致定位模糊、预测幻觉和可靠性受限。我们通过将3DVG表述为基于状态驱动的闭环定位,并在可重用的场景记忆中解决这一挑战。给定一个分解为上下文有序定位序列的查询,我们的框架维护当前候选集和累积的结构化证据,预测用于主动感知的信息视角,并在预测视图的投影局部区域内执行候选条件验证。新获取的观测被稀疏地写回场景记忆,实现局部记忆恢复和候选刷新,而无需全局重新计算。我们进一步引入一个反馈驱动的再定位机制,包含已解析、模糊、缺失和冲突状态:系统仅在验证唯一候选后才前进;否则,它继续主动感知或回溯以恢复上游锚点。通过仅在验证候选时使用VLM,而从场景记忆中读取最终3D几何信息,并将高成本的多模态推理限制在主动局部候选上,所提出的框架在部分可观测性下提高了鲁棒性,并缓解了幻觉风险。在ScanRefer、Sr3D、Nr3D和OpenTarget上的实验证明了我们方法的有效性,并展示了相较于竞争基线方法的强性能。
Keyword:
3D visual grounding
Active perception
Closed-loop grounding
Scene memory
Feedback-driven re-grounding

期刊

C
Complex & Intelligent Systems
IF:
4.6
论文数:
274
被引数:
0

机构

C
College of Mechanical and Electrical Engineering
学者数:
868
论文数: 272
被引数: 0