返回
Affordance-based robot manipulation with flow matching
DOI:10.3389/frobt.2026.1906861.png)
摘要
En 中文
我们提出了一种辅助机器人操作框架,该框架解决了两个基本挑战:大规模模型在场景可及性理解中的高效适应和通过视觉可及性基础学习机器人动作的有效性。为应对第一个挑战,我们采用了一种参数高效的提示调优方法,在冻结的视觉模型前添加可学习的文本提示以预测可及性,同时考虑多任务场景中的空间和语义关系。针对第二个挑战,我们提出了一种流匹配方法,将机器人的视觉运动策略表示为将随机路径点流向期望机器人动作的条件过程。我们引入了一个包含10个任务的真实世界数据集来评估我们的方法。实验表明,我们的提示调优方法在数据规模上达到了与其他微调协议相当或更优的性能,同时满足了参数效率。此外,流匹配相较于扩散策略实现了更稳定的训练和更快的推理;具体而言,单步流匹配达到了与16步DDIM相当的精度,同时将推理时间减少了约85%。我们的框架无缝统一了高级参数高效的可及性表示学习与低级流匹配策略,说明了显式可及性如何为基于流的策略提供有效的空间基础。
Keyword:
human-centered robotics,robot manipulation,flow matching,visual learning,affordance learning

