返回
DiffOG: Differentiable Policy Trajectory Optimization With Generalizability
DOI:10.1109/TRO.2025.3636302.png)
摘要
En 中文
基于模仿学习的视动策略在操作任务中表现出色,但与基于模型的方法相比,其产生的动作轨迹通常次优。通过神经网络直接将相机数据映射到动作可能导致运动抖动,并难以满足关键约束条件,从而影响实际部署中的安全性和鲁棒性。对于需要高鲁棒性或严格约束的任务,确保轨迹质量至关重要。然而,神经网络缺乏可解释性,使得在可控方式下生成符合约束的动作具有挑战性。本文介绍了具有泛化性的可微分策略轨迹优化(DiffOG),这是一种基于学习的轨迹优化框架,旨在增强视动策略。通过利用基于transformer的轨迹优化的可微分表述,DiffOG将策略与泛化性优化层无缝集成。DiffOG通过优化使动作轨迹更平滑且更符合约束,同时保持与原始演示分布的一致性,从而避免策略性能下降。我们在11个模拟任务和2个真实任务中评估了DiffOG。结果表明,DiffOG显著提升了视动策略的轨迹质量,对策略性能影响极小,优于贪心约束裁剪和基于惩罚的轨迹优化等轨迹处理基线。此外,DiffOG相较于现有的约束视动策略表现更优。
Keyword:
Differentiable optimization
imitation learning
robot learning
期刊
IF:
10.5
论文数:
3.3K
被引数:
2.8W
机构
引用论文
Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots通用操作接口:无需在野机器人的在野机器人教学
DexCap: Scalable and Portable Mocap Data Collection System for Dexterous ManipulationDexCap:一种用于灵巧操作的规模化、便携式动捕数据采集系统
GELLO: A General, Low-Cost, and Intuitive Teleoperation Framework for Robot ManipulatorsGELLO:一种通用的、低成本且直观的机器人操作者远程控制框架

