arrow
返回

DiffOG: Differentiable Policy Trajectory Optimization With Generalizability

delete2025-12-16
delete0
PRE
AI
Z
Zhengtong Xu
Z
Zichen Miao
Q
Qiang Qiu
Z
Zhe Zhang
Y
Yu She
DOI:10.1109/TRO.2025.3636302delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
基于模仿学习的视动策略在操作任务中表现出色,但与基于模型的方法相比,其产生的动作轨迹通常次优。通过神经网络直接将相机数据映射到动作可能导致运动抖动,并难以满足关键约束条件,从而影响实际部署中的安全性和鲁棒性。对于需要高鲁棒性或严格约束的任务,确保轨迹质量至关重要。然而,神经网络缺乏可解释性,使得在可控方式下生成符合约束的动作具有挑战性。本文介绍了具有泛化性的可微分策略轨迹优化(DiffOG),这是一种基于学习的轨迹优化框架,旨在增强视动策略。通过利用基于transformer的轨迹优化的可微分表述,DiffOG将策略与泛化性优化层无缝集成。DiffOG通过优化使动作轨迹更平滑且更符合约束,同时保持与原始演示分布的一致性,从而避免策略性能下降。我们在11个模拟任务和2个真实任务中评估了DiffOG。结果表明,DiffOG显著提升了视动策略的轨迹质量,对策略性能影响极小,优于贪心约束裁剪和基于惩罚的轨迹优化等轨迹处理基线。此外,DiffOG相较于现有的约束视动策略表现更优。
Keyword:
Differentiable optimization
imitation learning
robot learning

期刊

IEEE Transactions on Robotics 封面图
IEEE Transactions on Robotics
IF:
10.5
论文数:
3.3K
被引数:
2.8W

机构

P
Purdue University
学者数:
2.7W
论文数: 2.1W
被引数: 147
引用论文

引用论文

PoCo: Policy Composition from and for Heterogeneous Robot Learning
err
err0
PREAI
errWang,Lirui; Zhao,Jialiang; Du,Yilun; Adelson,Edward; Tedrake,Russ
err分享
err收藏
Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware
err2023-07-10
err0
errOAAI
errTony Zhao; Vikash Kumar; Sergey Levine; Chelsea Finn
err分享
err收藏
Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots通用操作接口:无需在野机器人的在野机器人教学
err2024-07-15
err0
PREAI
errCheng Chi; Zhenjia Xu; Chuer Pan; Eric Cousineau; Benjamin Burchfiel; Siyuan Feng; Russ Tedrake; Shuran Song
err分享
err收藏
π₀: A Vision-Language-Action Flow Model for General Robot Control
err
err0
PREAI
errBlack,Kevin; Brown,Noah; Driess,Danny; Esmail,Adnan; Equi,Michael; Finn,Chelsea; Fusai,Niccolo; Groom,Lachy; Hausman,Karol; Ichter,Brian; Jakubczak,Szymon; Jones,Tim; Ke,Liyiming; Levine,Sergey; Li-Bell,Adrian; Mothukuri,Mohith; Nair,Suraj; Pertsch,Karl; Shi,Lucy; Smith,Laura; Tanner,James; Vuong,Quan; Walling,Anna; Wang,Haohuan; Zhilinsky,Ury
err分享
err收藏
err分享
err收藏
学者 查看更多内容