返回
Efficiently Learning Robust Torque-Based Locomotion Through Reinforcement With Model-Based Supervision
DOI:10.1109/LRA.2026.3664534.png)
摘要
En 中文
我们提出了一种控制框架,将基于模型的步态行走与残差强化学习(RL)相结合,以在存在真实世界不确定性的情况下实现鲁棒且自适应的行走。我们的方法利用一个基于模型的控制器——包括一个发散运动分量(DCM)轨迹规划器和全身控制器——作为可靠的基础策略。为解决动力学建模不准确和传感器噪声的不确定性,我们引入了一种通过领域随机化训练的残差策略。关键在于,我们采用一个基于模型的先验策略,该策略在训练期间可获取动力学真值信息,通过一种新颖的监督损失来监督残差策略。这种监督使策略能够高效学习修正行为,以补偿未建模的影响,而无需进行大量的奖励塑造。我们的方法在一系列随机化条件下展示了改进的鲁棒性和泛化能力,为双足步态行走中的仿真到现实迁移提供了一种可扩展的解决方案。
Keyword:
Bipedal locomotion
sim-to-real transfer
residual RL
model-based control
期刊
I
IF:
5.3
论文数:
1.9K
被引数:
3.9W
机构
引用论文
He, T.; Luo, Z.; Xiao, W.; Zhang, C.; Kitani, K.; Liu, C.; Shi, G. Learning Human-to-Humanoid Real-Time Whole-Body Teleoperation. In Proceedings of the 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Abu Dhabi, United Arab Emirates, 14–18 October 2024; pp. 8944–8951. [Google Scholar] [CrossRef]He, T.; Luo, Z.; Xiao, W.; Zhang, C.; Kitani, K.; Liu, C.; Shi, G. 学习人机实时全身遥操作。发表于2024年IEEE/RSJ国际智能机器人与系统会议(IROS),阿布扎比,阿拉伯联合酋长国,2024年10月14日至18日;第8944–8951页。[Google Scholar][CrossRef]

