返回
Compact exploration for continuous action reinforcement learning
DOI:10.1016/j.patcog.2025.112739.png)
摘要
En 中文
• 概念上,我们提出紧凑探索,其重点是探索一个高价值、紧凑的区域,而不仅仅是策略的即时邻域。
• 方法上,我们通过集成多个Q函数的共识与发散来构建高价值区域,并动态压缩该区域以确保紧凑性。
• 理论上,我们基于动态压缩为Q值的收敛性提供保证,证明Q值最终收敛到最优值,从而证实了我们方法的有效性。
• 实验上,我们提出的方法在Mujoco平台上多个复杂的连续控制任务中达到了当前最佳性能。

