返回
PACER: A fully push-forward-based distributional reinforcement learning algorithm
DOI:10.1016/j.neucom.2025.131301.png)
摘要
En 中文
本文提出了一种基于全向前推算(push-forward)的分布式强化学习算法,命名为PACER,该算法包含一个分布式评论家(critic)、一个随机行为者(actor)和一个基于样本的鼓励器(encourager)。具体而言,向前推算算子被应用于评论家和行为者中,分别用于建模回报分布和随机策略,赋予它们等同的建模能力,从而增强协同性能。由于难以获取向前推算策略的密度函数,鼓励器中集成了新的基于样本的正则化项,以激励高效探索并缓解陷入局部最优的风险。此外,为向前推算策略更新建立了一种基于样本的随机效用值策略梯度,规避了现有基于REINFORCE的随机策略梯度对策略密度函数的显式需求。因此,PACER充分利用了向前推算算子的建模能力,能够探索比现有分布式Actor-Critic算法(即高斯分布)所使用的有限策略类更广泛的策略空间。我们通过广泛的实证研究验证了算法各组件的关键作用。实验结果表明,本算法优于当前最优方法,在Mujoco连续控制基准上实现了平均10%的得分提升。
Keyword:
Distributional reinforcement learning
Actor-critic
Push-forward policy
Sample-based regularizer
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
6.5
论文数:
2.5W
被引数:
6.5W
机构
引用论文
Lindenberg, B., Nordqvist, J., Lindahl, K.O., 2022. Conjugated discrete distributions for distributional reinforcement learning, in: AAAI 2022, pp. 7516–7524.Lindenberg, B., Nordqvist, J., Lindahl, K.O., 2022. 用于分布式强化学习的共轭离散分布,载于:AAAI 2022, pp. 7516–7524.

