arrow
返回

PACER: A fully push-forward-based distributional reinforcement learning algorithm

delete2025-08-19
delete0
delete
OA
AI
W
Wensong Bai
C
Chao Zhang *
Y
Yichao Fu
P
Peilin Zhao
H
Hui Qian
DOI:10.1016/j.neucom.2025.131301delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
本文提出了一种基于全向前推算(push-forward)的分布式强化学习算法,命名为PACER,该算法包含一个分布式评论家(critic)、一个随机行为者(actor)和一个基于样本的鼓励器(encourager)。具体而言,向前推算算子被应用于评论家和行为者中,分别用于建模回报分布和随机策略,赋予它们等同的建模能力,从而增强协同性能。由于难以获取向前推算策略的密度函数,鼓励器中集成了新的基于样本的正则化项,以激励高效探索并缓解陷入局部最优的风险。此外,为向前推算策略更新建立了一种基于样本的随机效用值策略梯度,规避了现有基于REINFORCE的随机策略梯度对策略密度函数的显式需求。因此,PACER充分利用了向前推算算子的建模能力,能够探索比现有分布式Actor-Critic算法(即高斯分布)所使用的有限策略类更广泛的策略空间。我们通过广泛的实证研究验证了算法各组件的关键作用。实验结果表明,本算法优于当前最优方法,在Mujoco连续控制基准上实现了平均10%的得分提升。
Keyword:
Distributional reinforcement learning
Actor-critic
Push-forward policy
Sample-based regularizer
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

Neurocomputing 封面图
Neurocomputing
IF:
6.5
论文数:
2.5W
被引数:
6.5W

机构

C
College of Computer Science and Technology
学者数:
854
论文数: 298
被引数: 0
S
School of Artificial Intelligence
学者数:
754
论文数: 344
被引数: 0
引用论文

引用论文

Safety-constrained reinforcement learning with a distributional safety critic
err2022-06-23
err19
errOAAI
errYang, Qisong; Simao, Thiago D.; Tindemans, Simon H.; Spaan, Matthijs T. J.
err分享
err收藏
err分享
err收藏
Human-level control through deep reinforcement learning通过深度强化学习实现人类层面的控制
err2015-02-25
err0
PREAI
errVolodymyr Mnih; Koray Kavukcuoglu; David Silver; Andrei A. Rusu; Joel Veness; Marc G. Bellemare; Alex Graves; Martin Riedmiller; Andreas K. Fidjeland; Georg Ostrovski; Stig Petersen; Charles Beattie; Amir Sadik; Ioannis Antonoglou; Helen King; Dharshan Kumaran; Daan Wierstra; Shane Legg; Demis Hassabis
err分享
err收藏
Generative Adversarial Networks生成对抗网络
err2020-10-22
err1.0W
errOAAI
errGoodfellow, Ian; Pouget-Abadie, Jean; Mirza, Mehdi; Xu, Bing; Warde-Farley, David; Ozair, Sherjil; Courville, Aaron; Bengio, Yoshua
err分享
err收藏
Remarks on quantiles and distortion risk measures
err2012-11-23
err0
PREAI
errJan Dhaene; Alexander Kukush; Daniël Linders; Qihe Tang
err分享
err收藏
err分享
err收藏
学者 查看更多内容