arrow
返回

Proximal policy optimization with reward-based prioritization

delete2025-07-01
delete0
PRE
AI
M
Mingsheng Zheng
J
Junwei Zhang
Z
Zhan, Changshuai
任
任新宇 (Xinyu Ren)
S
Shuai Lü *
DOI:10.1016/j.eswa.2025.127659delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
PPO(Proximal Policy Optimization)算法是一种基于策略优化的深度强化学习算法,已取得卓越成果并得到广泛应用。尽管PPO算法广受欢迎,但其存在若干显著缺陷,包括对超参数的敏感性、收敛速度慢以及探索能力有限。近期研究中,代码级优化被提出以提升训练效率并取得了良好性能。本文提出了一种基于奖励优先级的近端策略优化算法(RP-PPO),该算法根据奖励对不同经验赋予不同优先级以更新策略,并寻找获得最高平均奖励的模型。我们还应用了包括归一化奖励和双学习率衰减等若干辅助技术来优化算法。最后,我们在Gym环境中的四个问题领域进行了一系列实验和测试,以证明我们算法的优越性。
Keyword:
Reinforcement learning
Proximal policy optimization
Prioritization
Policy gradient
Actor-critic

期刊

Expert Systems with Applications 封面图
Expert Systems with Applications
IF:
7.5
论文数:
3.0W
被引数:
10.2W

机构

暂无机构信息
引用论文

引用论文

Prioritized Experience Replay based on Multi-armed Bandit
err2022-03-01
err10
PREAI
errLiu, Ximing; Zhu, Tianqing; Jiang, Cuiqing; Ye, Dayong; Zhao, Fuqing
err分享
err收藏
Sampling diversity driven exploration with state difference guidance
err2022-10-01
err3
PREAI
errLu, Jiayi; Han, Shuai; Lu, Shuai; Kang, Meng; Zhang, Junwei
err分享
err收藏
Mastering Complex Control in MOBA Games with Deep Reinforcement Learning
err2020-04-03
err0
errOAAI
errDeheng Ye; Zhao Liu; Mingfei Sun; Bei Shi; Peilin Zhao; Hao Wu; Hongsheng Yu; Shaojie Yang; Xipeng Wu; Qingwei Guo; Qiaobo Chen; Yinyuting Yin; Hao Zhang; Tengfei Shi; Liang Wang; Qiang Fu; Wei Yang; Lanxiao Huang
err分享
err收藏
Human-level control through deep reinforcement learning通过深度强化学习实现人类层面的控制
err2015-02-25
err0
PREAI
errVolodymyr Mnih; Koray Kavukcuoglu; David Silver; Andrei A. Rusu; Joel Veness; Marc G. Bellemare; Alex Graves; Martin Riedmiller; Andreas K. Fidjeland; Georg Ostrovski; Stig Petersen; Charles Beattie; Amir Sadik; Ioannis Antonoglou; Helen King; Dharshan Kumaran; Daan Wierstra; Shane Legg; Demis Hassabis
err分享
err收藏
Actor-critic with familiarity-based trajectory experience replay
err2022-01-01
err0
PREAI
errXiaoyu Gong; Jiayu Yu; Shuai Lü; Hengwei Lu
err分享
err收藏
Reinforcement learning algorithms: A brief survey强化学习算法: 简要综述
err2023-11-01
err81
PREAI
errShakya, Ashish Kumar; Pillai, Gopinatha; Chakrabarty, Sohom
err分享
err收藏
学者 查看更多内容