返回
Proximal policy optimization with reward-based prioritization
DOI:10.1016/j.eswa.2025.127659.png)
摘要
En 中文
PPO(Proximal Policy Optimization)算法是一种基于策略优化的深度强化学习算法,已取得卓越成果并得到广泛应用。尽管PPO算法广受欢迎,但其存在若干显著缺陷,包括对超参数的敏感性、收敛速度慢以及探索能力有限。近期研究中,代码级优化被提出以提升训练效率并取得了良好性能。本文提出了一种基于奖励优先级的近端策略优化算法(RP-PPO),该算法根据奖励对不同经验赋予不同优先级以更新策略,并寻找获得最高平均奖励的模型。我们还应用了包括归一化奖励和双学习率衰减等若干辅助技术来优化算法。最后,我们在Gym环境中的四个问题领域进行了一系列实验和测试,以证明我们算法的优越性。
Keyword:
Reinforcement learning
Proximal policy optimization
Prioritization
Policy gradient
Actor-critic
期刊
IF:
7.5
论文数:
3.0W
被引数:
10.2W
机构
暂无机构信息
引用论文
Deep multi-agent reinforcement learning for multi-level preventive maintenance in manufacturing systems面向制造系统多级预防性维护的深度多智能体强化学习
Application of deep reinforcement learning to intrusion detection for supervised problems深度强化学习在监督问题入侵检测中的应用

