arrow
返回

Extending Evolution-Guided Policy Gradient Learning into the multi-objective domain

delete2025-07-01
delete0
delete
OA
AI
A
Adam Callaghan *
K
Karl Mason
DOI:10.1016/j.neucom.2025.129991delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
多目标强化学习(MORL)带来了显著挑战,主要是因为需要平衡冲突目标——这是传统单目标方法未能解决的问题。本文介绍了多目标进化强化学习(MO-ERL),这是进化强化学习(ERL)首次专门针对多目标领域的复杂性进行有效设计的适应性方案。MO-ERL将基于策略梯度的强化学习(RL)与进化算法(EAs)相结合,前者优化预期效用,后者在帕累托前沿上保持多样性。这种结合利用了RL在开发方面的优势以及EAs在探索方面的专长,使MO-ERL能够有效应对多目标优化问题固有的权衡关系。在MuJoCo物理引擎的多目标连续控制任务上的评估表明,MO-ERL优于当前最佳基线方法,实现了最高62.71%的更高超体积和196.28%的更大预期效用。这些结果验证了MO-ERL在平衡解的多样性与最优性方面的能力,为解决MORL任务设立了新的基准。
Keyword:
Evolutionary Reinforcement Learning
Multi-objective reinforcement learning
Genetic algorithm
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

Neurocomputing 封面图
Neurocomputing
IF:
6.5
论文数:
2.5W
被引数:
6.5W

机构

暂无机构信息
引用论文

引用论文

Human-level control through deep reinforcement learning通过深度强化学习实现人类层面的控制
err2015-02-25
err0
PREAI
errVolodymyr Mnih; Koray Kavukcuoglu; David Silver; Andrei A. Rusu; Joel Veness; Marc G. Bellemare; Alex Graves; Martin Riedmiller; Andreas K. Fidjeland; Georg Ostrovski; Stig Petersen; Charles Beattie; Amir Sadik; Ioannis Antonoglou; Helen King; Dharshan Kumaran; Daan Wierstra; Shane Legg; Demis Hassabis
err分享
err收藏
Deep Reinforcement Learning for Autonomous Driving: A Survey用于自动驾驶的深度强化学习: 一项调查
err2022-06-01
err965
errOAAI
errKiran, B. Ravi; Sobh, Ibrahim; Talpaert, Victor; Mannion, Patrick; Al Sallab, Ahmad A.; Yogamani, Senthil; Perez, Patrick
err分享
err收藏
A practical guide to multi-objective reinforcement learning and planning
err2022-04-13
err0
errOAAI
errConor F. Hayes; Roxana Rădulescu; Eugenio Bargiacchi; Johan Källström; Matthew Macfarlane; Mathieu Reymond; Timothy Verstraeten; Luisa M. Zintgraf; Richard Dazeley; Fredrik Heintz; Enda Howley; Athirai A. Irissappane; Patrick Mannion; Ann Nowé; Gabriel Ramos; Marcello Restelli; Peter Vamplew; Diederik M. Roijers
err分享
err收藏
Scalar reward is not enough: a response to Silver, Singh, Precup and Sutton (2021)标量奖励是不够的:对Silver、Singh、Precup和Sutton(2021)的回应
err2022-07-16
err0
errOAAI
errPeter Vamplew; Benjamin J. Smith; Johan Källström; Gabriel Ramos; Roxana Rădulescu; Diederik M. Roijers; Conor F. Hayes; Fredrik Heintz; Patrick Mannion; Pieter J. K. Libin; Richard Dazeley; Cameron Foale
err分享
err收藏
Reward is enough奖励就足够了
err2021-10-01
err254
errOAAI
errSilver, David; Singh, Satinder; Precup, Doina; Sutton, Richard S.
err分享
err收藏
没有更多内容