返回
Extending Evolution-Guided Policy Gradient Learning into the multi-objective domain
DOI:10.1016/j.neucom.2025.129991.png)
摘要
En 中文
多目标强化学习(MORL)带来了显著挑战,主要是因为需要平衡冲突目标——这是传统单目标方法未能解决的问题。本文介绍了多目标进化强化学习(MO-ERL),这是进化强化学习(ERL)首次专门针对多目标领域的复杂性进行有效设计的适应性方案。MO-ERL将基于策略梯度的强化学习(RL)与进化算法(EAs)相结合,前者优化预期效用,后者在帕累托前沿上保持多样性。这种结合利用了RL在开发方面的优势以及EAs在探索方面的专长,使MO-ERL能够有效应对多目标优化问题固有的权衡关系。在MuJoCo物理引擎的多目标连续控制任务上的评估表明,MO-ERL优于当前最佳基线方法,实现了最高62.71%的更高超体积和196.28%的更大预期效用。这些结果验证了MO-ERL在平衡解的多样性与最优性方面的能力,为解决MORL任务设立了新的基准。
Keyword:
Evolutionary Reinforcement Learning
Multi-objective reinforcement learning
Genetic algorithm
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
6.5
论文数:
2.5W
被引数:
6.5W
机构
暂无机构信息
引用论文
Multi-Objective Reinforcement Learning Based on Decomposition: A Taxonomy and Framework基于分解的多目标强化学习:一种分类法和框架
Scalar reward is not enough: a response to Silver, Singh, Precup and Sutton (2021)标量奖励是不够的:对Silver、Singh、Precup和Sutton(2021)的回应
没有更多内容

