返回
Deep Q-Managed: a new framework for multi-objective deep reinforcement learning
DOI:10.3389/frai.2025.1683323.png)
摘要
En 中文
本文介绍了Deep Q-Managed;一种新颖的多目标强化学习(MORL)算法,旨在发现帕累托前沿内的所有策略。该方法通过整合深度学习技术,包括双网络和dueling网络,以有效缓解维度灾难和过估计偏差,从而增强多目标优化。Deep Q-Managed在确定性幕式环境中展现出高超的能力,能够获取非支配的多目标策略,并适应凸、凹或混合帕累托前沿的复杂性。在传统MORL基准测试(深海宝藏、富饶海宝藏和修改版富饶海宝藏)上的实验表明,该方法持续实现最大超体积值(例如,DST为1,155,BST为3,352,MBST为2,632),并定位所有帕累托前沿点。尽管该方法在机器人、金融和医疗保健等实际应用中表现出鲁棒性和通用性,但本研究验证目前仅限于确定性幕式设置,随机环境留待未来研究。
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
F
IF:
4.7
论文数:
2.5K
被引数:
4.4K
机构
引用论文
Smart material optimization using reinforcement learning in multi-dimensional self-assembly基于强化学习的多维自组装智能材料优化
food frontiers
IF2.9

