返回
Generalizable Offline Multiobjective Reinforcement Learning via Preference-Conditioned Diffuser
DOI:10.1109/TNNLS.2025.3591838.png)
摘要
En 中文
多目标强化学习(MORL)通过学习针对多样化偏好的优化策略,来解决具有多个目标序贯决策问题。尽管传统方法需要与环境的昂贵在线交互,但近期的方法利用包含预收集轨迹的静态数据集,使得离线MORL成为实际应用的首选方案。然而,现有的离线MORL技术存在表达能力有限和在对分布外(OOD)偏好上泛化能力差的问题。为克服这些限制,我们提出了基于扩散的MORL(DiffMORL),一种适用于MORL的通用型扩散基规划框架。借助扩散模型的强大表达能力和生成能力,DiffMORL通过离线数据混合进一步提升了其泛化能力,这缓解了记忆现象并通过数据增强促进特征学习。通过在增强数据上进行训练,DiffMORL能够根据给定偏好(无论是分布内还是分布外)规划所需轨迹并提取对应动作。在MORL(D4MORL)基准数据集上的评估表明,DiffMORL在几乎所有任务中均取得了最先进的结果。值得注意的是,在18个分布外泛化指标中的14个上,它超越了最佳基线,突显了其在离线MORL场景下的卓越泛化能力。
Keyword:
Diffusion models
generalization
multiobjective reinforcement learning (MORL)
offline reinforcement learning (RL)
期刊
IF:
8.9
论文数:
7.5K
被引数:
7.2W
机构
引用论文
Multi-Objective Neural Evolutionary Algorithm for Combinatorial Optimization Problems求解组合优化问题的多目标神经进化算法
Adaptive reinforcement learning-based control using proximal policy optimization and slime mould algorithm with experimental tower crane system validation使用近端策略优化和煤泥模具算法的自适应强化学习控制,并通过实验塔式起重机系统验证
Gu, S.; Sel, B.; Ding, Y.; Wang, L.; Lin, Q.; Knoll, A.; Jin, M. Safe and Balanced: A Framework for Constrained Multi-Objective Reinforcement Learning. IEEE Trans. Pattern Anal. Mach. Intell. 2025, 47, 3322–3331. [Google Scholar] [CrossRef] [PubMed]Gu, S.; Sel, B.; Ding, Y.; Wang, L.; Lin, Q.; Knoll, A.; Jin, M. 安全与平衡:一种约束多目标强化学习框架。IEEE Trans. Pattern Anal. Mach. Intell. 2025, 47, 3322–3331. [Google Scholar] [CrossRef] [PubMed]

