arrow
返回

Generalizable Offline Multiobjective Reinforcement Learning via Preference-Conditioned Diffuser

delete2025-10-13
delete0
PRE
AI
Y
Yuchen Xiao
L
Lei Yuan
L
Lihe Li
Z
Ziqian Zhang
Y
Yi-Chen Li
Y
Yang Yu
DOI:10.1109/TNNLS.2025.3591838delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
多目标强化学习(MORL)通过学习针对多样化偏好的优化策略,来解决具有多个目标序贯决策问题。尽管传统方法需要与环境的昂贵在线交互,但近期的方法利用包含预收集轨迹的静态数据集,使得离线MORL成为实际应用的首选方案。然而,现有的离线MORL技术存在表达能力有限和在对分布外(OOD)偏好上泛化能力差的问题。为克服这些限制,我们提出了基于扩散的MORL(DiffMORL),一种适用于MORL的通用型扩散基规划框架。借助扩散模型的强大表达能力和生成能力,DiffMORL通过离线数据混合进一步提升了其泛化能力,这缓解了记忆现象并通过数据增强促进特征学习。通过在增强数据上进行训练,DiffMORL能够根据给定偏好(无论是分布内还是分布外)规划所需轨迹并提取对应动作。在MORL(D4MORL)基准数据集上的评估表明,DiffMORL在几乎所有任务中均取得了最先进的结果。值得注意的是,在18个分布外泛化指标中的14个上,它超越了最佳基线,突显了其在离线MORL场景下的卓越泛化能力。
Keyword:
Diffusion models
generalization
multiobjective reinforcement learning (MORL)
offline reinforcement learning (RL)

期刊

IEEE Transactions on Neural Networks and Learning Systems 封面图
IEEE Transactions on Neural Networks and Learning Systems
IF:
8.9
论文数:
7.5K
被引数:
7.2W

机构

N
nanjing university
学者数:
7.8W
论文数: 5.6W
被引数: 87
引用论文

引用论文

Deep Learning for HDD Health Assessment: An Application Based on LSTM
err2022-01-01
err53
PREAI
errDe Santo, Aniello; Galli, Antonio; Gravina, Michela; Moscato, Vincenzo; Sperli, Giancarlo
err分享
err收藏
Multi-Objective Neural Evolutionary Algorithm for Combinatorial Optimization Problems求解组合优化问题的多目标神经进化算法
err2023-04-01
err68
PREAI
errShao, Yinan; Lin, Jerry Chun-Wei; Srivastava, Gautam; Guo, Dongdong; Zhang, Hongchun; Yi, Hu; Jolfaei, Alireza
err分享
err收藏
err
IF0
err
err0
errOAAI
err
err分享
err收藏
学者 查看更多内容