arrow
返回

Mitigating OOD overoptimism via in-sample value function in offline reinforcement learning

delete2026-02-23
delete0
PRE
AI
刘文辉 封面图
刘文辉 (Wenhui Liu)
K
Kangyang Luo
Z
Zhijian Wu
S
Shanfeng Hao
DOI:10.1016/j.neunet.2026.108763delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
• 提出了一种新颖的方法,即样本内分位数价值正则化(IEVR),该方法将样本内价值函数识别为一种有效的自然约束,用于限制离线强化学习中的分布外高估。 • 建立了一个连接样本内学习与价值正则化方法的实用框架,既增强了样本内学习方法的扩展性,又简化了价值正则化方法的实现难度。 • 通过理论分析和广泛的实证评估证明了IEVR的有效性,并在D4RL基准测试的广泛任务中实现了最先进的表现。
Keyword:
IEVR
offline reinforcement learning
out-of-distribution overestimation
value regularization
in-sample value function

期刊

Neural Networks 封面图
Neural Networks
IF:
6.3
论文数:
8.2K
被引数:
3.0W

机构

E
east china normal university
学者数:
3.1W
论文数: 2.1W
被引数: 25
T
tsinghua university
学者数:
11.9W
论文数: 10.0W
被引数: 137
引用论文

引用论文

Diffusion policy distillation for offline reinforcement learning离线强化学习中的扩散策略蒸馏
err2025-10-01
err0
PREAI
errZhang,Jiazhi; Cheng,Yuhu; Chen,C.L. Philip; Zhang,Hengrui; Wang,Xuesong
err分享
err收藏
Are Expressive Models Truly Necessary for Offline RL?
err
err0
PREAI
errWang,Guan; Niu,Haoyi; Li,Jianxiong; Jiang,Li; Hu,Jianming; Zhan,Xianyuan
err分享
err收藏
Adaptive pessimism via target Q-value for offline reinforcement learning基于目标q值的自适应悲观离线强化学习
err2024-12-01
err0
errOAAI
errLiu, Jie; Zhang, Yinmin; Li, Chuming; Yang, Yaodong; Liu, Yu; Ouyang, Wanli
err分享
err收藏
Human-level control through deep reinforcement learning通过深度强化学习实现人类层面的控制
err2015-02-25
err0
PREAI
errVolodymyr Mnih; Koray Kavukcuoglu; David Silver; Andrei A. Rusu; Joel Veness; Marc G. Bellemare; Alex Graves; Martin Riedmiller; Andreas K. Fidjeland; Georg Ostrovski; Stig Petersen; Charles Beattie; Amir Sadik; Ioannis Antonoglou; Helen King; Dharshan Kumaran; Daan Wierstra; Shane Legg; Demis Hassabis
err分享
err收藏
Grandmaster level in StarCraft II using multi-agent reinforcement learning使用多智能体强化学习在星际争霸II中的大师水平
err2019-10-30
err0
PREAI
errOriol Vinyals; Igor Babuschkin; Wojciech M. Czarnecki; Michaël Mathieu; Andrew Dudzik; Junyoung Chung; David H. Choi; Richard Powell; Timo Ewalds; Petko Georgiev; Junhyuk Oh; Dan Horgan; Manuel Kroiss; Ivo Danihelka; Aja Huang; Laurent Sifre; Trevor Cai; John P. Agapiou; Max Jaderberg; Alexander S. Vezhnevets; Rémi Leblond; Tobias Pohlen; Valentin Dalibard; David Budden; Yury Sulsky; James Molloy; Tom L. Paine; Caglar Gulcehre; Ziyu Wang; Tobias Pfaff; Yuhuai Wu; Roman Ring; Dani Yogatama; Dario Wünsch; Katrina McKinney; Oliver Smith; Tom Schaul; Timothy Lillicrap; Koray Kavukcuoglu; Demis Hassabis; Chris Apps; David Silver
err分享
err收藏
QFAE: Q-Function guided Action Exploration for offline deep reinforcement learning
err2025-02-01
err0
PREAI
errPang, Teng; Wu, Guoqiang; Zhang, Yan; Wang, Bingzheng; Yin, Yilong
err分享
err收藏
Deep Reinforcement Learning for Autonomous Driving: A Survey用于自动驾驶的深度强化学习: 一项调查
err2022-06-01
err965
errOAAI
errKiran, B. Ravi; Sobh, Ibrahim; Talpaert, Victor; Mannion, Patrick; Al Sallab, Ahmad A.; Yogamani, Senthil; Perez, Patrick
err分享
err收藏
err分享
err收藏
学者 查看更多内容