返回
Mitigating OOD overoptimism via in-sample value function in offline reinforcement learning
DOI:10.1016/j.neunet.2026.108763.png)
摘要
En 中文
• 提出了一种新颖的方法,即样本内分位数价值正则化(IEVR),该方法将样本内价值函数识别为一种有效的自然约束,用于限制离线强化学习中的分布外高估。
• 建立了一个连接样本内学习与价值正则化方法的实用框架,既增强了样本内学习方法的扩展性,又简化了价值正则化方法的实现难度。
• 通过理论分析和广泛的实证评估证明了IEVR的有效性,并在D4RL基准测试的广泛任务中实现了最先进的表现。
Keyword:
IEVR
offline reinforcement learning
out-of-distribution overestimation
value regularization
in-sample value function
期刊
IF:
6.3
论文数:
8.2K
被引数:
3.0W
机构
引用论文
Adaptive pessimism via target Q-value for offline reinforcement learning基于目标q值的自适应悲观离线强化学习
NEURAL NETWORKS
IF6.3
Kotb, M.; Weber, C.; Hafez, M.B.; Wermter, S. QT-TDM: Planning with transformer dynamics model and autoregressive q-learning. IEEE Robot. Autom. Lett. 2024, 10, 112–119. [Google Scholar] [CrossRef]Kotb, M.; Weber, C.; Hafez, M.B.; Wermter, S. QT-TDM: 基于Transformer动态模型和自回归Q学习的规划。IEEE Robot. Autom. Lett. 2024, 10, 112–119. [Google Scholar] [CrossRef]
Grandmaster level in StarCraft II using multi-agent reinforcement learning使用多智能体强化学习在星际争霸II中的大师水平
Nature
IF0
Model-Free Load Frequency Control of Nonlinear Power Systems Based on Deep Reinforcement Learning基于深度强化学习的非线性电力系统无模型负荷频率控制
QFAE: Q-Function guided Action Exploration for offline deep reinforcement learning
PATTERN RECOGNITION
IF7.6

