arrow
Return

Cautious implicit value learning

delete2026-08-12
delete0
PRE
AI
K
Ke Jin
Y
Yuhu Cheng
Y
Yi Kong
C
C.L. Philip Chen
X
Xuesong Wang *
DOI:10.1016/j.neunet.2026.109511delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
<ul class="list"> <li class="react-xocs-list-item"><span class="list-label">•</span><span class="list-content"> <div class="u-margin-s-bottom" id="p0001"> A missing next-state constraint in the V-network loss is revealed, motivating a target V-network and a sample filtering for cautious value and policy updates. </div></span></li> <li class="react-xocs-list-item"><span class="list-label">•</span><span class="list-content"> <div class="u-margin-s-bottom" id="p0002"> Trajectory-position weighting is proposed to leverage trajectory information and dynamically adjust the V-network’s pessimistic/optimistic bias in a temporally fine-grained manner. </div></span></li> <li class="react-xocs-list-item"><span class="list-label">•</span><span class="list-content"> <div class="u-margin-s-bottom" id="p0003"> Negative-action penalty suppresses actions deemed unworthy and stochastically induces an approximate Actor gradient penalty; a floating term is introduced to increase its occurrence. </div></span></li> </ul>
Keywords:
Offline reinforcement learning
Implicit value learning
Target V-network
Advantage weight
Gradient penalty

Journal

Neural Networks cover
Neural Networks
IF:
6.3
Papers:
7.8K
Citations:
3.0W

Organization

S
School of Information and Control Engineering
Scholars:
111
Papers: 45
Citations: 0
S
School of Computer Science and Engineering
Scholars:
1.2K
Papers: 552
Citations: 2