Return
Cautious implicit value learning
DOI:10.1016/j.neunet.2026.109511.png)
Abstract
En 中文
<ul class="list">
<li class="react-xocs-list-item"><span class="list-label">•</span><span class="list-content">
<div class="u-margin-s-bottom" id="p0001">
A missing next-state constraint in the V-network loss is revealed, motivating a target V-network and a sample filtering for cautious value and policy updates.
</div></span></li>
<li class="react-xocs-list-item"><span class="list-label">•</span><span class="list-content">
<div class="u-margin-s-bottom" id="p0002">
Trajectory-position weighting is proposed to leverage trajectory information and dynamically adjust the V-network’s pessimistic/optimistic bias in a temporally fine-grained manner.
</div></span></li>
<li class="react-xocs-list-item"><span class="list-label">•</span><span class="list-content">
<div class="u-margin-s-bottom" id="p0003">
Negative-action penalty suppresses actions deemed unworthy and stochastically induces an approximate Actor gradient penalty; a floating term is introduced to increase its occurrence.
</div></span></li>
</ul>
Keywords:
Offline reinforcement learning
Implicit value learning
Target V-network
Advantage weight
Gradient penalty
Journal
IF:
6.3
Papers:
7.8K
Citations:
3.0W

