返回
Regularized Q-Learning With Linear Function Approximation
DOI:10.1109/TAC.2025.3592801.png)
摘要
En 中文
我们考虑一种用于带正则化Q学习的线性函数近似的单循环算法。所提出的算法受到正则化Q学习的一种双层优化形式的启发,其中下级优化问题旨在识别满足Bellman递归最优性条件的价值函数近似,而上级优化问题旨在找到投影到基向量张成空间中的解。我们证明,在特定假设下,所提出的算法在马尔可夫噪声存在的情况下收敛到平稳点。此外,我们为从所提出算法中导出的策略提供了性能保证。
Keyword:
Linear function approximation
Q-learning
reinforcement learning
期刊
IF:
7
论文数:
1.3W
被引数:
6.7W
机构
引用论文
Fast gradient-descent methods for temporal-difference learning with linear function approximation具有线性函数逼近的时差学习的快速梯度下降方法

