返回
Sample efficient reinforcement learning via low-rank regularization
DOI:10.1016/j.knosys.2025.114176.png)
摘要
En 中文
本文通过一个便于理论分析的简化设置,展示了低秩性在状态-动作值函数估计中的有用性。首先,基于标准函数分析结果,定义了低秩函数的概念。随后,提出了一种基于核范数惩罚序列估计的具体方法,该方法对低秩函数的估计自然导致对低秩矩阵的估计。为估计量建立了风险界,表明其收敛速度比未使用低秩性的标准估计量更快。通过几个模拟的玩具示例作为概念验证,展示了其在模拟中的性能。
Keyword:
low-rankness
state-action value function
nuclear-norm penalized estimation
risk bounds
convergence rates
期刊
K
IF:
7.6
论文数:
1.2W
被引数:
4.5W
机构
引用论文
暂无论文信息

