arrow
返回

Sample efficient reinforcement learning via low-rank regularization

delete2025-07-27
delete0
PRE
AI
J
Jiamin Liu
H
Heng Lian
DOI:10.1016/j.knosys.2025.114176delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
本文通过一个便于理论分析的简化设置,展示了低秩性在状态-动作值函数估计中的有用性。首先,基于标准函数分析结果,定义了低秩函数的概念。随后,提出了一种基于核范数惩罚序列估计的具体方法,该方法对低秩函数的估计自然导致对低秩矩阵的估计。为估计量建立了风险界,表明其收敛速度比未使用低秩性的标准估计量更快。通过几个模拟的玩具示例作为概念验证,展示了其在模拟中的性能。
Keyword:
low-rankness
state-action value function
nuclear-norm penalized estimation
risk bounds
convergence rates

期刊

K
Knowledge-Based Systems
IF:
7.6
论文数:
1.2W
被引数:
4.5W

机构

U
university of science and technology beijing
学者数:
1.3W
论文数: 4.5K
被引数: 2
引用论文

引用论文

暂无论文信息