返回
POLICY GRADIENT ALGORITHMS FOR ROBUST MDPs WITH NONRECTANGULAR UNCERTAINTY SETS
DOI:10.1137/24M1631250.png)
摘要
En 中文
我们提出了针对具有非矩形不确定性集的鲁棒无限时域马尔可夫决策过程(MDP)的策略梯度算法,从而解决了鲁棒MDP文献中的一个开放性挑战。实际上,具有统计最优性性质并充分利用有限数据的不确定性集往往不是矩形的。不幸的是,相应的鲁棒MDP无法用动态规划技术求解,并且事实上已被证明是不可处理的。我们首先提出了一种随机投影朗之万动力学算法,可以全局最优地解决鲁棒策略评估问题,但效率低下。我们还提出了一种确定性策略梯度方法,其效率较高,但只能近似解决鲁棒策略评估问题,并证明近似误差与不确定性集的非矩形性新度量成比例。最后,我们描述了一种演员-评论家算法,能够在 \scrO(1/\epsilon4) 次迭代中找到鲁棒策略改进问题的 \epsilon-最优解。因此,我们提出了针对具有非矩形不确定性集的鲁棒MDP的第一个完整解决方案,并提供全局最优性保证。数值实验表明,我们的算法优于当前最先进的方法。
Keyword:
robust Markov decision processes
policy gradient
nonrectangular uncertainty sets
期刊
IF:
2.3
论文数:
27
被引数:
1.0W
机构
引用论文
暂无论文信息

