返回
Large Deviations and Optimal Control for Markov Decision Processes
DOI:10.1007/s00245-026-10446-8.png)
摘要
En 中文
本文研究了紧致空间上马尔可夫决策过程经验测度的大偏差渐近性质。基于风险敏感控制的研究结果,我们推导出状态-动作频率的大偏差上界,该上界在初始状态和策略上具有一致收敛性。通过对应速率函数的零点,用于刻画经验测度的聚点和其期望值。对于状态频率,我们还得到了大偏差下界,从而建立了受控的大偏差原理。文中还给出了奖励经验均值的结果。作为应用,我们证明了对于大偏差控制问题,存在一个ε-最优随机平稳策略。
Keyword:
Markov decision process
Risk-sensitive control
Large deviations
State-action frequencies
期刊
A
IF:
1.7
论文数:
129
被引数:
0

