arrow
返回

Large Deviations and Optimal Control for Markov Decision Processes

delete2026-05-06
delete0
PRE
AI
L
Lu, Xiaoyang *
J
Jing Chen
DOI:10.1007/s00245-026-10446-8delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
本文研究了紧致空间上马尔可夫决策过程经验测度的大偏差渐近性质。基于风险敏感控制的研究结果,我们推导出状态-动作频率的大偏差上界,该上界在初始状态和策略上具有一致收敛性。通过对应速率函数的零点,用于刻画经验测度的聚点和其期望值。对于状态频率,我们还得到了大偏差下界,从而建立了受控的大偏差原理。文中还给出了奖励经验均值的结果。作为应用,我们证明了对于大偏差控制问题,存在一个ε-最优随机平稳策略。
Keyword:
Markov decision process
Risk-sensitive control
Large deviations
State-action frequencies

期刊

A
APPLIED MATHEMATICS AND OPTIMIZATION
IF:
1.7
论文数:
129
被引数:
0

机构

T
tsinghua university
学者数:
11.9W
论文数: 10.0W
被引数: 137
引用论文

引用论文

Probability
err
IF0
err2019-04-05
err0
PREAI
errRick Durrett
err分享
err收藏
Ergodic risk-sensitive control-A survey
err2023-01-01
err5
errOAAI
errBiswas, Anup; Borkar, Vivek S.
err分享
err收藏
Connections between stochastic control and dynamic games
err1996-12-01
err0
PREAI
errPaolo Dai Pra; Lorenzo Meneghini; Wolfgang J. Runggaldier
err分享
err收藏
学者 查看更多内容