arrow
返回

Robust sequential decision-making in adversarial environments

delete2026-05-23
delete0
delete
OA
AI
J
Jurij Ružejnikov *
T
Tatiana V. Guy
DOI:10.1080/21642583.2026.2646376delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
强化学习(RL)代理在对抗性环境中往往失败,因为马尔可夫决策过程(MDP)的环境平稳性假设被违反。虽然针对这一场景的无模型解决方案已存在,但基于规划的对应方法仍较少被探索。本文在受威胁马尔可夫决策过程(TMDP)框架内引入了离线和在线值迭代算法,其中RL代理维护并更新对对手策略的贝叶斯信念。该信念被整合到修正的贝尔曼最优方程中,以计算鲁棒策略。我们使用随机对抗多智能体Coin Game对框架进行评估。主要发现是,基于模型的代理显著优于TMDP版本的无模型Q学习,证实了基于模型规划的优势从MDP扩展到了TMDP。此外,所提出的框架在系统转移函数未知时仍能保持对Q学习基线的性能优势。RL代理还表现出对直接对抗性交互的鲁棒性。本研究验证了TMDP值迭代作为对抗自适应对手的有效、基于规划的决策方法。
Keyword:
Dynamic programming
adversarial machine learning
multi-agent reinforcement learning
robust reinforcement learning
Bayesian reinforcement learning

期刊

S
Systems Science & Control Engineering
IF:
0
论文数:
39
被引数:
0

机构

C
Czech Academy of Sciences
学者数:
2.7K
论文数: 1.1K
被引数: 4.4W
引用论文

引用论文

err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
err分享
err收藏
On a general concept of forgetting
err1993-10-01
err0
PREAI
errR. KULHAVÝ; M. B. ZARROP
err分享
err收藏
学者 查看更多内容