返回
Robust sequential decision-making in adversarial environments
DOI:10.1080/21642583.2026.2646376.png)
摘要
En 中文
强化学习(RL)代理在对抗性环境中往往失败,因为马尔可夫决策过程(MDP)的环境平稳性假设被违反。虽然针对这一场景的无模型解决方案已存在,但基于规划的对应方法仍较少被探索。本文在受威胁马尔可夫决策过程(TMDP)框架内引入了离线和在线值迭代算法,其中RL代理维护并更新对对手策略的贝叶斯信念。该信念被整合到修正的贝尔曼最优方程中,以计算鲁棒策略。我们使用随机对抗多智能体Coin Game对框架进行评估。主要发现是,基于模型的代理显著优于TMDP版本的无模型Q学习,证实了基于模型规划的优势从MDP扩展到了TMDP。此外,所提出的框架在系统转移函数未知时仍能保持对Q学习基线的性能优势。RL代理还表现出对直接对抗性交互的鲁棒性。本研究验证了TMDP值迭代作为对抗自适应对手的有效、基于规划的决策方法。
Keyword:
Dynamic programming
adversarial machine learning
multi-agent reinforcement learning
robust reinforcement learning
Bayesian reinforcement learning
期刊
S
IF:
0
论文数:
39
被引数:
0
机构
引用论文
Multi-Agent Reinforcement Learning in Partially Observable Environments Using Social Learning部分可观测环境下的多智能体强化学习与社会学习
Partially-Observable Security Games for Attack-Defence Analysis in Software Systems软件系统中基于攻击-防御分析的局部可观测安全博弈

