返回
Graph-based strategy evaluation for large-scale multiagent reinforcement learning
DOI:10.1007/s11432-024-4223-2.png)
摘要
En 中文
在大型多智能体系统中,多智能体强化学习(MARL)的实践应用因缺乏鲁棒性可靠性保证而受到阻碍。这一差距使得对MARL框架内策略评估的关注度提升,该领域在联合策略空间中面临可扩展性问题。为解决此问题,本文提出了一种新颖的两阶段基于图策略评估算法,该算法在不影响评估质量的前提下,显著降低了联合策略空间所需的样本容量。所提算法通过分层评估来压缩样本容量,并采用策略寻求模型利用最优响应寻求一个汇均衡(SE)联合策略。此外,开发了一种停止条件以实现近似全局最优的SE策略,同时考虑到基于最优响应算法的局部最优特性。案例研究表明,本算法相较于其他方法,以更优的样本效率实现了近似最优的SE联合策略。MARL方法与策略评估算法的集成被证明是构建可信MARL系统的有效途径。
Keyword:
strategy evaluation
large-scale multiagent reinforcement learning
graph grouping
best response
sink equilibrium

