返回
Asynchronous self-triggered nash learning in distributed multiplayer systems
DOI:10.1016/j.neucom.2026.134446.png)
摘要
En 中文
稀疏通信网络阻碍了玩家之间的直接信息交换,导致基于同步更新的传统观测器设计失效,并使基于全连接网络的方法不切实际。为解决此问题,本文提出了一种基于异步触发观测器的离策略无模型强化学习算法,用于求解网络化多人系统中的纳什均衡。在受限通信拓扑下,玩家无法直接访问非邻接信息,设计了一种自触发观测器来估计所需不可及信息。此外,基于观测器的最大事件间间隔和哈密顿-雅可比-贝尔曼残差,构建了异步学习触发条件,使各玩家能够独立更新其控制策略。在巴拿赫空间框架下的理论分析确立了所提算法的收敛性,并通过仿真研究验证了其有效性。
Keyword:
Adaptive dynamic programming
Event-triggered
Non-zero-sum game
Asynchronous policy iteration

