返回
Asynchronous multi-agent deep reinforcement learning under partial observability
DOI:10.1177/02783649241306124.png)
摘要
En 中文
当前先进的多智能体强化学习(MARL)方法为多种复杂问题提供了有前景的解决方案。然而,这些方法均假设智能体以同步方式执行原始动作,这使其难以应用于需要智能体在可变时间跨度内异步选择动作的长时域现实世界多机器人任务。为解决此问题,我们首先提出了一组基于值函数的协同MARL方法,用于异步执行时序扩展宏动作。在此方法中,智能体在三种范式下使用宏动作值函数进行异步学习和决策:分布式学习与控制、集中式学习与控制以及为分布式执行进行集中式训练(CTDE)。在此基础上,我们在三种训练范式下制定了一套基于宏动作的策略梯度算法,其中智能体以异步方式直接优化其参数化策略。我们在仿真和真实机器人上对多种真实场景进行了方法评估。实验结果表明,我们的算法在大型多智能体问题中能够有效学习高质量且异步的宏动作解决方案,而这些问题先前无法通过基于原始动作的方法解决。所提出的方法代表了针对时序扩展动作的第一类通用MARL方法,并为该领域未来的方法奠定了基础。
Keyword:
Multi-agent
reinforcement learning
macro-actions
期刊
IF:
5
论文数:
2.4K
被引数:
1.5W
机构
暂无机构信息
引用论文
Learning Phrase Representations using RNN Encoder–Decoder for Statistical Machine Translation使用RNN编码器-解码器学习统计机器翻译的短语表示
Multi-agent reinforcement learning as a rehearsal for decentralized planning多智能体强化学习作为分散计划的演练
NEUROCOMPUTING
IF6.5

