arrow
返回

Asynchronous multi-agent deep reinforcement learning under partial observability

delete2025-02-06
delete0
PRE
AI
Y
Yuchen Xiao *
W
Weihao Tan
J
Joshua Hoffman
T
Tian Xia
C
Christopher Amato
DOI:10.1177/02783649241306124delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
当前先进的多智能体强化学习(MARL)方法为多种复杂问题提供了有前景的解决方案。然而,这些方法均假设智能体以同步方式执行原始动作,这使其难以应用于需要智能体在可变时间跨度内异步选择动作的长时域现实世界多机器人任务。为解决此问题,我们首先提出了一组基于值函数的协同MARL方法,用于异步执行时序扩展宏动作。在此方法中,智能体在三种范式下使用宏动作值函数进行异步学习和决策:分布式学习与控制、集中式学习与控制以及为分布式执行进行集中式训练(CTDE)。在此基础上,我们在三种训练范式下制定了一套基于宏动作的策略梯度算法,其中智能体以异步方式直接优化其参数化策略。我们在仿真和真实机器人上对多种真实场景进行了方法评估。实验结果表明,我们的算法在大型多智能体问题中能够有效学习高质量且异步的宏动作解决方案,而这些问题先前无法通过基于原始动作的方法解决。所提出的方法代表了针对时序扩展动作的第一类通用MARL方法,并为该领域未来的方法奠定了基础。
Keyword:
Multi-agent
reinforcement learning
macro-actions

期刊

International Journal of Robotics Research 封面图
International Journal of Robotics Research
IF:
5
论文数:
2.4K
被引数:
1.5W

机构

暂无机构信息
引用论文

引用论文

err分享
err收藏
Policy Search for Multi-Robot Coordination under Uncertainty
err2015-07-13
err0
errOAAI
errChristopher Amato; George Konidaris; Ariel Anders; Gabriel Cruz; Jonathan How; Leslie Kaelbling
err分享
err收藏
Counterfactual Multi-Agent Policy Gradients
err2018-04-29
err0
errOAAI
errJakob Foerster; Gregory Farquhar; Triantafyllos Afouras; Nantas Nardelli; Shimon Whiteson
err分享
err收藏
err分享
err收藏
err分享
err收藏
Online Planning for Target Object Search in Clutter under Partial Observability
err2019-05-01
err0
PREAI
errYuchen Xiao; Sammie Katt; Andreas ten Pas; Shengjian Chen; Christopher Amato
err分享
err收藏
学者 查看更多内容