返回
Mean-Field Deep Reinforcement Learning for Multi-Agent Path Finding
DOI:10.1109/LRA.2026.3669783.png)
摘要
En 中文
连续空间多智能体路径规划(MAPF)对深度强化学习(DRL)提出了严峻挑战,因为联合状态-动作空间呈指数级增长,且需要精细的智能体间协调。应用均值场近似可将输入复杂度从 $\mathcal {O}(N^{2}~d)$ 降至 $\mathcal {O}(Nd)$,但简单平均邻居可能会削弱关键局部交互,限制规划成功率。为解决此问题,我们提出均值场多智能体强化路径规划框架(MAMFRPF),该框架整合了均值场交互压缩、双流局部均值场批评器、信任域策略优化和稀疏奖励设计。双流批评器补偿了均值场平均造成的信息损失,在部分可观测性条件下将规划成功率提高了超过20个百分点,同时训练时间减少了约7%。信任域优化确保策略单调改进,而稀疏奖励机制加速了长时域的信用分配。在连续MAPF基准测试中的实验表明,MAMFRPF在成功率上比强基线提高了15%,能够随智能体密度扩展,并在多样化的空间布局中具有良好的泛化能力。
Keyword:
Mean-field reinforcement learning
multi-agent path finding
deep reinforcement learning
coordination and scalability
continuous control
期刊
I
IF:
5.3
论文数:
1.7K
被引数:
3.9W
机构
引用论文
Scaling Lifelong Multi-Agent Path Finding to More Realistic Settings: Research Challenges and Opportunities将终身多智能体路径规划扩展到更现实的场景:研究挑战与机遇
Cooperative Obstacle Avoidance of Unmanned System Swarm via Reinforcement Learning Under Unknown Environments基于强化学习的未知环境下无人系统集群协同避障

