arrow
返回

Double distillation network for multi-agent reinforcement learning

delete2026-03-23
delete0
PRE
AI
Y
Yang Zhou
S
Siying Wang *
W
Wenyu Chen
R
Ruoning Zhang
Z
Zhitong Zhao
Z
Zixuan Zhang
Z
Zijun Ma
DOI:10.1016/j.neucom.2026.133438delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
多智能体强化学习(MARL)通常在集中式训练和分布式执行(CTDE)框架下进行,以缓解环境非平稳性。然而,传统方法在执行过程中常受限于部分可观测性,导致智能体间出现累积间隙误差,阻碍了有效协同策略的发展。为解决此挑战,我们提出双蒸馏网络(DDN),其整合了两种互补的蒸馏模块,以在信息受限条件下促进鲁棒协调与高效协作。具体而言,外部蒸馏模块采用全局引导网络和局部策略网络,通过多级蒸馏促进知识转移,从而弥合全局训练与局部执行之间的差距。此外,内部蒸馏模块利用基于全局状态的内禀奖励增强智能体的探索能力。在StarCraft II和Predator–Prey基准上的实验结果表明,所提方法有效降低了固有误差,提升了探索效率,并显著改善了协同策略学习的质量。
Keyword:
Multi-agent reinforcement learning
Centralized training and decentralized execution
Knowledge distillation
Cooperative policy learning
Exploration efficiency

期刊

Neurocomputing 封面图
Neurocomputing
IF:
6.5
论文数:
2.5W
被引数:
6.5W

机构

U
university of electronic science and technology of china
学者数:
1.3W
论文数: 4.8K
被引数: 4
C
Chengdu University of Technology
学者数:
1.2W
论文数: 6.9K
被引数: 24
引用论文

引用论文

Symmetrical Learning and Transferring: Efficient Knowledge Distillation for Remote Sensing Image Classification
err
err0
PREAI
errSong,Huaxiang; Xie,Junping; Liang,Liang; Su,Yan; Xiao,Yao; Zhang,Xinyuan; Ouyang,Yuqi; Li,Xinling; Chen,Siyi; Li,Yucheng
err分享
err收藏
Knowledge Distillation: A Survey知识蒸馏: 一项调查
err2021-03-22
err1.5K
PREAI
errGou, Jianping; Yu, Baosheng; Maybank, Stephen J.; Tao, Dacheng
err分享
err收藏
Enhancing collaboration in multi-agent reinforcement learning with correlated trajectories
err2024-12-01
err0
PREAI
errWang, Siying; Du, Hongfei; Zhou, Yang; Zhao, Zhitong; Zhang, Ruoning; Chen, Wenyu
err分享
err收藏
Value-Decomposition Networks For Cooperative Multi-Agent Learning Based On Team Reward
err2018-07-09
err0
PREAI
errSunehag,Peter; Lever,Guy; Gruslys,Audrunas; Czarnecki,Wojciech Marian; Zambaldi,Vinicius; Jaderberg,Max; Lanctot,Marc; Sonnerat,Nicolas; Leibo,Joel Z.; Tuyls,Karl; Graepel,Thore
err分享
err收藏
err分享
err收藏
CTDS: Centralized Teacher With Decentralized Student for Multiagent Reinforcement Learning
err2024-03-01
err0
errOAAI
errJian Zhao; Xunhan Hu; Mingyu Yang; Wengang Zhou; Jiangcheng Zhu; Houqiang Li
err分享
err收藏
学者 查看更多内容