arrow
返回

Multi-agent contrastive exploration via value decomposition discrepancy

delete2026-04-06
delete0
PRE
AI
S
Siying Wang
H
Hongfei Du
C
Chiyu Cai
Y
Yang Zhou
W
Wenyu Chen
J
Jinliang Shao
Y
Yuhua Cheng *
DOI:10.1016/j.neunet.2026.108929delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
值分解作为多智能体强化学习(MARL)中的一种因式分解方法,在许多有效的基于值的算法发展中产生了重要影响。关于值分解的现有研究若侧重表示能力,往往面临低样本效率问题,而其他因式分解方法也可能表示能力有限,这仍可能阻碍协作者发现最优联合动作。为通过无限联合状态-值函数增强智能体的探索,我们提出一种多智能体对比探索方法(MACE),利用值分解差异和对比原理。MACE基于不同值分解估计之间的差异确定更新权重,并将此差异作为更新过程中的内在目标。此外,MACE受此差异启发设计了探索偏好网络,在交互中明确调整智能体的探索偏好。通过矩阵博弈和星际争霸多智能体挑战中不同类型和难度的实验,我们证明MACE不仅在学习速度和最终性能上显著优于基线,而且有效维持了更高的表达力,代表了一种整合现有算法优势的创新解决方案。
Keyword:
Multi-Agent Reinforcement Learning
Value Decomposition
Contrastive Exploration
Joint Action
Sample Efficiency

期刊

Neural Networks 封面图
Neural Networks
IF:
6.3
论文数:
7.8K
被引数:
3.0W

机构

S
State Information Center
学者数:
2
论文数: 2
被引数: 0
U
university of electronic science and technology of china
学者数:
1.3W
论文数: 4.8K
被引数: 4
引用论文

引用论文

err分享
err收藏
Value-Decomposition Networks For Cooperative Multi-Agent Learning Based On Team Reward
err2018-07-09
err0
PREAI
errSunehag,Peter; Lever,Guy; Gruslys,Audrunas; Czarnecki,Wojciech Marian; Zambaldi,Vinicius; Jaderberg,Max; Lanctot,Marc; Sonnerat,Nicolas; Leibo,Joel Z.; Tuyls,Karl; Graepel,Thore
err分享
err收藏
Multi-agent dueling Q-learning with mean field and value decomposition
err2023-07-01
err5
PREAI
errDing, Shifei; Du, Wei; Ding, Ling; Guo, Lili; Zhang, Jian; An, Bo
err分享
err收藏
A survey and critique of multiagent deep reinforcement learning
err2019-10-16
err0
PREAI
errPablo Hernandez-Leal; Bilal Kartal; Matthew E. Taylor
err分享
err收藏
Human-level control through deep reinforcement learning通过深度强化学习实现人类层面的控制
err2015-02-25
err0
PREAI
errVolodymyr Mnih; Koray Kavukcuoglu; David Silver; Andrei A. Rusu; Joel Veness; Marc G. Bellemare; Alex Graves; Martin Riedmiller; Andreas K. Fidjeland; Georg Ostrovski; Stig Petersen; Charles Beattie; Amir Sadik; Ioannis Antonoglou; Helen King; Dharshan Kumaran; Daan Wierstra; Shane Legg; Demis Hassabis
err分享
err收藏
学者 查看更多内容