返回
Multi-agent contrastive exploration via value decomposition discrepancy
DOI:10.1016/j.neunet.2026.108929.png)
摘要
En 中文
值分解作为多智能体强化学习(MARL)中的一种因式分解方法,在许多有效的基于值的算法发展中产生了重要影响。关于值分解的现有研究若侧重表示能力,往往面临低样本效率问题,而其他因式分解方法也可能表示能力有限,这仍可能阻碍协作者发现最优联合动作。为通过无限联合状态-值函数增强智能体的探索,我们提出一种多智能体对比探索方法(MACE),利用值分解差异和对比原理。MACE基于不同值分解估计之间的差异确定更新权重,并将此差异作为更新过程中的内在目标。此外,MACE受此差异启发设计了探索偏好网络,在交互中明确调整智能体的探索偏好。通过矩阵博弈和星际争霸多智能体挑战中不同类型和难度的实验,我们证明MACE不仅在学习速度和最终性能上显著优于基线,而且有效维持了更高的表达力,代表了一种整合现有算法优势的创新解决方案。
Keyword:
Multi-Agent Reinforcement Learning
Value Decomposition
Contrastive Exploration
Joint Action
Sample Efficiency
期刊
IF:
6.3
论文数:
7.8K
被引数:
3.0W
机构
引用论文
Causal inference multi-agent reinforcement learning for traffic signal control交通信号控制的因果推理多智能体强化学习
INFORMATION FUSION
IF15.5
Game of Drones: Multi-UAV Pursuit-Evasion Game With Online Motion Planning by Deep Reinforcement Learning无人机游戏: 通过深度强化学习进行在线运动规划的多无人机追逃游戏
Multi-agent reinforcement learning for cooperative lane changing of connected and autonomous vehicles in mixed traffic混合交通下互联自主车辆协同换道的多智能体强化学习
QDAP: Downsizing adaptive policy for cooperative multi-agent reinforcement learningQDAP: 协作多智能体强化学习的精简自适应策略

