返回
Multi-Agent Reinforcement Learning via Agent-Specific Preference
DOI:10.1109/tase.2026.3722633.png)
摘要
En 中文
多智能体强化学习(MARL)是解决复杂协作任务的有力框架,但高度依赖定义良好的全局奖励函数。设计此类奖励具有挑战性,特别是在异构智能体系统中,单一标量目标可能无法捕捉多样化行为。本文引入多智能体偏好集成学习(MAGPIE),通过智能体特定的偏好建模解决这些挑战。每个智能体通过偏好信号由专属专家评估,无需全局评估。我们从理论上证明,优化这些去中心化偏好收敛至纳什均衡策略。为将局部偏好整合为统一全局目标,我们基于偏好数据构建智能体特定奖励模型,并通过单调聚合机制将其结合。进一步证明优化此聚合奖励模型等价于训练纳什均衡策略。在基准多智能体任务和顺序生产线任务上的广泛实验表明,MAGPIE的性能可比拟奖励工程基准,展示了其在精确奖励工程不切实际的场景下促进策略学习的潜力。实践者注—多智能体系统在现代工程应用中广泛使用。例如,自动驾驶车队协调以避免碰撞并保持效率,工业生产线协同工作以满足生产目标而不导致缓冲区溢出。多智能体强化学习(MARL)为促进此类协作提供了有力框架,但其成功高度依赖精心设计的奖励函数。设计这些奖励往往具有挑战性,尤其是当智能体扮演不同角色时,难以将复杂交互和多样化智能体行为转化为精确数值信号。相比之下,提供关于偏好行为的比较反馈通常比指定显式数学奖励更直观。本文引入多智能体偏好集成学习(MAGPIE),一个利用智能体特定偏好信号的多智能体学习框架。MAGPIE学习智能体特定奖励模型,并通过单调聚合将其整合为统一全局目标。通过优化此目标,可推导出纳什均衡解。重要地,偏好可由轻量级自动化规则或领域特定启发式方法提供,无需昂贵的人工标注。MAGPIE有效、易于实现,特别适用于传统奖励设计不切实际的复杂系统。
Keyword:
Reinforcement learning
multi-agent system
preference-based optimization
Nash equilibrium
期刊
IF:
6.4
论文数:
5.1K
被引数:
1.6W
机构
引用论文
暂无论文信息

