arrow
返回

An Adaptive Exploration-Oriented Multi-Agent Co-Evolutionary Method Based on MATD3

delete2025-10-26
delete0
delete
OA
AI
S
Suyu Wang
Z
Zhentao Lyu
Q
Quan Yue
Q
Qichen Shang
Y
Ya Ke
F
Feng Gao *
DOI:10.3390/electronics14214181delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
随着人工智能的持续发展,强化学习(RL)在解决复杂序贯决策问题方面展现了显著潜力,并已应用于机器人、自动驾驶汽车和金融分析等多个领域。在各种RL范式之中,多智能体强化学习(MARL)因其能够管理多实体系统中的合作与竞争交互而备受关注。然而,主流MARL算法在训练稳定性和策略泛化方面仍面临严峻挑战,这些挑战源于环境非平稳性、策略耦合以及样本利用效率低下等因素。为缓解这些局限性,本研究提出了一种名为MATD3_AHD的改进算法,该算法基于MATD3框架扩展开发,整合了TD3和MADDPG原理。其目标在于提升复杂环境中智能体的学习效率与整体策略有效性。所提方法包含三个核心机制:(1)自适应探索策略(AEP),根据TD误差动态调整扰动幅度,以提升探索能力与训练稳定性;(2)分层采样策略(HSP),通过样本聚类和优先级回放增强经验利用;(3)动态延迟更新(DDU),基于批评网络误差自适应调节执行者更新频率,从而加速收敛并提高策略稳定性。在Multi-Agent Particle Environment(MPE)中多个基准任务上的实验表明,MATD3_AHD相较于MADDPG和MATD3等基线方法表现出更优性能。该算法在平均性能上超越基线方法——相较于MATD3提升5%,相较于MADDPG提升20%——实现了更快的收敛速度、更高的奖励值以及更稳定的策略学习,从而证实了其鲁棒性与泛化能力。
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

暂无期刊信息

机构

引用论文

引用论文

Research on Multi-Robot Formation Control Based on MATD3 Algorithm
err2023-01-31
err0
errOAAI
errConghang Zhou; Jianxing Li; Yujing Shi; Zhirui Lin
err分享
err收藏
A survey and critique of multiagent deep reinforcement learning
err2019-10-16
err0
PREAI
errPablo Hernandez-Leal; Bilal Kartal; Matthew E. Taylor
err分享
err收藏
Health-conscious deep reinforcement learning energy management for fuel cell buses integrating environmental and look-ahead road information
errENERGY
IF9.4
err2024-03-01
err30
PREAI
errJia, Chunchun; Zhou, Jiaming; He, Hongwen; Li, Jianwei; Wei, Zhongbao; Li, Kunang
err分享
err收藏
err2001-01-01
err0
PREAI
errRadford M. Neal
err分享
err收藏
Multi-Robot Flocking Control Based on Deep Reinforcement Learning
err2020-01-01
err52
errOAAI
errZhu, Pengming; Dai, Wei; Yao, Weijia; Ma, Junchong; Zeng, Zhiwen; Lu, Huimin
err分享
err收藏
学者 查看更多内容