arrow
返回

Task-Guided Multi-UAV Cooperative Multi-Target Tracking with Gaussian Process-Based Value Correction

delete2026-09-05
delete0
delete
OA
AI
李伟 (Wei Li) *
X
Xin Chen
X
Xuebing Li
DOI:10.3390/drones10090676delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
在部分可观测性、通信受限和障碍物约束下,多无人机协同跟踪多个地面目标仍具挑战性,这归因于复杂的目标关联、困难的任务交接、低层连续控制决策间的强耦合以及不稳定的评价价值估计。为解决这些问题,本文提出了一种分层引导与高斯过程修正的多智能体近端策略优化方法,简称HGP-MAPPO。基于集中训练与分散执行范式,HGP-MAPPO引入了由目标关联信息、任务交接与恢复提示、任务优先级和期望观测几何形状衍生出的低频任务引导信号。这些引导信号被整合为低层演员-评价者框架的条件输入,从而降低了联合处理目标跟踪、遮挡恢复、障碍物避障和光滑控制的策略学习难度。此外,为缓解复杂部分可观测条件下神经网络评价者中的局部估计偏差,设计了一种基于高斯过程的残差修正机制。具体而言,后验均值用于补偿价值残差,而后验不确定性自适应调节修正强度,提升了价值评估和策略优化的稳定性。采用稀疏诱导点近似控制训练阶段的计算成本,并在分散执行时移除高斯过程模块,因此不引入额外的在线推理开销。实验在标准障碍物和密集遮挡的多无人机多目标跟踪场景中进行,以DDPG-MHSA、MAPPO、MADDPG和MATD3作为基线。实验结果表明,HGP-MAPPO实现了更快的训练收敛、更高的平均回合奖励和改进的目标保持率,同时有效降低了无人机-目标距离波动和平均绝对时序差分(TD)误差。消融研究进一步证实了任务引导信号、高斯过程残差修正和不确定性感知加权对协同跟踪性能和训练稳定性的贡献。
Keyword:
multi-UAV systems
cooperative multi-target tracking
multi-agent reinforcement learning
task-guided control
Gaussian process
value correction

期刊

D
Drones
IF:
4.8
论文数:
3.9K
被引数:
8.3K

机构

N
nanjing university of aeronautics and astronautics
学者数:
3.7K
论文数: 1.2K
被引数: 1
引用论文

引用论文

Exploration in Deep Reinforcement Learning: From Single-Agent to Multiagent Domain
err2024-07-01
err41
errOAAI
errHao, Jianye; Yang, Tianpei; Tang, Hongyao; Bai, Chenjia; Liu, Jinyi; Meng, Zhaopeng; Liu, Peng; Wang, Zhen
err分享
err收藏
Adaptively Calibrated Critic Estimates for Deep Reinforcement Learning
err2023-02-01
err0
errOAAI
errNicolai Dorka; Tim Welschehold; Joschka Bodecker; Wolfram Burgard
err分享
err收藏
CTDS: Centralized Teacher With Decentralized Student for Multiagent Reinforcement Learning
err2024-03-01
err0
errOAAI
errJian Zhao; Xunhan Hu; Mingyu Yang; Wengang Zhou; Jiangcheng Zhu; Houqiang Li
err分享
err收藏
学者 查看更多内容