返回
Task-Guided Multi-UAV Cooperative Multi-Target Tracking with Gaussian Process-Based Value Correction
DOI:10.3390/drones10090676.png)
摘要
En 中文
在部分可观测性、通信受限和障碍物约束下,多无人机协同跟踪多个地面目标仍具挑战性,这归因于复杂的目标关联、困难的任务交接、低层连续控制决策间的强耦合以及不稳定的评价价值估计。为解决这些问题,本文提出了一种分层引导与高斯过程修正的多智能体近端策略优化方法,简称HGP-MAPPO。基于集中训练与分散执行范式,HGP-MAPPO引入了由目标关联信息、任务交接与恢复提示、任务优先级和期望观测几何形状衍生出的低频任务引导信号。这些引导信号被整合为低层演员-评价者框架的条件输入,从而降低了联合处理目标跟踪、遮挡恢复、障碍物避障和光滑控制的策略学习难度。此外,为缓解复杂部分可观测条件下神经网络评价者中的局部估计偏差,设计了一种基于高斯过程的残差修正机制。具体而言,后验均值用于补偿价值残差,而后验不确定性自适应调节修正强度,提升了价值评估和策略优化的稳定性。采用稀疏诱导点近似控制训练阶段的计算成本,并在分散执行时移除高斯过程模块,因此不引入额外的在线推理开销。实验在标准障碍物和密集遮挡的多无人机多目标跟踪场景中进行,以DDPG-MHSA、MAPPO、MADDPG和MATD3作为基线。实验结果表明,HGP-MAPPO实现了更快的训练收敛、更高的平均回合奖励和改进的目标保持率,同时有效降低了无人机-目标距离波动和平均绝对时序差分(TD)误差。消融研究进一步证实了任务引导信号、高斯过程残差修正和不确定性感知加权对协同跟踪性能和训练稳定性的贡献。
Keyword:
multi-UAV systems
cooperative multi-target tracking
multi-agent reinforcement learning
task-guided control
Gaussian process
value correction
期刊
D
IF:
4.8
论文数:
3.9K
被引数:
8.3K
机构
引用论文
Communication and Control in Collaborative UAVs: Recent Advances and Future Trends协作无人机中的通信与控制: 最新进展和未来趋势
Multi-UAV Cooperative Search in Partially Observable Low-Altitude Environments Based on Deep Reinforcement Learning基于深度强化学习的部分可观测低空环境多无人机协同搜索
Drones
IF4.8

