返回
Improved maskable PPO for budget-constrained data-collection path planning
DOI:10.1007/s10586-026-06488-w.png)
摘要
En 中文
本研究针对空间异构环境中的预算受限数据收集问题,其中智能体必须在有限路径长度下选择高价值目标。我们将该任务表述为有限时间窗口的奖金收集路径规划问题,并将其建模为约束马尔可夫决策过程以进行策略学习。提出的改进可掩码近端策略优化(IM-PPO)框架集成了动作掩码、连续动作级价值权重、拉格朗日约束适应以及价值感知奖励塑形。我们在最大84×84网格环境中,针对150个目标对IM-PPO进行评估,并与基于PPO的消融实验、启发式加A*规划器以及OR-Tools加A*基线进行比较。在150目标设置下,IM-PPO在所有测试预算中均实现最佳价值覆盖,相比可掩码PPO提升6.1%至14.7%。结果表明,价值感知掩码强化学习可提升合成预算受限数据收集效果,而实际部署仍需更丰富的动力学、感知、不确定性和安全建模。
Keyword:
Deep reinforcement learning
Maskable PPO
Path planning
Spatial heterogeneity
Data collection
期刊
IF:
2.9
论文数:
232
被引数:
1.1K
机构
引用论文
A survey on approximability of traveling salesman problems using the TSP-T3CO definition scheme使用TSP-T3CO定义方案的旅行商问题近似可解性调查
A two-stage optimization method for unmanned aerial vehicle inspection of an oil and gas pipeline network
PETROLEUM SCIENCE
IF6.1
Constraints Driven Safe Reinforcement Learning for Autonomous Driving Decision-Making约束驱动的安全强化学习在自主驾驶决策中的应用
IEEE ACCESS
IF3.6
Task offloading for multi-UAV asset edge computing with deep reinforcement learning基于深度强化学习的多UAV资产边缘计算的任务卸载
Yu, C.; Velu, A.; Vinitsky, E.; Wang, Y.; Bayen, A.; Wu, Y. The Surprising Effectiveness of PPO in Cooperative Multi-Agent Games. Adv. Neural Inf. Process. Syst. 2021, 35, 24611–24624. [Google Scholar] [CrossRef]Yu, C.; Velu, A.; Vinitsky, E.; Wang, Y.; Bayen, A.; Wu, Y. PPO在合作多智能体游戏中的惊人有效性. Adv. Neural Inf. Process. Syst. 2021, 35, 24611–24624. [Google Scholar] [CrossRef]

