arrow
返回

Improved maskable PPO for budget-constrained data-collection path planning

delete2026-08-17
delete0
PRE
AI
J
Jiayi Miao
G
Guangyu Liu *
S
Shikai Wu
L
Ling Zhu
W
Wujia Yu
Q
Qiang Zhou
DOI:10.1007/s10586-026-06488-wdelete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
本研究针对空间异构环境中的预算受限数据收集问题,其中智能体必须在有限路径长度下选择高价值目标。我们将该任务表述为有限时间窗口的奖金收集路径规划问题,并将其建模为约束马尔可夫决策过程以进行策略学习。提出的改进可掩码近端策略优化(IM-PPO)框架集成了动作掩码、连续动作级价值权重、拉格朗日约束适应以及价值感知奖励塑形。我们在最大84×84网格环境中,针对150个目标对IM-PPO进行评估,并与基于PPO的消融实验、启发式加A*规划器以及OR-Tools加A*基线进行比较。在150目标设置下,IM-PPO在所有测试预算中均实现最佳价值覆盖,相比可掩码PPO提升6.1%至14.7%。结果表明,价值感知掩码强化学习可提升合成预算受限数据收集效果,而实际部署仍需更丰富的动力学、感知、不确定性和安全建模。
Keyword:
Deep reinforcement learning
Maskable PPO
Path planning
Spatial heterogeneity
Data collection

期刊

Journal of International Entrepreneurship 封面图
Journal of International Entrepreneurship
IF:
2.9
论文数:
232
被引数:
1.1K

机构

S
School of Automation
学者数:
741
论文数: 290
被引数: 0
S
School of Life Sciences
学者数:
3.9K
论文数: 1.2K
被引数: 9
学者 查看更多机构
引用论文

引用论文

Classical and Heuristic Approaches for Mobile Robot Path Planning: A Survey
err2023-06-27
err0
errOAAI
errJaafar Ahmed Abdulsaheb; Dheyaa Jasim Kadhim
err分享
err收藏
Human-level control through deep reinforcement learning通过深度强化学习实现人类层面的控制
err2015-02-25
err0
PREAI
errVolodymyr Mnih; Koray Kavukcuoglu; David Silver; Andrei A. Rusu; Joel Veness; Marc G. Bellemare; Alex Graves; Martin Riedmiller; Andreas K. Fidjeland; Georg Ostrovski; Stig Petersen; Charles Beattie; Amir Sadik; Ioannis Antonoglou; Helen King; Dharshan Kumaran; Daan Wierstra; Shane Legg; Demis Hassabis
err分享
err收藏
A two-stage optimization method for unmanned aerial vehicle inspection of an oil and gas pipeline network
err2019-03-13
err23
errOAAI
errYan, Yamin; Liang, Yongtu; Zhang, Haoran; Zhang, Wan; Feng, Huixia; Wang, Bohong; Liao, Qi
err分享
err收藏
Non-Standard Map Robot Path Planning Approach Based on Ant Colony Algorithms
errSENSORS
IF3.5
err2023-08-29
err4
errOAAI
errLi, Feng; Kim, Young-Chul; Xu, Boyin
err分享
err收藏
学者 查看更多内容