返回
A Q-learning robot path planning algorithm based on improved reward function and exploration strategy
DOI:10.1016/j.neucom.2026.133589.png)
摘要
En 中文
为克服传统Q学习在机器人路径规划中局部最优和探索受限的挑战,我们提出了一种融合碰撞检测与路径质量评估(REQL)的增强框架。首先,采用优先经验回放机制选择高价值样本,从而提高学习效率并加速收敛。其次,通过每时间步减去平均奖励实现奖励函数中心化,减少价值估计偏差并突出状态-动作对的相对差异。此外,引入路径质量函数奖励高质量轨迹,以提高后期训练稳定性。最后,实施碰撞日志记录易碰撞状态并防止训练中冗余碰撞。此外,引入碰撞检测以消除物理不可行动作,从而提升早期探索效率。在三种不同环境中的实验结果表明,REQL相比标准Q学习分别将平均路径长度降低2.19%和10.92%。REQL始终识别转弯显著更少的优化路径,从而提升路径规划准确性与效率。
Keyword:
Q-learning
path planning
reward function
exploration strategy
collision detection
期刊
IF:
6.5
论文数:
2.5W
被引数:
6.5W
机构
暂无机构信息
引用论文
Path-planning method based on reinforcement learning for cooperative two-crane lift considering load constraint基于强化学习的考虑负载约束的协同双起重机吊装路径规划方法
An Improved Dyna-Q Algorithm for Mobile Robot Path Planning in Unknown Dynamic Environment未知动态环境下移动机器人路径规划的改进dyna-q算法
Multi-Agent Q-Learning for Real-Time Load Balancing User Association and Handover in Mobile Networks
Goal-driven navigation via variational sparse Q network and transfer learning基于变分稀疏Q网络和迁移学习的目标驱动导航
NEUROCOMPUTING
IF6.5

