arrow
返回

A Q-learning robot path planning algorithm based on improved reward function and exploration strategy

delete2026-04-12
delete0
PRE
AI
Z
Zhaojun Zhang *
G
Guangyang Liu
P
Peiye Cao
S
Shun Lu
DOI:10.1016/j.neucom.2026.133589delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
为克服传统Q学习在机器人路径规划中局部最优和探索受限的挑战,我们提出了一种融合碰撞检测与路径质量评估(REQL)的增强框架。首先,采用优先经验回放机制选择高价值样本,从而提高学习效率并加速收敛。其次,通过每时间步减去平均奖励实现奖励函数中心化,减少价值估计偏差并突出状态-动作对的相对差异。此外,引入路径质量函数奖励高质量轨迹,以提高后期训练稳定性。最后,实施碰撞日志记录易碰撞状态并防止训练中冗余碰撞。此外,引入碰撞检测以消除物理不可行动作,从而提升早期探索效率。在三种不同环境中的实验结果表明,REQL相比标准Q学习分别将平均路径长度降低2.19%和10.92%。REQL始终识别转弯显著更少的优化路径,从而提升路径规划准确性与效率。
Keyword:
Q-learning
path planning
reward function
exploration strategy
collision detection

期刊

Neurocomputing 封面图
Neurocomputing
IF:
6.5
论文数:
2.5W
被引数:
6.5W

机构

暂无机构信息
引用论文

引用论文

Depth Image Denoising Using Nuclear Norm and Learning Graph Model
err2020-12-17
err176
errOAAI
errYan, Chenggang; Li, Zhisheng; Zhang, Yongbing; Liu, Yutao; Ji, Xiangyang; Zhang, Yongdong
err分享
err收藏
Chaotic sequence-driven path planning for autonomous robot terrain coverage
err2025-04-01
err0
PREAI
errAbou-Bakr, Ehab; Alnajim, Abdullah M.; Alashwal, May; Elmanfaloty, Rania A.
err分享
err收藏
TMSTC*: A Path Planning Algorithm for Minimizing Turns in Multi-Robot Coverage
err2023-08-01
err0
PREAI
errJunjie Lu; Bi Zeng; Jingtao Tang; Tin Lun Lam; Junbin Wen
err分享
err收藏
A survey on model-based reinforcement learning基于模型的强化学习研究综述
err2024-01-23
err23
errOAAI
errLuo, Fan-Ming; Xu, Tian; Lai, Hang; Chen, Xiong-Hui; Zhang, Weinan; Yu, Yang
err分享
err收藏
err分享
err收藏
学者 查看更多内容