arrow
返回

Adaptive mapless mobile robot navigation using deep reinforcement learning based improved TD3 algorithm

delete2025-12-18
delete0
delete
OA
AI
S
Shoaib Mohd Nasti *
Z
Zahoor Ahmad Najar
M
Mohammad Ahsan Chishti
DOI:10.3389/frobt.2025.1625968delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
在无先验地图的未知环境中进行导航对移动机器人构成了重大挑战,原因在于稀疏奖励、动态障碍物以及有限的先验知识。本文提出了一种基于双延迟深度确定性策略梯度(TD3)算法的改进深度强化学习(DRL)框架,用于自适应无地图导航。除架构增强外,所提出的方法通过引入隐状态编码器与预测器模块,将高维传感器输入转换为紧凑嵌入,从而在理论上带来优势。这种紧凑表示降低了状态空间的有效维度,实现了更平滑的价值函数逼近,并缓解了演员-评论家方法中常见的过高估计误差。该方法利用隐空间中的预测误差衍生内在奖励,以促进对新状态的探索。内在奖励促使智能体优先探索不确定性高但信息量大的区域,在稀疏外在奖励信号下提升了探索效率并加速收敛。此外,通过最大均值差异(MMD)损失对隐空间进行正则化,实现了训练稳定性。MMD约束通过强制隐状态动态一致性,降低了目标值估计的方差,从而获得更稳定的策略更新。在模拟的ROS2/Gazebo环境中的实验结果表明,所提出的框架优于标准TD3及其他改进TD3变体。本模型实现了93.1%的成功率和6.8%的低碰撞率,反映了高效且安全的目标导向导航。这些发现证实,结合内在动机、结构化表示学习以及基于正则化的稳定性机制,能够为无地图移动机器人导航生成更鲁棒且泛化性更强的策略。
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

F
Frontiers in Robotics and AI
IF:
3
论文数:
514
被引数:
6.9K

机构

N
National Institute of Technology
学者数:
1.7K
论文数: 838
被引数: 2.1K
C
Central University of Kashmir
学者数:
250
论文数: 189
被引数: 278
引用论文

引用论文

err
IF0
err
err0
errOAAI
err
err分享
err收藏
Cognition-Driven Structural Prior for Instance-Dependent Label Transition Matrix Estimation
err2025-02-01
err24
PREAI
errZhang, Ruiheng; Cao, Zhe; Yang, Shuo; Si, Lingyu; Sun, Haoyang; Xu, Lixin; Sun, Fuchun
err分享
err收藏
学者 查看更多内容