返回
Adaptive mapless mobile robot navigation using deep reinforcement learning based improved TD3 algorithm
DOI:10.3389/frobt.2025.1625968.png)
摘要
En 中文
在无先验地图的未知环境中进行导航对移动机器人构成了重大挑战,原因在于稀疏奖励、动态障碍物以及有限的先验知识。本文提出了一种基于双延迟深度确定性策略梯度(TD3)算法的改进深度强化学习(DRL)框架,用于自适应无地图导航。除架构增强外,所提出的方法通过引入隐状态编码器与预测器模块,将高维传感器输入转换为紧凑嵌入,从而在理论上带来优势。这种紧凑表示降低了状态空间的有效维度,实现了更平滑的价值函数逼近,并缓解了演员-评论家方法中常见的过高估计误差。该方法利用隐空间中的预测误差衍生内在奖励,以促进对新状态的探索。内在奖励促使智能体优先探索不确定性高但信息量大的区域,在稀疏外在奖励信号下提升了探索效率并加速收敛。此外,通过最大均值差异(MMD)损失对隐空间进行正则化,实现了训练稳定性。MMD约束通过强制隐状态动态一致性,降低了目标值估计的方差,从而获得更稳定的策略更新。在模拟的ROS2/Gazebo环境中的实验结果表明,所提出的框架优于标准TD3及其他改进TD3变体。本模型实现了93.1%的成功率和6.8%的低碰撞率,反映了高效且安全的目标导向导航。这些发现证实,结合内在动机、结构化表示学习以及基于正则化的稳定性机制,能够为无地图移动机器人导航生成更鲁棒且泛化性更强的策略。
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
F
IF:
3
论文数:
514
被引数:
6.9K
机构
引用论文
Mobile robot navigation based on intrinsic reward mechanism with TD3 algorithm基于内在奖励机制的TD3算法移动机器人导航。Int. J. Adv. Robotic Syst. 21 (5), 17298806241292893
Tang, C.; Abbatematteo, B.; Hu, J.; Chandra, R.; Martín-Martín, R.; Stone, P. Deep Reinforcement Learning for Robotics: A Survey of Real-World Successes. arXiv 2024, arXiv:2408.03539. [Google Scholar] [CrossRef]Tang, C.; Abbatematteo, B.; Hu, J.; Chandra, R.; Martín-Martín, R.; Stone, P. 机器人深度强化学习:真实世界成功的综述。arXiv 2024, arXiv:2408.03539. [Google Scholar] [CrossRef]
Intelligent mobile robot navigation in unknown and complex environment using reinforcement learning technique
SCIENTIFIC REPORTS
IF3.9
A target-driven visual navigation method based on intrinsic motivation exploration and space topological cognition
SCIENTIFIC REPORTS
IF3.9
Deep Reinforcement Learning for Mapless Navigation of Autonomous Mobile Robot无地图导航的自主移动机器人深度强化学习。Int. J. Comput. Sci. Trends Comput. Commun. (IJCSTCC), 283–288

