返回
Knowledge guided deep deterministic policy gradient
DOI:10.1016/j.knosys.2025.113087.png)
摘要
En 中文
深度确定性策略梯度(DDPG)在处理连续状态和动作空间的复杂调节与控制问题上表现出色。然而,其试错交互和从零开始的学习需要代理进行广泛探索,导致学习效率低下,甚至在稀疏奖励环境中出现不收敛现象。为充分利用学习过程中的知识以提升效率和性能,本文借鉴人类学习方法,提出了一种基于语义知识引导的DDPG(KGDDPG)方法。在知识表示方面,考虑到语义知识具有模糊性和精确性,构建了一个基于规则框架结合精确命题和模糊命题的知识系统。在知识融合方面,为减少探索的随机性,提出了基于堆叠泛化的知识引导动作策略。此外,采用了一种监督-强化学习结合的方法:监督阶段快速融入先验知识以加速学习,强化阶段则优化策略网络,以克服仅依赖先验知识的局限性。最后,通过移动机器人无地图导航任务进行实验,验证了该方法的有效性和实际可行性。
Keyword:
Knowledge guide
Fuzzy system
Mapless navigation
DDPG
期刊
K
IF:
7.6
论文数:
1.3W
被引数:
4.5W
机构
暂无机构信息
引用论文
Collaborative Optimization of Energy Management Strategy and Adaptive Cruise Control Based on Deep Reinforcement Learning基于深度强化学习的能量管理策略与自适应巡航控制协同优化
Path-based multi-hop reasoning over knowledge graph for answering questions via adversarial reinforcement learning基于对抗强化学习的知识图谱路径多跳推理
Grasping Living Objects With Adversarial Behaviors Using Inverse Reinforcement Learning使用反向强化学习抓取具有对抗行为的生活对象
Autonomous Platoon Control With Integrated Deep Reinforcement Learning and Dynamic Programming集成深度强化学习和动态规划的自主排控
SADRL: Merging human experience with machine intelligence via supervised assisted deep reinforcement learning
NEUROCOMPUTING
IF6.5
An inverse reinforcement learning framework with the Q-learning mechanism for the metaheuristic algorithm用于元启发式算法的具有Q学习机制的逆强化学习框架

