arrow
返回

Knowledge guided deep deterministic policy gradient

delete2025-02-01
delete0
PRE
AI
P
Peng Qin
赵
赵涛 (Tao Zhao) *
DOI:10.1016/j.knosys.2025.113087delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
深度确定性策略梯度(DDPG)在处理连续状态和动作空间的复杂调节与控制问题上表现出色。然而,其试错交互和从零开始的学习需要代理进行广泛探索,导致学习效率低下,甚至在稀疏奖励环境中出现不收敛现象。为充分利用学习过程中的知识以提升效率和性能,本文借鉴人类学习方法,提出了一种基于语义知识引导的DDPG(KGDDPG)方法。在知识表示方面,考虑到语义知识具有模糊性和精确性,构建了一个基于规则框架结合精确命题和模糊命题的知识系统。在知识融合方面,为减少探索的随机性,提出了基于堆叠泛化的知识引导动作策略。此外,采用了一种监督-强化学习结合的方法:监督阶段快速融入先验知识以加速学习,强化阶段则优化策略网络,以克服仅依赖先验知识的局限性。最后,通过移动机器人无地图导航任务进行实验,验证了该方法的有效性和实际可行性。
Keyword:
Knowledge guide
Fuzzy system
Mapless navigation
DDPG

期刊

K
Knowledge-Based Systems
IF:
7.6
论文数:
1.3W
被引数:
4.5W

机构

暂无机构信息
引用论文

引用论文

SADRL: Merging human experience with machine intelligence via supervised assisted deep reinforcement learning
err2022-01-01
err12
PREAI
errLi, Xiaoshuang; Wang, Xiao; Zheng, Xinhu; Jin, Junchen; Huang, Yanhao; Zhang, Jun Jason; Wang, Fei-Yue
err分享
err收藏
MSN: Mapless Short-Range Navigation Based on Time Critical Deep Reinforcement Learning
err2023-08-01
err9
PREAI
errLi, Bohan; Huang, Zhelong; Chen, Tony Weitong; Dai, Tianlun; Zang, Yalei; Xie, Wenbin; Tian, Bo; Cai, Ken
err分享
err收藏
Exploration in deep reinforcement learning: A survey深度强化学习探索: 综述
err2022-09-01
err138
errOAAI
errLadosz, Pawel; Weng, Lilian; Kim, Minwoo; Oh, Hyondong
err分享
err收藏
学者 查看更多内容