返回
Adjustable behavior-guided adaptive dynamic programming for neural learning control
DOI:10.1016/j.neucom.2025.129986.png)
摘要
En 中文
本文设计了一种可调的行为引导自适应动态规划(BGADP)算法,用于解决离散时间系统的最优调节问题。在传统的自适应动态规划方法中,进行策略改进需要系统的梯度信息。然而,当无法计算梯度信息或系统动力学不可微时,这些方法面临挑战。为克服这些局限性,本文采用一种受人类行为启发的群智能方法,在迭代过程中搜索更优策略,从而无需梯度信息。此外,在值函数更新中引入松弛因子,以加速算法的收敛速度。文中严格分析了迭代值函数的单调性和收敛性。最后,通过两个基于神经网络actor-critic框架实现的仿真研究,验证了可调BGADP算法的有效性和实用性。
Keyword:
Adaptive dynamic programming
Brain storm optimization
Convergence rate
Neural networks
Optimal control
Swarm intelligence
期刊
IF:
6.5
论文数:
2.5W
被引数:
6.5W
机构
引用论文
Advanced value iteration for discrete-time intelligent critic control: A survey离散时间智能评论家控制的高级值迭代: 一项调查
System Stability of Learning-Based Linear Optimal Control With General Discounted Value Iteration具有一般折现值迭代的基于学习的线性最优控制的系统稳定性
Reinforcement-Learning-Based Robust Controller Design for Continuous-Time Uncertain Nonlinear Systems Subject to Input Constraints基于强化学习的具有输入约束的连续时间不确定非线性系统的鲁棒控制器设计
Recent Progress in Reinforcement Learning and Adaptive Dynamic Programming for Advanced Control Applications用于高级控制应用的强化学习和自适应动态规划的最新进展
Adaptive optimal control for reference tracking independent of exo-system dynamics
NEUROCOMPUTING
IF6.5

