返回
Discrete-Time Local Value Iteration Adaptive Dynamic Programming: Convergence Analysis
DOI:10.1109/TSMC.2016.2623766.png)
摘要
En 中文
本文建立了新开发的离散时间局部值迭代自适应动态规划 (ADP) 算法的收敛性。本局部迭代ADP算法允许任意正半定函数初始化该算法。采用状态相关的学习率函数,首次可以在状态空间的子集而不是整个状态空间中更新迭代值函数和迭代控制律,有效地减轻了计算负担。提出了一种新的收敛性分析方法,证明了迭代值函数在一定的约束条件下收敛到最优值。给出了局部值迭代ADP算法的单调性,表明在初值函数和学习率函数的某些特殊条件下,迭代值函数可以单调收敛到最优。最后,给出了三个仿真例子并进行了比较,以说明所开发算法的性能。
Keyword:
Adaptive critic designs
adaptive dynamic programming (ADP)
approximate dynamic programming
local iteration
neural networks
neuro-dynamic programming
nonlinear systems
optimal control
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
10.5
论文数:
1.1W
被引数:
5.0W
机构
引用论文
Constrained Multilegged Robot System Modeling and Fuzzy Control With Uncertain Kinematics and Dynamics Incorporating Foot Force Optimization具有不确定运动学和动力学并结合脚力优化的约束多足机器人系统建模和模糊控制
Off-Policy Actor-Critic Structure for Optimal Control of Unknown Systems With Disturbances具有扰动的未知系统最优控制的非策略参与者-批评者结构
Infinite Horizon Self-Learning Optimal Control of Nonaffine Discrete-Time Nonlinear Systems非仿射离散非线性系统的无穷水平自学习最优控制
Finite-Approximation-Error-Based Discrete-Time Iterative Adaptive Dynamic Programming基于有限近似误差的离散时间迭代自适应动态规划
A novel policy iteration based deterministic Q-learning for discrete-time nonlinear systems基于策略迭代的离散时间非线性系统确定性Q学习

