arrow
返回

Finite-Approximation-Error-Based Discrete-Time Iterative Adaptive Dynamic Programming

delete2014-12-01
delete173
PRE
AI
Q
Qinglai Wei *
F
Fei‐Yue Wang
D
Derong Liu
杨雄 (Xiong Yang)
DOI:10.1109/TCYB.2014.2354377delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
本文提出了一种新的迭代自适应动态规划 (ADP) 算法,用于解决具有有限逼近误差的无限水平离散时间非线性系统的最优控制问题。首先,开发了一种新的ADP的广义值迭代算法,以使迭代性能指标函数收敛到hamilton-jacobi-bellman方程的解。广义值迭代算法允许任意半正定函数初始化,克服了传统值迭代算法的缺点。当每次迭代中的迭代控制律和迭代性能指标函数不能精确获得时,首次建立了基于有限近似-误差的广义值迭代算法收敛准则的新设计方法。可以自适应地设计合适的近似误差,以使迭代性能指标函数收敛到最优性能指标函数的有限邻域。神经网络用于实现迭代ADP算法。最后,给出了两个仿真例子来说明所开发方法的性能。
Keyword:
Adaptive critic designs
adaptive dynamic programming (ADP)
approximate dynamic programming
approximation error
neural networks
neuro-dynamic programming
nonlinear systems
optimal control
reinforcement learning
value iteration
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

IEEE Transactions on Cybernetics 封面图
IEEE Transactions on Cybernetics
IF:
10.5
论文数:
1.1W
被引数:
5.0W

机构

C
chinese academy of sciences
学者数:
56.7W
论文数: 44.9W
被引数: 704
引用论文

引用论文

Accelerating the convergence of value iteration by using partial transition functions
err2013-08-01
err10
PREAI
errArruda, Edilson F.; Ourique, Fabricio O.; LaCombe, Jason; Almudevar, Anthony
err分享
err收藏
学者 查看更多内容