返回
Reinforcement Learning and Adaptive Dynamic Programming for Feedback Control
DOI:10.1109/MCAS.2009.933854.png)
摘要
En 中文
生物体通过作用于环境来学习,观察由此产生的奖励刺激,并相应地调整其行为以提高奖励。这种基于动作的学习或强化学习可以捕捉自然系统中发生的最佳行为的概念。我们描述了用于强化学习的数学公式和一种称为自适应动态编程的实用实现方法。这些使我们深入了解了既学习又表现出最佳行为的人造工程系统的控制器设计。
Keyword:
NEURAL-NETWORK
CONTINUOUS-TIME
CONVERGENCE
NEUROCONTROL
SYSTEMS
REWARD
期刊
IF:
3.5
论文数:
525
被引数:
1.3K
机构
引用论文
Adaptive-critic based optimal neuro control synthesis for distributed parameter systems
AUTOMATICA
IF5.9

