返回
Policy-Adjustable Q-Learning for Data-Driven Nonlinear Optimal Tracking Control
DOI:10.1109/tnnls.2026.3672136.png)
摘要
En 中文
本文研究了一种新颖的政策可调Q学习(PA-QL)算法,旨在解决非线性离散时间(DT)系统的最优跟踪控制(OTC)问题,并增强其适应性和灵活性。提出了一种新颖的迭代方案,将控制权重整合到扩展神经网络(NN)的输入中,从而重新构建学习过程,以明确地将最优策略表征为可调权重的函数。因此,学习到的控制策略不受预设权重的约束,允许在离线训练完成后进行动态调整。此外,这种调整可以无缝在线执行,为适应操作条件或控制目标的变化提供了显著更大的灵活性。最后,通过严谨的理论分析和仿真研究验证了所提出算法的有效性。
Keyword:
Artificial neural networks
Q-learning
Optimal control
Training
Cost function
Vectors
Approximation algorithms
Switches
Data models
Computational modeling
Adaptive dynamic programming (ADP)
neural network (NN)
optimal tracking control (OTC)
policy adjustable
期刊
IF:
8.9
论文数:
7.6K
被引数:
7.2W
机构
引用论文
暂无论文信息

