arrow
返回

Policy-Adjustable Q-Learning for Data-Driven Nonlinear Optimal Tracking Control

delete2026-03-01
delete0
PRE
AI
J
Jiaoyuan Chen
D
Dawei Gong *
Y
Yuyang Zhao
S
Shijie Song
M
Minglei Zhu
DOI:10.1109/tnnls.2026.3672136delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
本文研究了一种新颖的政策可调Q学习(PA-QL)算法,旨在解决非线性离散时间(DT)系统的最优跟踪控制(OTC)问题,并增强其适应性和灵活性。提出了一种新颖的迭代方案,将控制权重整合到扩展神经网络(NN)的输入中,从而重新构建学习过程,以明确地将最优策略表征为可调权重的函数。因此,学习到的控制策略不受预设权重的约束,允许在离线训练完成后进行动态调整。此外,这种调整可以无缝在线执行,为适应操作条件或控制目标的变化提供了显著更大的灵活性。最后,通过严谨的理论分析和仿真研究验证了所提出算法的有效性。
Keyword:
Artificial neural networks
Q-learning
Optimal control
Training
Cost function
Vectors
Approximation algorithms
Switches
Data models
Computational modeling
Adaptive dynamic programming (ADP)
neural network (NN)
optimal tracking control (OTC)
policy adjustable

期刊

IEEE Transactions on Neural Networks and Learning Systems 封面图
IEEE Transactions on Neural Networks and Learning Systems
IF:
8.9
论文数:
7.6K
被引数:
7.2W

机构

S
Southwest Jiaotong University
学者数:
2.0K
论文数: 564
被引数: 0
U
University of Electronic Science and Technology of China
学者数:
2.0K
论文数: 626
被引数: 0
引用论文

引用论文

暂无论文信息