返回
Shielding Twin Delayed Deep Deterministic Policy Gradient Algorithm for Optimal Operational Control
DOI:10.1109/tii.2026.3728036.png)
摘要
En 中文
本文针对复杂工业过程中的最优操作控制问题展开研究,重点在于自动确定设定点以提升系统性能。解决该问题的挑战包括确保操作安全、处理未知的非线性动态特性以及抑制强干扰。为应对这些挑战,我们提出了一种屏蔽型双子延迟深度确定性策略梯度强化学习算法。首先,通过由评价网络引导的深度执行者网络逼近最优设定点决策策略,该策略用于确定设定点并优化定义的性能指标。其次,通过近似模型计算安全动作集的边界,并设计屏蔽机制以保障系统操作的安全性。最后,在硬件在环数字孪生系统上开展实验,验证所提方法的有效性。
Keyword:
Complex industrial processes
hardware-in-the-loop
optimal operational control (OOC)
shielding twin delayed deep deterministic policy gradient (STD3)
setpoint decision
期刊
IF:
9.9
论文数:
8.5K
被引数:
6.0W
机构
引用论文
暂无论文信息

