arrow
返回

Exploring reinforcement learning in process control: a comprehensive survey

delete2025-03-02
delete2
PRE
AI
N
N. Rajasekhar
T
T. K. Radhakrishnan *
S
Samsudeen Naina Mohamed
DOI:10.1080/00207721.2025.2469821delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
强化学习(RL)是一种机器学习方法论,通过试错技术发展在复杂问题中制定序列决策的能力。RL在工业过程、生化系统和能源管理等领域日益广泛地应用于决策与控制任务。本文献综述对强化学习的发展、模型、算法及实际应用进行了全面考察,并特别强调其在过程控制中的应用。该研究考察了强化学习的基本理论、方法与应用,将其分为两类:经典强化学习(如马尔可夫决策过程(MDP))和深度强化学习(如演员-评论家方法)。强化学习是多个流程工业讨论的主题,包括工业化工过程控制、生化过程控制、能源系统、废水处理以及油气行业。然而,本文也指出了阻碍其更广泛应用挑战,包括对大规模计算资源的需求、模拟真实环境设置的复杂性,以及确保强化学习算法在动态和不可预测环境中稳定性和韧性的难题。强化学习已展现出显著潜力,但仍需更多研究以将其完全整合到工业和环境系统中,以解决当前挑战。 缩写:AC:演员-评论家;AI:人工智能;ANN:人工神经网络;A3C:异步优势演员-评论家;CRL:经典强化学习;CV:受控变量;DDPG:深度确定性策略梯度;DQN:深度Q网络;DRL:深度强化学习;DP:动态规划;FOMDP:完全可观测马尔可夫决策过程;GRU:门控循环单元;LQR:线性二次调节器;LSTM:长短期记忆;ML:机器学习;MV:操纵变量;MC:蒙特卡洛;MDP:马尔可夫决策过程;MPC:模型预测控制器;MIMO:多输入多输出;PG:策略梯度;PID:比例积分微分;PPO:近端策略优化;RL:强化学习;PPO:近端策略优化;SAC:软演员-评论家;SISO:单输入单输出;TD:时序差分;TRPO:信任域策略优化;TD3:双延迟深度确定性策略梯度。
Keyword:
Process control
reinforcement learning
chemical
energy
waste water treatment
biochemical process

期刊

I
International Journal of Systems Science
IF:
4.6
论文数:
1.1K
被引数:
7.3K

机构

N
National Institute of Technology
学者数:
1.7K
论文数: 838
被引数: 2.1K
引用论文

引用论文

MPC: Current practice and challenges
err2012-04-01
err265
PREAI
errDarby, Mark L.; Nikolaou, Michael
err分享
err收藏
Natural Actor-Critic
err2008-03-01
err643
PREAI
errPeters, Jan; Schaal, Stefan
err分享
err收藏
Intelligent Control of Wastewater Treatment Plants Based on Model-Free Deep Reinforcement Learning
err2023-07-28
err0
errOAAI
errOscar Aponte-Rengifo; Mario Francisco; Ramón Vilanova; Pastora Vega; Silvana Revollar
err分享
err收藏
学者 查看更多内容