返回
Stability-constrained policy optimization under unknown rewards
DOI:10.1016/j.ifacsc.2026.100366.png)
摘要
En 中文
强化学习(RL)的主要挑战之一是在未知、可能稀疏的奖励函数下保证智能体的闭环稳定性。虽然无模型RL适用于各种系统和奖励,但基于模型的控制策略(如优化型控制)自然地利用先验系统模型来提供安全性和稳定性保证。然而,这些模型可能无法代表真正的全局性能目标,导致次优策略。本文提出了一种策略搜索RL方法,将稳定性要求与全局性能目标解耦。核心思想是使用基于模型的策略结构作为有效的稳定参数化,使智能体能够以无模型方式学习最大化未知奖励。具体而言,智能体采用预测控制架构,并通过离散代数Riccati方程的固定点迭代隐式学习稳定终端成本。通过对该固定点进行隐式微分,稳定性条件的导数用于指导策略梯度。所提出的方法被证明能为各种稀疏的全局性能目标设计高性能、稳定的策略。此外,该方法可通过使用随机离散代数Riccati方程来考虑动态不确定性,以促进鲁棒稳定性。这项工作展示了一种原则性的策略搜索RL方法,将先验模型和系统观测集成到智能体设计中,以实现不确定环境下的安全可靠决策。© 2026 Elsevier Ltd. 版权所有,包括文本和数据挖掘、AI训练及类似技术的权利。
Keyword:
Safe reinforcement learning
Stability-constrained policy search
Implicit differentiation
Predictive control
期刊
I
IF:
1.8
论文数:
80
被引数:
317
机构
引用论文
Integral reinforcement learning and experience replay for adaptive optimal control of partially-unknown constrained-input continuous-time systems
AUTOMATICA
IF5.9
Stabilizing reinforcement learning control: A modular framework for optimizing over all stable behavior
AUTOMATICA
IF5.9

