arrow
返回

Stability-constrained policy optimization under unknown rewards

delete2026-01-01
delete0
PRE
AI
T
Thomas Banker
N
Nathan P. Lawrence
A
Ali Mesbah *
DOI:10.1016/j.ifacsc.2026.100366delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
强化学习(RL)的主要挑战之一是在未知、可能稀疏的奖励函数下保证智能体的闭环稳定性。虽然无模型RL适用于各种系统和奖励,但基于模型的控制策略(如优化型控制)自然地利用先验系统模型来提供安全性和稳定性保证。然而,这些模型可能无法代表真正的全局性能目标,导致次优策略。本文提出了一种策略搜索RL方法,将稳定性要求与全局性能目标解耦。核心思想是使用基于模型的策略结构作为有效的稳定参数化,使智能体能够以无模型方式学习最大化未知奖励。具体而言,智能体采用预测控制架构,并通过离散代数Riccati方程的固定点迭代隐式学习稳定终端成本。通过对该固定点进行隐式微分,稳定性条件的导数用于指导策略梯度。所提出的方法被证明能为各种稀疏的全局性能目标设计高性能、稳定的策略。此外,该方法可通过使用随机离散代数Riccati方程来考虑动态不确定性,以促进鲁棒稳定性。这项工作展示了一种原则性的策略搜索RL方法,将先验模型和系统观测集成到智能体设计中,以实现不确定环境下的安全可靠决策。© 2026 Elsevier Ltd. 版权所有,包括文本和数据挖掘、AI训练及类似技术的权利。
Keyword:
Safe reinforcement learning
Stability-constrained policy search
Implicit differentiation
Predictive control

期刊

I
IFAC Journal of Systems and Control
IF:
1.8
论文数:
80
被引数:
317

机构

University of California System 封面图
University of California System
学者数:
37.5W
论文数: 33.7W
被引数: 6.6K
引用论文

引用论文

Robust reinforcement learning control with static and dynamic stability
err2002-01-07
err49
errOAAI
errKretchmar, RM; Young, PM; Anderson, CW; Hittle, DC; Anderson, ML; Delnero, CC
err分享
err收藏
err分享
err收藏
err分享
err收藏
Stabilizing reinforcement learning control: A modular framework for optimizing over all stable behavior
err2024-06-01
err0
errOAAI
errLawrence, Nathan P.; Loewen, Philip D.; Wang, Shuyuan; Forbes, Michael G.; Gopaluni, R. Bhushan
err分享
err收藏
Tuning LQR Controllers: A Sensitivity-Based Approach
err2022-01-01
err0
PREAI
errDaniele Masti; Mario Zanon; Alberto Bemporad
err分享
err收藏
err分享
err收藏
学者 查看更多内容