返回
Learning-efficient orbit decision via reinforcement learning with astrodynamics-informed action parameterization
DOI:10.1007/s42064-026-0313-9.png)
摘要
En 中文
卫星轨道决策需要在不确定环境中采用可靠的方法。传统制导方法可以生成高质量轨迹,但依赖边界值问题的重复数值求解,这限制了其在大规模在线决策中的可扩展性。深度强化学习(RL)原则上能够处理非线性高维动力学,但其交互需求使得样本效率成为高保真航天动力学模型下轨道决策的中心瓶颈。本文提出了一种基于航天动力学启发式参数化动作空间的、学习高效的轨道决策RL框架。每个动作由一个离散机动索引和一个连续参数向量组成。离散索引从经典轨道制导方法的库中选择一个机动基元,连续参数统一这些基元的内部自由度。该架构通过重参数化连续采样和投影来确保机动可行性,并生成有界且具有物理意义的指令。全面的仿真表明,与无结构的Δv动作空间和归一化基线相比,所提出的航天动力学启发式参数化提高了样本效率并改善了最终性能。
Keyword:
reinforcement learning (RL)
parameterized action space
astrodynamics-informed control
sample efficiency

