返回
Integrated Algorithm for PPO-Based Intelligent Dynamic Target Assignment and Entry Guidance Using Quasi-Second-Order Enhanced Linear Pseudospectral Method
DOI:10.1002/rnc.70190.png)
摘要
En 中文
本文提出了一种动态目标分配与再入制导的集成算法,该算法考虑了多目标威胁值的动态变化以及再入飞行中能量管理的强非线性约束。通过设计能量管理算法、智能目标分配算法和制导算法,本文建立了一个集成的计算框架,实现了目标分配与制导命令的同步执行。首先,推导了一个高精度的降阶滑翔动力学模型,该模型更全面地考虑了地球自转的影响。尽管该模型仅包含三个状态变量,但仍能准确预测高超声速飞行器的滑翔轨迹。为进一步降低求解规模,将控制参数化为两个转折点的纵向升阻比和能量。随后,开发了一种准二阶增强型线性伪谱方法。该方法首先将偏差传播方程展开至二阶。为推导控制的解析修正公式,该方法进一步进行高斯伪谱离散化和准二阶线性化。尽管修正过程在数学上更为复杂,但包含了额外的二阶信息,使其能在更少的迭代次数内收敛到更高精度。基于飞行器的能量管理,上述工作得以实现。为寻找满足能量管理要求并最大化目标值的综合最优解,将再入过程中的动态目标分配抽象为马尔可夫决策过程。采用近端策略优化智能算法对分配策略进行离线训练,并在每个回合中调用能量管理算法求解能量管理问题。飞行器的能量和位置,以及各目标的威胁值,被用作观测值,而选定的目标编号则作为动作。奖励函数被设计为目标威胁值、剩余距离和能量管理结果的复合函数。最后,进行了广泛的数值仿真以评估该算法。结果表明,飞行器能够根据剩余能量和各目标的威胁值智能分配目标,同时严格满足所有约束条件,证明了该算法的广泛适用性、高精度和快速计算效率。此外,蒙特卡洛仿真结果指出,即使在高度分散的环境下,该集成算法仍表现出较强的鲁棒性。
Keyword:
dynamic target assignment
entry guidance
model predictive control
nonlinear control
pseudospectral method
reinforcement learning
期刊
IF:
3.2
论文数:
6.9K
被引数:
1.4W

