返回
Frequency jamming resource allocation method based on temporal reinforcement learning
DOI:10.1016/j.sigpro.2025.110330.png)
摘要
En 中文
为了解决干扰器处理频率捷变信号时,干扰频域资源分配滞后于雷达频率变化的问题,提出了一种基于时间序列强化学习的频域参数决策方法。首先,基于频域决策滞后导致的观测不完整问题,对频率捷变信号进行仿真建模,并将其视为部分可观测马尔可夫决策过程。同时,提出采用门控循环单元(Gated Recurrent Unit)从过去的观测信息中推断隐藏状态,以弥补当前时刻观测的不完善性,从而提升智能体对环境的认知。此外,本文采用近端策略优化(Proximal Policy Optimization)算法建立频域参数分配模型。实验结果表明,所提出的方法在带宽更窄的情况下,能够实现与长短期记忆-近端策略优化(Long Short-Term Memory-Proximal Policy Optimization)相当频率覆盖。具体而言,在三种跳频模式下,其频率覆盖均超过97%。此外,在泛化测试中,该算法也能保持95%以上的频率覆盖率,有效增强复杂电磁环境下对不同捷变系统的干扰频域决策能力。
期刊
IF:
3.6
论文数:
9.9K
被引数:
1.7W

