APP下载

融合动作剔除的深度竞争双Q网络智能干扰决策算法

2021-09-23宋佰霖

空军工程大学学报 2021年4期
关键词:动作环境策略

饶 宁, 许 华, 宋佰霖

(空军工程大学信息与导航学院,西安,710077)

电磁空间是继陆、海、空、天的第五维战场,电子对抗是在电磁空间进行军事斗争的主要手段。在感知、决策、行动、评估的闭环电磁频谱作战过程中,干扰决策是进行有效对抗的重要环节,然而目前人工决策的实时性与科学性较差,难以适应未来战场瞬息万变的态势。近年智能决策成为研究热点,出现了基于遗传算法、粒子群算法[1-2]等优化理论的干扰参数寻优方法,这些方法需要较多的先验信息,实用性不强。而随着人工智能技术的迅速发展,无需先验信息的强化学习理论在电子战领域得到初步应用。如Amuru等人[3]将决策干扰参数的过程建模为多臂赌博机模型,提出干扰赌博机(jamming bandit,JB)算法,该算法可自适应地优化干扰信号直至最佳;在干扰信号参数方面,颛孙少帅等人[4]提出一种双层强化学习的干扰决策算法,以牺牲交互时间来提升算法收敛速度,决策干扰参数。此外,该团队还利用正强化的思想来提高最优动作被选中的概率,以更少的交互次数获得更好的干扰效果[5]。在雷达对抗领域,邢强等人[6]针对雷达工作模式及数目未知情况,研究基于Q学习的智能雷达对抗方法,可实现秒量级的收敛速度。黄星源等人[7]利用双Q学习对战场的干扰效果进行自主学习,实现对雷达干扰资源的认知决策。Q学习作为一种基于表格搜索型的强化学习算法,无法解决高维决策问题。而深度Q网络(deep Q network,DQN)[8]可利用神经网络进行Q学习算法中的函数拟合,能够处理高维的态势信息。……

登录APP查看全文

猜你喜欢

动作环境策略
长期锻炼创造体内抑癌环境
一种用于自主学习的虚拟仿真环境
例谈未知角三角函数值的求解策略
孕期远离容易致畸的环境
我说你做讲策略
环境
动作描写要具体
高中数学复习的具体策略
动作描写不可少
非同一般的吃饭动作