基于多组并行深度Q网络的连续空间追逃博弈算法
2021-05-06刘冰雁叶雄兵岳智宏董献洲张其扬
兵工学报 2021年3期
刘冰雁, 叶雄兵, 岳智宏, 董献洲, 张其扬
(1.军事科学院, 北京 100091; 2.32032部队, 北京 100094)
0 引言
以追捕者视角看待的追逃博弈(PEG)问题[1],是在仅知自身状态和逃逸者当前有限状态、未知逃逸者未来行为策略的条件下采取最优行为,并最终完成追捕任务的一个动态博弈过程。该问题是最优控制与动态博弈的深度融合,现已在战车追捕[2]、战斗机格斗[3]、导弹拦截[4]以及航天器交会[5]等军事应用场景中被重点关注。
PEG问题中的逃逸者,除了在一个连续且动态变化的空间环境中活动外,还具有典型的非合作性,即有信息层面不沟通、机动行为不配合、先验知识不完备等特性[5]。针对此类军事场景中常出现的双方连续动态冲突、对抗博弈问题,可通过微分对策[6-7]进行数学描述。这类追捕- 逃逸微分博弈是微分对策的一种应用,最初由Isaacs[1]提出,近年被广泛运用到诸多领域。例如,文献[8-9]根据机器人追捕问题的具体情况,通过分析追逃双方的不同状态及形势,建立了追捕者与逃逸者的微分博弈描述式。文献[10]将高速机动目标拦截末制导过程抽象为以视线角速率和燃料消耗为性能指标的零和微分博弈问题,设计了一种微分对策制导律,以表述对目标的拦截策略。文献[11-12]在主动防御飞行器制导问题研究中,运用微分对策理论对对抗双方的制导律进行了描述与设计。文献[13]在三维空间中多智能体参与的PEG问题研究中,利用微分对策设计了防御器和逃逸器的最优控制策略。文献[14]为获得追逃双方在对策条件下的最优策略,运用微分博弈对航天器的整个追逃过程进行了数学描述。……
登录APP查看全文
