基于改进双延迟深度确定性策略梯度法的无人机反追击机动决策
2021-09-23郭万春解武杰董文瀚
郭万春, 解武杰, 尹 晖, 董文瀚
(1.空军工程大学航空工程学院, 西安, 710038; 2.空军工程大学教研保障中心, 西安, 710051)
近年来,各种控制理论和方法研究为自主空战决策提供了解决方案。文献[1]利用差分博弈论,将空战模型建模为一个确定的、完全信息的追逃博弈模型。文献[2]研究了一种实时自主一对一的近似动态规划空战方法。文献[3]采用了一种基于可达性的方法来解决追逃博弈问题。此外,还有多级影响图法[4]、滚动时域法[5]和基于统计学原理的方法[6]等。由于现实环境的不确定性以及真实测试昂贵、耗时和危险等原因,这些探索大多停留在理论研究阶段,难以付诸工程实践和实战。
深度强化学习(deep reinforcement learning,DRL)正成为利用AI解决决策问题的主流研究方向[7-10]。文献[11]采用了深度Q学习(deep Q-learning network,DQN)的方法控制无人机的速度和转角,然而DQN对次优动作高估的状态动作值超过最优动作的动作值时将无法找到最优动作,并且它只能处理离散的、低维的动作空间,这与大多实际情境不符。文献[12]使用异步的优势行动者评论家算法(asynchronous advantage actor-critic,A3C)训练无人机进行空战,利用多线程的方法,同时在多个线程里分别与环境进行交互学习,避免了DQN中出现的经验回放相关性过强的问题,但是训练出的无人机空战性能有待提高。文献[13]假定对战的两架飞机速度恒定,使用深度确定性策略梯度算法(deep deterministic policy gradient, DDPG)训练了无人机,虽然取得了良好的训练效果,但是训练出的追击策略较为单一,并且没有考虑飞机的火力打击区域,仅仅以两机间的距离在某一范围内作为成功打击目标的准则。……
