深度强化学习算法在智能军事决策中的应用
2021-10-28况立群李思远徐清宇
计算机工程与应用 2021年20期
况立群,李思远,冯 利,韩 燮,徐清宇
1.中北大学 大数据学院,太原 030051
2.北方自动控制技术研究所 仿真装备部,太原 030006
现代战争规模与复杂性不断扩大,作战方式日益复杂,面对瞬息万变的战场环境,仅靠人类决策行动已经很难确保正确快速的军事响应[1]。深度强化学习在解决序贯决策问题上做出了许多突出贡献,契合了指挥员的经验学习与决策思维方式,二者相结合是现代智能军事决策的发展方向。强化学习[2]具有鲁棒性强[3]、独立于环境模型和先验知识等优点,在运用于军事作战行动中常采用试错法寻求最优军事决策序列。Q-Learning[4]是一种典型的强化学习方法,已被广泛地研究并产生了SARSA[5]、深度Q网络(DQN)[6]、Double-DQN[7]等改进算法。Q-Learning被大量应用于军事决策中的部分环节中,如战机路径规划[8]以及半自治坦克军事决策[9]。2015年,DeepMind团队提出了DQN算法,将深度卷积神经网络和Q学习结合到一起,在Atari系列游戏上达到了人类专家[10]的决策和控制水平,并且避免了Q表的巨大存储空间;此外还利用经验回放记忆和目标网络提高了训练过程的稳定性。陆军工程大学依据该算法提出了一种基于DQN的逆向强化学习的陆军分队战术决策技术框架[11],在解决战术行动决策上取得了一定的效果。
虽然DQN算法在离散行为决策方面取得了一系列成果[12],但是难以实现高维的连续动作。如果连续变化的动作被无限分割,那么动作数量会随着自由度的增加而成倍增加,这就导致了维度突变的问题,网络将难以收敛。……
登录APP查看全文
