MADDPG算法并行优先经验回放机制
2021-01-26董志明宋敬华
高 昂, 董志明, 李 亮, 宋敬华, 段 莉
(1. 陆军装甲兵学院演训中心, 北京 100072; 2. 中国人民解放军61516部队, 北京 100076)
0 引 言
多智能体系统(multi-agent system, MAS)是在同一个环境中由多个交互实体(代理)组成的系统[1-2],具有模块化、可扩展、并行性、鲁棒性强等特点,常用于解决单智能体系统难以解决的问题。强化学习(reinforcement learning, RL)是实现MAS智能的一类重要方法,许多现实问题,如网络包路由、城市交通控制、自主化无人作战等,可以很自然地被建模为多智能体RL(multi-agent RL, MARL)问题。然而,随着智能体数量增多,状态空间呈指数级增大,MARL方法在问题规模的扩展性上受到限制。近来,深度学习(deep learning,DL)[3]的兴起解决了高维状态空间感知的问题,融合DL和RL的深度RL(deep RL,DRL)[4]方法成为许多领域研究的热点。文献[5]对DRL进展进行了较为全面的阐述,研究人员将DRL方法融入MAS领域,催生了多智能体DRL(multi-agent DRL,MADRL)方法[6]。经过数年的发展,MADRL诞生了众多算法、规则、框架,逐渐成为人工智能领域的热门方向,具有较高的研究和应用价值[7-9]。
用于多智能体协同控制的MADRL算法主要包括:智能体间增强学习(reinforced inter-agent learning, RIAL)算法[10]、策略空间回应/深度分层认知(policy-space response oracles,PSRO / deep cognitive hierarchies, DCH)算法[11]、引入宽大值的深度Q学习网络(lenient deep Q-learning network, LDQN)算法[12]、滞后深度递归Q学习网络(hysteretic deep recurrent Q-learning network, HDRQN)算法[13]、加权双重深度Q学习网络(weighted double deep Q-learning network, WDDQN)算法[14]、获胜导向(for the win,FTW)多智能体算法[15]、价值分解网络(value decomposition networks,VDN)算法[16]、Q学习混合网络(Q-learning mixing network, QMIX)算法[17]、反事实多智能体策略梯度(counterfactual multi-agent policy gradients, COMA)算法[18]、参数共享的深度Q学习网络(parameter sharing deep Q-learning network, PS-DQN)算法、参数共享的置信域策略优化算法(parameter sharing trust region policy optimization, PS-TRPO)、参数共享的异步优势行动者评论家(parameter sharing asynchronous advantage actor critic, PS-A3C)算法[19]、多智能体深度确定性策略梯度(multi-agent deep deterministic policy gradient, MADDPG)算法[20]。相比于其……
