基于优先经验回放的多智能体协同算法
2021-09-21黄子蓉甯彦淞
太原理工大学学报 2021年5期
黄子蓉,甯彦淞,王 莉
(太原理工大学 大数据学院,山西 晋中 030600)
协作是多智能体系统的核心,智能体间通过协调配合可提高团队协作效率且获得更高的利益。深度强化学习结合了深度学习自学习、自适应的能力和强化学习感知试错能力,在多智能体协同中取得了阶段性成果,如星际争霸Ⅱ[1]、交通枢纽任务[2]、飞机编队[3]等。但基于深度强化学习的多智能体协同算法仍然存在经验数据回放、可扩展性和合作性能等诸多方面的挑战。
On-policy强化学习算法中,智能体与环境交互一次获得的经验元组(st,at,rt,st+1)仅利用一次便被抛弃。为了重复利用历史经验数据,DQN(Deep Q-Networks)算法中引入经验回放缓存机制[4-5],将历史数据存入经验回放缓存池中,极大地提高了经验利用率。但先前的工作采取随机采样方式回放经验或仅采样近期经验数据,忽略了经验数据的优先级,这可能造成成功经验很快被遗忘或成功经验较少的问题。SCHAUL et al[6]研究者提出的PER(prioritized experience replay)算法对经验数据进行优先级评估和排序,在采样时选取优先级较高的经验进行模型训练。该算法使重要经验被回放的概率增大,增加了模型采样效率和学习效率。但这种算法仅关注单智能体环境,随着科技的发展,人们不再仅满足于用深度强化学习算法控制单智能体,基于深度强化学习的多智能体协同研究逐步进入人们视野。如何在多智能体环境中有效利用历史经验且提高采样效率和合作性能成为关键研究挑战。
多智能体合作环境中,集中训练分散执行的框架已被证明是处理智能体间合作的有效范式。……
登录APP查看全文
