APP下载

事件驱动的强化学习多智能体编队控制

2019-03-21徐鹏谢广明文家燕高远

智能系统学报 2019年1期
关键词:动作智能策略

徐鹏,谢广明,2,3,文家燕,2,高远

(1. 广西科技大学 电气与信息工程学院,广西 柳州 545006; 2. 北京大学 工学院,北京 100871; 3. 北京大学 海洋研究院,北京 100871)

强化学习是受动物能有效适应环境的启发发展而来的一种算法。基本思想是以试错的机制与环境进行交互,在没有导师信号的情况下,使奖励累积最大化,来寻求最优的策略[1-3]。目前强化学习的行业应用颇广泛,比如无人驾驶、人形机器人、智能交通和多智能体协同等。其中多智能体编队的强化学习研究是一个重要的方向[4-5]。文献[4]设计多动作回放的马尔可夫模型,在此框架下,多智能体 Q 学习可收敛到最优的联合行动策略。文献[5]提出一种评估 Q 值法,多智能体通过交流 Q 值函数和折扣奖励方差来学习世界,较快完成了编队任务。然后,智能体在这些学习过程中,需要连续地与环境进行交互,会导致大量的通信和计算资源消耗。因此在有限资源情况下,保证多智能体系统的编队性能,考虑如何降低资源消耗是必要的,这也是促使开展本项研究的直接原因。

事件驱动机制已经被证明可以有效地减小大规模网络的通信量[6-7]。综合已有研究成果,事件驱动条件设计主要分为两类:状态相关[8]和状态无关[9]。其主要做法都是通过检测智能体采样前后状态的偏差值大小,判断是否满足事件驱动条件,来决定间歇性的更新控制输入,减小控制器与多智能体系统的通信频率和计算量[10-12]。文献[10]较早在状态反馈控制器中引入事件驱动控制机制。……

登录APP查看全文

猜你喜欢

动作智能策略
例谈未知角三角函数值的求解策略
我说你做讲策略
智能前沿
智能前沿
智能前沿
智能前沿
动作描写要具体
高中数学复习的具体策略
动作描写不可少
非同一般的吃饭动作