考虑博弈的多智能体强化学习分布式信号控制
2020-05-13曲昭伟潘昭天陈永恒李海涛
曲昭伟,潘昭天,陈永恒,李海涛,王 鑫
(吉林大学交通学院,长春130022)
0 引言
实现闭环反馈自适应控制的多智能体强化学习(Multi-agent Reinforcement Learning,MARL)技术为交通网络信号控制领域研究提供了一种新的解决方法[1].Thorpe[2]设计了一种边界恒定流量输入,车辆具有速度随机性的交通模拟器,采用车辆数、信号持续时间、距交叉口距离等因素划分交通状态,并讨论其对SARSA算法应用于路网交通信号控制适用性的影响.Abdulhai等[3]设计了一个泊松到达率的四路交叉口,模拟2 h内不同的高峰状况,采用Q学习对相位顺序和持续时间进行控制并取得良好效果,验证了MARL在交通信号控制上的优越性.Balaji等[4]将借鉴邻近智能体交通数据的改进Q学习方法应用于城市交通干线分布式控制,通过对绿灯时间等参数调节,达到减少总延误的目标.Zhu等[5]在协作多智能体框架的强化学习中嵌入节点树算法用于对交叉口节点最优联合动作的精确推理,调整相序,降低拥堵,减少排放.但文献[4-5]的方法对通信和计算等要求随着路网范围增大呈几何增长,故基于独立动作MARL(Independent Action Multi-agent Reinforcement Learning,IA-MARL)的分布式控制是路网信号控制合理选择.
文献[2-4]中,MARL框架的决策过程多采用贪婪搜索或softmax策略,是建立在其自身累积的历史经验之上进行的,在面临路网中不均衡和波动的交通需求时,反馈控制延迟是不可避免的.若要更好地响应不均衡和波动的交通需求,IAMARL的决策过程应当具有主动应对局部交通状态变化的能力.博弈论中混合策略纳什……
