基于深度Q-Learning的信号灯配时优化研究
2021-08-27董小明
计算机技术与发展 2021年8期
关键词:策略
赵 纯,董小明
(安庆师范大学 计算机与信息学院,安徽 安庆 246000)
0 引 言
随着机动车数量的不断增长,道路交叉口的拥堵问题迫在眉睫,想要更好地处理交通拥堵问题,就必须从根源出发。传统的交通信号控制时间固定,导致绿灯阶段的不必要等待,造成了极大的资源浪费,而且也需要大量的人力物力资源[1]。因此通过交通信号控制,能够很好地缓解拥堵压力,减少交通事故的发生,使系统更加效率化和合理化。
交叉口路网系统具有一定的不确定性和实时性,因此需要设计一个能够感知状态变化、选择最优时间的控制器。由于近年来交通控制系统的目标是通过预测未来的交通状态提前制定适当的控制方案[2],这一方案突出了智能交通的重要性和艰巨性。但是随着强化学习和深度学习的不断发展进步,有许多学者把深度学习和强化学习结合为深度强化学习应用到交通控制上[3]。机器学习是目前快速发展的理论方向,包含了众多的研究方向,而强化学习是机器学习的一个领域,使得强化学习成为时下研究的热点问题之一[4-5]。
强化学习是一种自适应生成控制策略,其中一个或多个Agent学习如何利用Agent和环境本身之间的交互产生的经验来解决环境中的任务。早期阶段的交通信号强化学习控制对手动特征提取有着很大的依赖性,需要极大的人力资源,而且状态非常不稳定,很容易就丢失最主要的状态信息。强化学习由于近年来AlphaGo[6]等的成功而越来越吸引人们的关注和研究兴趣。……
登录APP查看全文
