APP下载

基于强化学习下城市道路交通信号控制研究

2021-03-05陈圣颖

黑龙江交通科技 2021年2期
关键词:模型

陈圣颖

(深圳市金溢科技股份有限公司,广东 深圳 518000)

0 引 言

在城市交通的自动管理程序中,交通信号起着中枢神经的作用,可以在时间上调度和分配发生冲突的交通流。但是,往往因为交通信号控制的方案缺乏合理性,经常造成交叉路口和多条道路发生拥堵,所以交通信号控制方案的科学合理地制定,是避免交通拥挤、堵塞的关键措施。而基于城市道路交通流的不确定性、时变性以及非线性,具备一定的建模难度,难以通过数学模型的精确性对交通信号控制方案进行优化,从而需要一个应对以上交通流特点的科学有效控制措施,而强化学习的智能体优势在与环境的交互中学习以及自适应构成优良、有效地控制手段,本文将从以下几个方面进行研究。

1 强化学习

1.1 公式算法

强化学习以一类算法的形式存在,借助从起始的完整的随机操作,不间断的探索、尝试,从每一次的错误中总结经验,找到可以遵循的内部规律,最后找到实现目标地最佳途径。该学习方法的核心蕴涵是引导智能体在环境里不断学习。强化学习由以下四个方面所构成:state(环境变量)、Agent(智能体)、action(策略行为)和reward(奖惩)。强化学习的基本过程是借助每个时间步(timestep)把一个行为(action)生成,然后与环境发生作用,达到最大化预期积累的目的。见图1。

图1 强化学习框架

强化学习各个时间步的累积奖励用下面的公式进行表示:

(1)

式中:G表示未来T个时间步针对第t个时间步的奖励积累值,各个时间步的奖励值设定为R。……

登录APP查看全文

猜你喜欢

模型
一半模型
一种去中心化的域名服务本地化模型
适用于BDS-3 PPP的随机模型
函数模型及应用
p150Glued在帕金森病模型中的表达及分布
函数模型及应用
重尾非线性自回归模型自加权M-估计的渐近分布
3D打印中的模型分割与打包
FLUKA几何模型到CAD几何模型转换方法初步研究
一个相似模型的应用