APP下载

面向无人驾驶时空同步约束制导的安全强化学习

2021-12-14王金永黄志球杨德艳XiaoweiHuang华高洋

计算机研究与发展 2021年12期
关键词:动作系统

王金永 黄志球 杨德艳 Xiaowei Huang 祝 义 华高洋

1(南京航空航天大学计算机科学与技术学院 南京 211106) 2(高安全系统的软件开发与验证技术工信部重点实验室(南京航空航天大学) 南京 211106) 3(江苏师范大学计算机科学与技术学院 江苏徐州 221116) 4(利物浦大学计算机科学系 英国利物浦 L69 3BX)

无人驾驶系统可以看作是自车车辆和环境在时间空间上的转移,其安全性一直是阻碍无人驾驶普及的首要问题.系统安全性(safety)可定义为坏的事情永远不要发生,无人驾驶安全指的是车辆之间和车辆与周围的环境之间不要发生碰撞.无人驾驶决策模块需要根据动态的时钟和空间信息做出正确安全的决策,提供安全的时空道路通行权(right-of-way),避免在某一时刻自车车辆与周围环境车辆的空间重叠.安全攸关的无人驾驶车辆处在复杂的时空运动轨迹中,在面对没有训练过的未知不确定场景时,系统设计者不仅需要采用强化学习(reinforce-ment learning, RL)的方法来训练车辆,使得车辆获得最优的策略和累计奖励,而且更加需要特定领域的形式化规约方法,为强化学习提供安全约束和保障.

无人驾驶决策的方法可以分为2类:1)基于规则(rule-based)的方法,比如有限状态机(finite state machine);2)数据驱动(data-driven)的方法,比如机器学习(machine learning)的方法.基于规则的决策系统可以根据事先定义好的规则输出事先规定好的动作,从而实现系统的安全与可解释性[1-4].尽管基于规则的方法可以为安全的系统操作提供保障,但是只有复杂的现实环境与……

登录APP查看全文

猜你喜欢

动作系统
Smartflower POP 一体式光伏系统
下一个动作
WJ-700无人机系统
ZC系列无人机遥感系统
基于PowerPC+FPGA显示系统
半沸制皂系统(下)
动作描写要具体
连通与提升系统的最后一块拼图 Audiolab 傲立 M-DAC mini
让动作“活”起来
动作描写不可少