一种基于稠密卷积网络和竞争架构的改进路径规划算法∗
2019-05-07余玉琴
黄 颖 余玉琴
(上海理工大学光电信息与计算机工程学院 上海 200093)
1 引言
机器人路径规划问题就是给定环境、机器人模型,指定规划目标(如无碰撞的到达目的地),自主地计算出机器人的运动路径。
目前路径规划问题多转化为搜索问题或者能量优化问题解决,常用的方法有人工势场法[1]、遗传算法[2]和 A*算法[3]。随着机器人路径规划面对的环境越来越复杂多变,传统的路径规划算法并不能迅速响应复杂变化的环境。目前,直接利用视觉信息再结合深度网络的函数近似功能[4]进行路径规划是路径规划领域的前沿研究方向,这主要依靠深度强化学习实现。2013年初,Google DeepMind提出直接利用游戏视频信息进行游戏控制的深度Q网络(DQN)算法[5],是直接利用图像信息进行强化学习任务处理的雏形。
DQN算法[5~6]是最原始且最常用的深度强化学习算法,可以用来解决路径规划问题,但是会学习到过高的动作状态值。双重深度Q网络(DDQN)[7]、平均深度 Q 网络[8]等算法均能减少DQN学习过程存在的动作状态值高估现象,但是它们拥有复杂的卷积网络结构,不能满足高速路径规划的需求。为了满足高速路径规划的需求,解决方案之一是使用轻量级卷积网络DenseNets[9]和ResNets[10]作为深度强化学习方法中的函数逼近器,进而获得更轻盈易训练的模型、更少的模型参数和计算时间。
近年来,最流行的卷积网络简化方法是在层与层之间创建短路径,如ResNets网络、Highway网络[11]、随机深度网络[12]、DenseNets网络。其中,DenseNets网络将之前层的输出直接连接到该层后面的所有层,这样之前层输出的特征可以在其所有后续层中传播和重利用,层与层之间的信息流将更加平滑地传输,从而有助于解决梯度消失问题,还能减少模型的参数量[9]。……
