APP下载

深度强化学习及在路径规划中的研究进展

2021-10-14张荣霞武长旭孙同超赵增顺

计算机工程与应用 2021年19期
关键词:规划环境策略

张荣霞,武长旭,孙同超,赵增顺

山东科技大学 电子信息工程学院,山东 青岛 266590

随着机器人技术以及电子信息技术的发展,移动机器人的应用越来越智能化,智能移动机器人的一个重要特征是在复杂动态环境下可以进行良好的路径规划[1]。智能机器人路径规划是指在搜索区域内给出合理的目标函数,并在一定范围内找到目标函数的最优解,使机器人找到一条从起点到目标点的安全无障碍路径[2]。路径规划在许多领域有着广泛的应用,如机器人机械手臂的路径规划[3]、无人机的路径规划[4]等。

传统的路径规划方法,如人工势场法[5]、A*算法[6-7]、蚁群算法[8-9]、遗传算法[10]等,在复杂环境中无法处理复杂高维环境信息,或者容易陷入局部最优。

路径规划方法根据训练方法的不同,可分为监督学习、无监督学习和强化学习[11]、监督学习和无监督学习在进行路径规划时都需要大量的先验知识,否则无法进行良好的路径规划。强化学习(Reinforcement Learning,RL)是一种不需先验知识并且与环境直接进行试错迭代获取反馈信息来优化策略的人工智能算法,并且能够自主学习和在线学习,逐渐成为机器人在未知环境下路径规划的研究热点[12-13]。传统的强化学习方法受到动作空间和样本空间维数的限制,难以适应更接近实际情况的复杂问题情况,而深度学习(Deep Learning,DL)具有较强的感知能力,能够更加适应复杂的问题,但是缺乏一定的决策能力。因此,谷歌大脑将DL 和RL 结合起来,得到深度强化学习(Deep Reinforcement Learning,DRL),取长补短,为移动机器人复杂环境中的运动规划问题提供了新的思路和方向。……

登录APP查看全文

猜你喜欢

规划环境策略
长期锻炼创造体内抑癌环境
一种用于自主学习的虚拟仿真环境
例谈未知角三角函数值的求解策略
孕期远离容易致畸的环境
我说你做讲策略
环境
高中数学复习的具体策略
规划引领把握未来
快递业十三五规划发布
多管齐下落实规划