基于强化学习的路径规划技术综述
2021-10-15闫皎洁张锲石胡希平
计算机工程 2021年10期
闫皎洁,张锲石,胡希平
(1.中国科学院深圳先进技术研究院,广东 深圳 518055;2.中国科学院大学 深圳先进技术学院,广东 深圳 518055)
0 概述
随着计算机技术、人工智能技术及自动化控制技术的发展,移动机器人的智能化程度不断提高,路径规划作为实现机器人自主导航的核心技术受到广泛关注[1-2]。路径规划就是使目标对象在最小的时间或距离代价下,在规定区域范围内找到一条从起点到终点的安全无碰撞路径。目前,路径规划的核心方法[3-4]按其特点及关键技术可分为常规方法与强化学习(Reinforcement Learning,RL)方法两类。常规方法可分为传统方法、图形学方法及智能仿生学方法。近年来,又由强化学习方法衍生出深度强化学习方法,深入研究强化学习方法及其衍生方法对路径规划技术的发展有重要的意义。本文简述基于常规方法的路径规划技术,重点分析基于强化学习的路径规划技术并将其分为基于值和基于策略两类,再由强化学习引出基于深度强化学习的路径规划技术,同时对强化学习代表方法的原理、特点、优缺点、适用场合及改进策略进行深入探讨。
1 基于常规方法的路径规划技术
常规方法分为传统方法、图形学方法、智能仿生学方法等3 类:
1)传统方法主要包括模拟退火法[5]、人工势场法[6]和模糊逻辑法[7]。这类方法最早应用于路径规划技术,具有描述简单、易于实现的特点,但不能充分利用先验知识和全局信息,求解时容易陷入局部最优解或遇到目标不可达的问题。……
登录APP查看全文
