改进的DDPG算法在机器人路径规划中的应用①
2021-11-02张宁,葛斌
佳木斯大学学报(自然科学版) 2021年5期
张 宁, 葛 斌
(安徽理工大学计算机科学与工程学院,安徽 淮南232001)
0 引 言
随着机器人技术和自动化的发展,移动机器人被广泛应用于工业、农业和家庭环境中[1]。路径规划问题是移动机器人技术的一个重要环节。在许多实际应用场景下,路径规划往往是在未知环境中进行,如矿井救援、水下机器人控制、资源勘探等。在未知环境下无法获知障碍物的全部信息,只能感知环境的部分信息,所以机器人在未知环境下的路径规划比已知环境更为困难。对于路径规划有一些传统的方法,粒子群算法[2],蚁群算法[3]。这些算法虽然可以实现路径规划,但是不具备环境适应性,需要事先搭建环境模型。强化学习不需要环境模型,它的学习方式是不断的进行试错。在路径规划中,移动机器人学会了如何制定一系列动作来获得最大的回报[4-5]。近年来许多研究学者对强化学习在机器人路径规划上的应用进行了研究Ee Soong Low等人用FPA算法来改进Q-learning的初始化,加快了Q-learning的收敛速度[5]。徐哓苏等人将人工势场的引力势场引入到Q值初始化的过程中加快了收敛速度[6]。董瑶等人提出了基于竞争网络结构的改进深度双Q网络,使机器人到达目标点成功率得到了提高[8]。但是这些方法都没有解决连续动作空间的问题。用DDPG算法来规划机器人路径。针对DDPG算法在机器人路径规划上存在收敛速度慢等问题,对DDPG算法做如下改进:(1)引入改进的人工势场,加快DDPG算法的收敛速度和机器人到达目标点的速度。……
登录APP查看全文