DDPG优化算法的机械臂轨迹规划*
2021-12-29张浩博仲志丹乔栋豪杨遨宇
张浩博,仲志丹,乔栋豪,赵 耀,杨遨宇
(河南科技大学机电工程学院,河南 洛阳 471003)
0 引言
机械臂的轨迹规划是指在满足一定的约束条件下,计算出一条连接起点和终点的轨迹[1-2]。传统的机械臂轨迹规划主要包括人工势场法[3]、蚁群算法[4]、快速随机树法[5]等,这些方法都需要在已知的环境中进行训练,且动态规划较差,智能性较低。随着深度强化学习(Deep Reinforcement Learning,DRL)的发展,具备了让智能体在未知的环境中进行自主学习的能力,深度学习(Deep Learning,DL)使用多层神经网络学习,在特征提取和事物感知方面具有独特的优势,强化学习(Reinforcement Learning,RL)是一个顺序决策问题,在马尔科夫决策过程中,通过获得最大的奖励来找到最优的策略。DRL结合了DL和RL的优势,可以很好地完成在复杂的环境下对机械臂的控制[6]。
Mnih V等[7]提出了DQN算法,将神经网络与Q-learning相结合,并且在Atari 2600游戏中进行了训练,最终训练的水平远高于人类。Lillicrap T P等[8]用DDPG算法,将其应用到高维连续动作空间。Rusu A A等[9]将仿真环境下训练的结果迁移到实体机械臂上,只需要进行简单的训练之后就能达到与仿真相似的效果。柯丰恺等[10]基于DDPG算法,提出根据TD-error变化的优化采样算法,并将其应用到机械臂。陈建平等[11]提出的E-DDPG算法,增加了多样性和高误差样本池,收敛速度更快。Li Z等[12]通过添加成功经验池和碰撞经验池改进传统的经验池,与传统的DDPG算法相比,改进后的DDPG算法效果更好。Luck K S等[13]将DDPG算法与基于模型的轨迹优化方法相结合,利用已学习到的深度动力学模型来计算策略梯度,以价值函数作为评判标准,从而提高了训练的效率。……
