APP下载

基于改进的DQN机器人路径规划

2021-02-25董永峰屈向前肖华昕王子秋

计算机工程与设计 2021年2期
关键词:规划动作环境

董永峰,杨 琛,董 瑶+,屈向前,肖华昕,王子秋

(1.河北工业大学 人工智能与数据科学学院,天津 300401;2.河北工业大学 河北省大数据计算重点实验室,天津 300401;3.河北工业大学 河北省数据驱动工业智能工程中心,天津 300401)

0 引 言

移动机器人的研究已经成为当前社会和科技的研究方向,路径规划技术是机器人研究中的基础问题[1]。硬件技术的进步促进了机器人路径规划算法的发展,包括传统算法,例如:遗传算法[2]、蚁群算法[3]、强化学习[4]。还有另一种新颖的方法,深度强化学习[5],该方法是深度学习与强化学习的结合,深度强化学习解决了强化学习中状态到动作映射所带来的维数灾难问题[6],能更好满足机器人动作选择需求。

Google DeepMind中Mnih等提出深度Q网络模型[7],该模型将深度网络和Q-learning算法结合,不仅解决了传统Q-learning算法中的维数灾难,也可以机器人所获取的环境信息作为训练数据训练网络,达到网络收敛[8]。Tai Lei等[9]将DQN算法应用到了移动机器人的路径规划中,但是在实验过程中,出现了过估计对机器人动作选择带来的负面影响,造成机器人获得的奖赏值和规划出的路径并非最优。在DQN的基础上又出现了很多改进的算法,比如深度双Q网络[10]、竞争深度Q网络[11]、优先回放DQN[12]、平均DQN[13]等。DDQN有效解决了DQN在实验环境下存在Q学习算法固有的缺点——过估计问题[14],使得智能体能够选择相对较优的动作。但是DDQN优化目标中,仅仅利用当前估计网络参数,忽略了先验知识的重要性。在前期的网络训练中,网络参数均为初始化,并未进行网络训练,即不存在先验知识,若是利用平均DQN优化目标进行估计网络参数训练,会使得网络参数训练效率降低。……

登录APP查看全文

猜你喜欢

规划动作环境
长期锻炼创造体内抑癌环境
一种用于自主学习的虚拟仿真环境
孕期远离容易致畸的环境
环境
动作描写要具体
规划引领把握未来
快递业十三五规划发布
动作描写不可少
多管齐下落实规划
迎接“十三五”规划