APP下载

改进深度强化学习的室内移动机器人路径规划

2021-11-12郝密密

计算机工程与应用 2021年21期
关键词:深度动作环境

成 怡,郝密密

天津工业大学 控制科学与工程学院,天津300387

路径规划是移动机器人研究的重要方向,是实现导航任务的关键[1],即移动机器人从起始位置到目标位置能够自主探索出一条平滑且无碰撞的路径轨迹[2]。传统的路径规划算法有A*算法[3]、人工势场法[4]以及快速扩展随机树法[5]等,这些算法用于解决已知环境下的路径规划,且容易实现,但机器人在规划路径时存在探索能力差的问题。针对传统算法存在的问题,许多研究者引入了深度强化学习算法[6-8],让机器人在环境状态中能做出更准确的运动方向。深度强化学习由深度学习和强化学习相结合,深度学习通过感知环境来获得目标状态观测信息。强化学习通过获取的信息给予动作,再结合奖励判断动作价值,是智能体与环境不断交互试错,再利用奖惩函数指导动作好坏的过程。

Mnih等[9]提出第一个深度强化学习模型,即深度Q网络(DQN),该网络模型是将神经网络和Q-learning相结合,利用神经网络代替Q值表解决了Q-learning中的维数灾难问题,但在网络训练时收敛速度较慢。Tai等[10]把DQN应用到了无模型避障的路径规划中,但存在状态-动作值过估计问题,造成移动机器人获得的奖励稀疏,且规划出的路径并非最优。Yu等[11]提出一种基于深度强化学习的安全约束月球车端到端的路径规划算法,通过利用课程学习的思想,针对不同地形特征的月面环境对网络进行训练,提高了月球车对月面不同地形的适应性。……

登录APP查看全文

猜你喜欢

深度动作环境
长期锻炼创造体内抑癌环境
一种用于自主学习的虚拟仿真环境
孕期远离容易致畸的环境
深度观察
深度观察
环境
深度观察
动作描写要具体
动作描写不可少
非同一般的吃饭动作