基于深度强化学习的区域化视觉导航方法
2021-06-01阮晓钢朱晓庆任顶奇刘鹏飞
上海交通大学学报 2021年5期
李 鹏, 阮晓钢, 朱晓庆, 柴 洁, 任顶奇, 刘鹏飞
(北京工业大学 信息学部,北京 100124)
在环境中高效导航是智能行为的基础,也是机器人控制领域研究的热点之一.实现自主导航的传统方法是结合一系列硬件和算法解决同步定位和建图、路径规划及动作控制等问题,该类方法在实际应用中取得了良好效果,但需人工设计特征和预先构造地图[1].通过对空间认知行为的研究,动物神经学家发现,哺乳动物可基于视觉输入和环境信息(食物、巢穴、配偶等)在海马体内形成认知地图[2],从而实现大范围导航.在探索环境过程中,端到端的学习方法可建立视觉到动作的直接映射,使得动作不会与视觉信息分离,而是在一起相互学习,以此获得与任务相关的空间表征.近年来备受关注的深度强化学习[3]具有类似的学习方法,可通过构建表征完成具有挑战性的导航任务.
当机器人与环境交互时,导航被看作一个寻优过程[4],而随着深度模型的发展和异步优势训练方法的应用,深度强化学习在导航领域展现出强大的生命力.Zhu等[5]将预先训练好的ResNet与Actor-Critic(AC)算法结合,并在根据实际场景设计的3D仿真环境下进行测试,实现了目标驱动的视觉导航,同时证明该方法具有更好的目标泛化能力.Mirowski[4]等提出Nav A3C模型,且在训练过程中增加深度预测和闭环检测任务,使得在同样训练数据下可两次更新网络参数.Jaderberg等[6]则研究了关于非监督辅助任务对训练的影响,这两种方法……
登录APP查看全文
