鲁棒强化学习及其在航天控制中的应用与展望*
2021-11-16张立宪卢生奥韩铭昊姜芊鹏李云鹏徐恺鑫
航天控制 2021年3期
张立宪 卢生奥 韩铭昊 姜芊鹏 李云鹏 徐恺鑫
哈尔滨工业大学航天学院,哈尔滨 150001
0 引言
强化学习(Reinforcement learning, RL)作为一种解决非线性随机系统最优决策问题的有效方法,被认为是最有可能通往通用型人工智能的方向之一。近年来,随着理论研究的深入和计算机算力的提高,策略梯度(Policy gradient)[1]、演员-评论家(Actor-Critic)[2]等强化学习算法开始越来越多地应用于自动控制中,在围棋、电子游戏等领域已经能够达到甚至超越人类水平[3-4]。
然而,作为一种黑盒学习方法,强化学习完全通过与环境交互试错积累经验,但训练环境与实际环境存在差异(Reality gap),可能存在过拟合(Overfitting)现象,难以保证智能体学得的控制策略的鲁棒性[5];此外,智能体和工作环境参数的变化也可能导致任务失败,这些因素都限制了其在具有高鲁棒性要求场景中的应用。随着应用领域的日渐增多,特别是在航天控制中,航天器的姿态控制、轨迹优化等任务具有风险性高、复杂度高、不允许失败等特点,这对强化学习的鲁棒性提出了挑战。
2005年,Morimoto等[6]提出了鲁棒强化学习(Robust RL, RRL)的概念,自此,越来越多的学者开始将目光投向强化学习算法的鲁棒性保障上。本文将对鲁棒强化学习的最新研究进行分类和总结。第1节简要介绍了强化学习的基本概念,阐释了何为强化学习中的鲁棒性;第2节从引入H∞控制理论的鲁棒强化学习、域随机化方法、鲁棒对抗强化学习3个类别系统地对鲁棒强化学习进行综述;第3节分析并展望了鲁棒强化学习在航天控制中的应用;……
登录APP查看全文
