人在环路的机器人在线可持续示教学习
2021-09-22胡艳明
胡艳明,华 炜
(之江实验室,杭州 311121)
1 引 言
机器人在现代社会与经济的发展中扮演着重要的角色,显著地提高了人类的工作效率与安全性,并加快了科学发展的进程。与人类相比,现有的机器人在未知环境下的行为能力还很低下[1-3]。参照人类提升行为能力的方式,研究人员通过研究基于示教学习的机器人学习方法,使机器人通过模仿示教者来获得新的行为。
示教学习是通过最小化机器人与示教者之间的行为差异来获得新行为的技术[4]。相比基于“试错”的强化学习,示教学习的样本使用率与学习效率更高。但是,示教学习依赖示教样本的质量,所学行为鲁棒性较差,较小误差的动作会使机器人逐渐偏移正确的行为,从而在真实应用中失效。针对该问题,研究人员提出一系列经典算法,如基于搜索的结构化预测算法[5]、随机混合迭代学习算法[6]、数据集聚合(Dataset Aggregation, DAgger)算法[7-8]、基于示教的近似策略迭代算法[9]、用于模仿的聚合值算法(Aggregate Values to Imitate, AggreVaTe)[10]等(详细介绍见文献[11])。随着生成对抗网络(Generative Adversarial Network, GAN)[12]的提出,许多研究人员利用GAN 的样本生成能力,提出了基于GAN 的模仿学习算法,如生成对抗模仿学习[13]、互信息生成对抗模仿学习[14]、多智能体对抗模仿学习[15]、奖励增广模仿学习[16]、基于动作排序的对抗模仿学习[17]等。
以上所示的大部分经典算法与基于GAN 的算法由两个基本时期组成:①示教样本收集;②策略导出。对于示教学习来说,示教样本包含了机器人可能学到的行为。当机器人遇到示教样本中未包含的场景时,所学行为极有可能会失效。……
