基于示范主动采样的行为克隆方法
2021-11-10黄文宇黄圣君
南京航空航天大学学报 2021年5期
黄文宇,黄圣君
(南京航空航天大学计算机科学与技术学院/人工智能学院,南京 211106)
强化学习[1]旨在为智能决策任务学习出有效的策略,使智能体获得的长远奖赏最大。传统的强化学习更多关注离散状态和动作空间的任务,难以在状态和动作连续的任务上应用。深度强化学习通过将策略用深度神经网络来表示可以有效地解决这一问题。最近研究表明,深度强化学习在很多富有挑战性的任务上都取得了成功,例如围棋[2]、游戏[3]和模拟机器人任务[4‑5]。但是深度强化学习在训练智能体的策略时需要与环境进行大量的交互,因此面临着训练效率低下的挑战。模仿学习通过从专家的示范中学习可以有效应对这一挑战,其主要思想是从专家的示范中去模仿专家的行为,因而无需与环境进行交互。
模仿学习大体上可被分为两大类:行为克隆和逆强化学习。行为克隆[6‑7]运用监督学习的方式直接从示范中学得一个策略,其将状态视为监督学习中的示例,将动作视为监督学习中的标签。与行为克隆直接学得一个策略不同,逆强化学习[8‑9]首先学得一个奖赏函数,然后通过标准的强化学习算法学习策略。生成对抗模仿学习[10]是当前较为前沿的模仿学习方法,其主要思想是同时学习策略和判别器。判别器的目标是将专家生成的状态‑动作对与智能体生成的状态‑动作对有效区分,而智能体策略的目标是混淆判别器,使得判别器将智能体生成的状态‑动作对判别为专家生成的状态‑动作对。……
登录APP查看全文
