元学习研究综述
2021-02-01朱应钊李嫚
朱应钊,李嫚
(中国电信股份有限公司研究院,广东 广州 510630)
1 引言
在人工智能(artificial intelligent,AI)发展的历史长河中,深度学习的出现具有里程碑式的意义,其中的卷积神经网络(convolutional neural network,CNN)[1]、自编码器(auto-encoder,AE)[2]、循环神经网络(recurrent neural network)[3]、递归神经网络(recursive neural network)[4]及深度置信网络(deep belief network,DBN)[5]已广泛应用于图像分类、语音识别、文本处理等领域,极大推动了农业、工业、军事、航空等行业进步发展[6]。虽然深度学习在感知能力方面很强大,但是其在决策能力方面还是比较欠缺的,而后,融合了深度学习与强化学习的深度强化学习问世了。深度强化学习采用不断与实际环境进行交互[7],且在这过程中以保证累积奖赏最大化来获得最优策略的试错方式,能有效优化序列决策的问题,增强人工智能的行为决策能力[8]。可无论是单一深度学习还是深度强化学习,它们的成功在很大程度上都依靠于数百万的训练样本及大规模的计算资源。一旦缺乏这两个条件,它们的性能会大打折扣,而且这样“暴力”的学习方式与人类高效快速的学习方式有较大出入。如基于深度强化学习的智能体[9]玩《雅达利游戏》需要83 小时才达到人类玩家的水平,但对于人类玩家来说,几分钟就能上手。如小孩一般只需见过几次小猫和小鸟后就能分辨它们,但基于深度学习的系统需要大量的样本训练后才能区分出小猫和小鸟。为此,现有的深度学习算法和强化学习算法等都过于依赖数据与算力,很多领域的可用样本实例是极其稀少的,且庞大的算力需求条件也会有一定的受限,导致这些算法的应用出现很大的局限性。……
