文本生成领域的深度强化学习研究进展
2020-06-08张德政崔家瑞
工程科学学报 2020年4期
徐 聪,李 擎,张德政,陈 鹏,崔家瑞
1) 北京科技大学自动化学院,北京 100083 2) 材料领域知识工程北京市重点实验室,北京 100083 3) 北京科技大学计算机与通信工程学院,北京 100083
由于深度学习的兴盛,强化学习和自然语言处理技术都得到了巨大的发展,突破了各自在传统方法上的瓶颈. 如今越来越多研究将强化学习的强大决策能力应用于自然语言处理的各个任务之中,都取得了不错的进展. 本文首先简要介绍深度强化学习和文本生成任务,然后分别梳理三类深度强化学习方法在文本生成任务中的应用以及各自的优缺点,最后对深度强化学习技术和自然语言处理任务相结合的前景与方向进行总结.
1 简介
1.1 深度强化学习
强化学习(Reinforcement learning)通常用来解决科学、工程甚至经济文化等众多领域中的序列决策问题[1]. 强化学习和神经网络的结合可以追溯到20世纪90年代,而直到近年来由于深度学习和大数据的惊人成就以及硬件计算能力的大幅提升,才使得强化学习迎来了一次复兴,同时也使深度强化学习(Deep reinforcement learning, DRL)成为目前人工智能科学中最热门的研究领域之一.
谷歌的深度思维团队是深度强化学习的主要提出者和研究者,他们于2015年在《Nature》杂志上提出了深度Q网络(Deep Q-network,DQN)[2],并让其学习如何操作Atari视频游戏,最终在49个游戏中取得了高于人类专业玩家的得分. 2016年,他们提出了蒙特卡罗树搜索和深度强化学习相结合的算法−人工智能算法(AlphaGo),在与职业九段棋手李世石的……
登录APP查看全文
