人工智能深度强化学习的重要机制及改进技术
2021-06-24吴英萍耿江涛熊晓波余雪莲
理论与创新 2021年2期
关键词:人工智能
吴英萍 耿江涛 熊晓波 余雪莲


【摘 要】深度强化学习引发了人工智能领域的革命性突破,成为问题解决的通用框架。该学习模式将深层神经网络融入强化学习,不但在图像识别和自然语言处理等领域取得突破性的进展,更在围棋等复杂棋类游戏中具有超人的表现。总结归纳深度强化学习模式的优势在于其具有的6项重要学习机制。然而,这种模式也存在样本数据有效性低的痛点问题。为此提出情景元深度强化学习的改进技术,力图解决困扰深度强化学习的慢速和收敛稳定问题。这对深度强化学习技术的实际应用起到有效的推动作用。
【关键词】深度强化学习;学习机制;情景深度强化学习;元学习;人工智能
引言
近几年人工智能(Artificial Intelligence, AI)的研究取得了革命性的进展。神经网络(Neural Network)或深度学习(Deep Learning,DL)方法的复兴推动了人工智能在图像识别、自然语言处理和许多其他领域的技术突破。
强化学习(Reinforcement learning,RL)与深度学习相结合,产生的深度强化学习(Deep Reinforcement Learning,DRL)近年也取得了令人惊叹的成就。特别是在围棋和象棋等复杂棋类游戏中的超人表现,使其迅速成为人工智能领域的研究热点。
1.深度强化学习的痛点问题及原因
深度强化学习不是从更明确的教学中学习,而是一套学习奖惩的方法,如图所示。表面看来,深度强化学习系统的学习方式与人类截然不同。然而深入探究深度强化学习机制的产生背景,则发现深度强化学习系统的学习机制最初来自动物条件的作用研究,并与以多巴胺为中心的基于奖励学习的神经机制密切相关。……
登录APP查看全文
