APP下载

深度强化学习研究综述

2021-12-20杨思明李刚伟

计算机工程 2021年12期
关键词:动作策略方法

杨思明,单 征,丁 煜,李刚伟

(1.数学工程与先进计算国家重点实验室,郑州 450001;2.中国人民解放军94162 部队,西安 710600;3.中国人民解放军78100 部队,成都 610031)

0 概述

近年来,深度学习(Deep Learning,DL)技术不断发展,凭借深度神经网络优异的特征表示能力,解决了许多学术界和工业界的难题并取得了重要的研究成果。强化学习(Reinforcement Learning,RL)作为解决序列决策的重要方法,赋予智能体自监督学习能力,能够自主与环境进行交互,通过获得的奖励不断修正策略。深度神经网络的引入,使得强化学习取得了很大的进步并衍生出深度强化学习(Deep Reinforcement Learning,DRL)。

深度强化学习近几年在各领域相继取得重大突破。在游戏领域:Atari 系列视频游戏中的智能体使用DRL 算法直接学习图像像素,表现超越了人类水平;DeepMind 公司开发的AlphaGo[1]战胜了顶尖人类棋手,最终版的AlphaZero[2]更是经过自学习的方式,战胜了AlphaGo;腾讯AI Lab 开发的绝悟AI 在《王者荣耀》游戏中击败顶尖人类选手[3],又在Kaggle 的足球AI比赛中获得冠军[4];Open AI 的AlphaStar[5]在《星际争霸2》游戏中以5∶0 战胜了职业选手,展现了AI 在多智能体、复杂状态动作空间中的优秀表现。在商业领域:Facebook 开源了Horizon 强化学习平台,用于开发和部署基于DRL 的推荐系统;阿里在双十一活动中,使用深度强化学习来提高用户点击率;Sliver 提出使用深度强化学习构建针对客户交互的系统[6]。在控制领域,目前已经可以利用DRL 方法实现从现实世界摄像机输入中学习机器人的控制策略[7-8],例如斯坦福大学使用DRL 方法实现对直升机的控制完成特技飞行,达到了人类同等水平。……

登录APP查看全文

猜你喜欢

动作策略方法
例谈未知角三角函数值的求解策略
我说你做讲策略
动作描写要具体
高中数学复习的具体策略
动作描写不可少
用对方法才能瘦
四大方法 教你不再“坐以待病”!
非同一般的吃饭动作
捕鱼
Passage Four