APP下载

分层强化学习综述

2021-02-04魏竞毅陈希亮

计算机工程与应用 2021年3期
关键词:动作智能环境

赖 俊,魏竞毅,陈希亮

陆军工程大学 指挥控制工程学院,南京210007

强化学习(Reinforcement Learning,RL)是机器学习的一个重要分支,它是智能体(Agent)根据自身状态(State)采取动作(Action)与环境进行交互获取奖励,最终完成一个最优策略使奖励最大化。2017 年最具影响力的AlphaGo大胜世界围棋冠军李世石和柯洁事件,其核心算法就是强化学习算法。但在传统强化学习中面临着维数灾难的问题,因为所有强化学习的方法都把状态动作空间视为一个巨大的、平坦的搜索空间,这也就意味着一旦环境较为复杂,状态动作空间过大,将会导致起始状态到目标状态的路径非常长,需要学习参数以及学习过程中的存储空间将会非常大,使得学习的难度成指数增加,并且强化学习效率以及效果不尽如人意。

之后随着深度学习的再次兴起,其强大的探索能力受到了广大科研人员的热捧,于是结合两者深度强化学习也就此应运而生,深度强化学习不仅具有强大的探索能力,对于复杂的环境状态都能够有一个良好的处理,但当智能体具有复杂动作空间时,其依旧不能取得良好的结果,使得强化学习的发展再次碰触到了瓶颈。为解决强化学习发展的瓶颈问题,研究者们将分层的思想加入强化学习中,提出分层深度强化学习(Hierarchical Deep Reinforcement Learning,HRL),HRL 的本质是通过将任务分解为不同抽象层次上的子任务,子任务的状态动作空间有限,对子任务能够有较快的求解速度,最终加快整体问题的求解[1]。经过分层深度强化学习在竞技对抗游戏中,人工智能不断发力,在例如DOTA2、星际争霸2 这类复杂的竞技对抗游戏中与游戏职业顶尖人员进行对抗并取得了胜利,甚至在与普通人对战时出现人类一败涂地的情况。……

登录APP查看全文

猜你喜欢

动作智能环境
长期锻炼创造体内抑癌环境
一种用于自主学习的虚拟仿真环境
孕期远离容易致畸的环境
环境
智能前沿
智能前沿
智能前沿
智能前沿
动作描写要具体
动作描写不可少