APP下载

基于可中断Option的在线分层强化学习方法

2016-10-13朱斐许志鹏刘全伏玉琛王辉

通信学报 2016年6期
关键词:动作环境实验

朱斐,许志鹏,刘全,伏玉琛,王辉



基于可中断Option的在线分层强化学习方法

朱斐1,2,许志鹏1,刘全1,2,伏玉琛1,王辉1

(1. 苏州大学计算机科学与技术学院,江苏苏州215006;2. 吉林大学符号计算与知识工程教育部重点实验室,吉林长春130012)

针对大数据体量大的问题,在Macro-Q算法的基础上提出了一种在线更新的Macro-Q算法(MQIU),同时更新抽象动作的值函数和元动作的值函数,提高了数据样本的利用率。针对传统的马尔可夫过程模型和抽象动作均难于应对可变性,引入中断机制,提出了一种可中断抽象动作的Macro-Q无模型学习算法(IMQ),能在动态环境下学习并改进控制策略。仿真结果验证了MQIU算法能加快算法收敛速度,进而能解决更大规模的问题,同时也验证了IMQ算法能够加快任务的求解,并保持学习性能的稳定性。

大数据;强化学习;分层强化学习;Option;在线学习

1 引言

在强化学习(RL,reinforcement learning)框架中,用户给出问题的目标,agent选择某一个动作,实现与环境的交互,获得环境给出的奖赏作为强化信号,agent根据强化信号和环境当前状态再选择下一个动作。Agent的目标是在每个离散状态发现最优策略以使期望的折扣奖赏和最大[1]。作为一种具有较高通用性的机器学习框架,强化学习得到了较为广泛的研究和应用[2]。然而,由于强化学习的算法需要通过不断地与环境交互来进行学习,同时还要保存经验数据,因此当问题规模扩大时,算法的复杂度往往会以指数级上升,导致算法的性能急剧下降,所以强化学习的经典算法很难直接用于解决数据规模比较大的问题。……

登录APP查看全文

猜你喜欢

动作环境实验
记一次有趣的实验
长期锻炼创造体内抑癌环境
一种用于自主学习的虚拟仿真环境
孕期远离容易致畸的环境
做个怪怪长实验
环境
动作描写要具体
动作描写不可少
NO与NO2相互转化实验的改进
实践十号上的19项实验