APP下载

基于5G的强化学习算法分析与挑战

2022-09-21董春利王莉

电子测试 2022年17期
关键词:监督环境策略

董春利,王莉

(南京交通职业技术学院电子信息工程学院,江苏南京, 211188)

0 引言

强化学习(RL)是指通过在环境中采取一些行动,来增加奖励。这种学习涉及执行使这些奖励最大化的那些行动。这种类型的学习行为与自然学习相同,其中代理必须通过命中和试验机制自己学习以获得最大奖励[1]。机器学习(ML)可分为监督、无监督和半监督学习。RL(半监督)不同于有监督和无监督学习。在监督学习中,每个动作都有一组指令,目标是映射输入对应的输出并从标记数据中学习规则。此类中使用回归和分类模型,取决于值是连续的,还是离散的。而在无监督学习的情况下,代理必须发现未标记数据的隐藏结构[2]。无监督学习与有监督学习相反,通常可以在数据不足且未标记时应用。但是在RL的情况下,代理具有初始点和终点,并且要到达其目的地,代理必须通过操纵环境来找到最佳可能的行动。达到最终解决方案后,代理会获得奖励,但如果未能达到,则不会获得任何奖励,因此,代理必须学习环境才能获得最大的奖励。在RL中,问题的制定是使用马尔可夫决策过程(MDP) 完成的,解决方案可以是策略或模型库,并且可以是无模型的,即 Q-learning、SARSA。在这种技术中,代理与环境交互并根据奖励生成策略,最后系统被训练并提供改进的性能。

1 RL模式

RL有两个主要特征:(i)试错搜索;(ii)延迟奖励。图1显示了RL和深度Q学习模式。

图1 (a)RL示意图,(b)深度Q学习示意图

模型用于预测环境的性质。同时使用规划和模型的ML设计是基于模型的机制。……

登录APP查看全文

猜你喜欢

监督环境策略
长期锻炼创造体内抑癌环境
一种用于自主学习的虚拟仿真环境
突出“四个注重” 预算监督显实效
例谈未知角三角函数值的求解策略
孕期远离容易致畸的环境
我说你做讲策略
环境
高中数学复习的具体策略
监督见成效 旧貌换新颜
夯实监督之基