APP下载

基于随机方差减小方法的DDPG算法

2021-10-14杨薛钰陈建平傅启明1悠1吴宏杰1

计算机工程与应用 2021年19期
关键词:动作策略实验

杨薛钰,陈建平,傅启明1,,5,陆 悠1,,5,吴宏杰1,,5

1.苏州科技大学 电子与信息工程学院,江苏 苏州 215009

2.苏州科技大学 江苏省建筑智慧节能重点实验室,江苏 苏州 215009

3.苏州科技大学 苏州市移动网络技术与应用重点实验室,江苏 苏州 215009

4.珠海米枣智能科技有限公司,广东 珠海 519000

5.苏州科技大学 苏州市虚拟现实智能交互与应用技术重点实验室,江苏 苏州 215009

强化学习是机器学习的一个重要分支,强化学习的基本思想就是学习如何将场景映射到动作,以获得最大的数值奖赏信号,从而学习完成目标的最优策略[1]。具体而言,就是智能体处在一个环境中,每个状态为智能体对当前环境的感知,智能体通过动作来影响环境,当智能体执行一个动作后,会使得环境按照某种概率转移到另外一种状态;同时,环境会根据潜在的奖赏函数反馈给智能体一个奖赏。强化学习中主要包括四个要素:状态、动作、转移概率以及奖赏函数。目前强化学习在游戏博弈,工业领域中均得到很好的应用[2]。

深度学习是机器学习的另一个重要的分支,是一种以人工神经网络为架构,对数据进行表征学习的算法,它是从数据中学习表示的一种新方法[3]。强调从连续的层中进行学习,这些层对应于越来越有意义的表示。至今为止已有数种深度学习框架,如深度神经网络、卷积神经网络和深度置信网络等。最近几年,深度学习在实践中也取得了革命性的进展,在计算机视觉、语音识别、自然语言处理等领域取得了显著的成果[4]。……

登录APP查看全文

猜你喜欢

动作策略实验
记一次有趣的实验
例谈未知角三角函数值的求解策略
做个怪怪长实验
我说你做讲策略
动作描写要具体
高中数学复习的具体策略
动作描写不可少
NO与NO2相互转化实验的改进
实践十号上的19项实验
非同一般的吃饭动作