基于随机方差减小方法的DDPG算法
2021-10-14杨薛钰陈建平傅启明1悠1吴宏杰1
计算机工程与应用 2021年19期
杨薛钰,陈建平,傅启明1,,5,陆 悠1,,5,吴宏杰1,,5
1.苏州科技大学 电子与信息工程学院,江苏 苏州 215009
2.苏州科技大学 江苏省建筑智慧节能重点实验室,江苏 苏州 215009
3.苏州科技大学 苏州市移动网络技术与应用重点实验室,江苏 苏州 215009
4.珠海米枣智能科技有限公司,广东 珠海 519000
5.苏州科技大学 苏州市虚拟现实智能交互与应用技术重点实验室,江苏 苏州 215009
强化学习是机器学习的一个重要分支,强化学习的基本思想就是学习如何将场景映射到动作,以获得最大的数值奖赏信号,从而学习完成目标的最优策略[1]。具体而言,就是智能体处在一个环境中,每个状态为智能体对当前环境的感知,智能体通过动作来影响环境,当智能体执行一个动作后,会使得环境按照某种概率转移到另外一种状态;同时,环境会根据潜在的奖赏函数反馈给智能体一个奖赏。强化学习中主要包括四个要素:状态、动作、转移概率以及奖赏函数。目前强化学习在游戏博弈,工业领域中均得到很好的应用[2]。
深度学习是机器学习的另一个重要的分支,是一种以人工神经网络为架构,对数据进行表征学习的算法,它是从数据中学习表示的一种新方法[3]。强调从连续的层中进行学习,这些层对应于越来越有意义的表示。至今为止已有数种深度学习框架,如深度神经网络、卷积神经网络和深度置信网络等。最近几年,深度学习在实践中也取得了革命性的进展,在计算机视觉、语音识别、自然语言处理等领域取得了显著的成果[4]。……
登录APP查看全文
