APP下载

基于平均序列累计奖赏的自适应ε-greedy策略

2021-06-11杨彤,秦进

计算机工程与应用 2021年11期
关键词:利用动作智能

杨 彤,秦 进

贵州大学 计算机科学与技术学院,贵阳550025

强化学习[1]作为求解序贯优化决策问题的途径之一,以最大化累计奖赏为目标。智能体使用极少的先验知识,利用与环境交互过程中的试错学习能力,感知环境并采取动作影响环境,得到环境给予的奖励,再根据奖励值的大小调整下一次所采取的动作,不断调节策略,最终在这个交互过程中学习到最大化累计奖赏的策略。传统的强化学习方法使用表格法对离散状态空间的值函数进行存储,但在处理高维连续状态空间时表格法的存储方式会受到限制,使用线性或非线性函数对强化学习中的值函数进行参数化表示,可以改善处理高维状态空间时所遇到的问题。因此,将深度学习[2]从大规模原始数据中抽象本质特征的能力和强化学习通过不断试错感知环境获取最大化累计奖赏的决策能力相结合,形成能够将深度学习抽象出来的数据特征作为输入,通过与环境交互以找到解决问题的最优策略的深度强化学习[3]。深度Q网络[4](Deep Q-Network,DQN)为深度强化学习的代表性算法,实验证明该算法在Atari 2 600的大多数视频游戏中表现优异。并且在人机对抗[5]、机器人控制[6]等领域取得突破成果。

与机器学习[7]中的监督学习、无监督学习等侧重于从固定数据样本中学习不同,强化学习中的数据样本不是由人类收集,而是由智能体与环境交互所生成。智能体在与环境的交互过程中依据行为策略选择动作,不同的行为策略使得智能体采取不一样的动作,导致得到不同的数据样本分布,通过这些数据样本会学习到不同的目标策略,最终影响到智能体所获得的累计奖赏。……

登录APP查看全文

猜你喜欢

利用动作智能
利用min{a,b}的积分表示解决一类绝对值不等式
利用一半进行移多补少
智能前沿
智能前沿
智能前沿
智能前沿
利用数的分解来思考
Roommate is necessary when far away from home
动作描写要具体
动作描写不可少