APP下载

一种权重平均值的深度双Q网络方法

2020-03-21吴金金

计算机研究与发展 2020年3期
关键词:动作游戏

吴金金 刘 全,2,3,4 陈 松 闫 岩

1(苏州大学计算机科学与技术学院 江苏苏州 215006) 2(符号计算与知识工程教育部重点实验室(吉林大学) 长春 130012) 3(江苏省计算机信息处理技术重点实验室(苏州大学) 江苏苏州 215006) 4(软件新技术与产业化协同创新中心(南京大学) 南京 210023)(20174227020@stu.suda.edu.cn)

在强化学习(reinforcement learning, RL)中,通常采用Markov决策过程(Markov decision processes, MDPs)作为不确定情况下的序贯决策问题的框架[1-2].RL的目标是通过最大化累积未来奖赏来获得最优策略.目前部分算法可以应用于带有明确样本转移和奖赏的强化学习问题中,而大多数的无模型算法可以直接学习到不同的动作值[3-5].其中,Q学习(Q-learning)是迄今为止最受欢迎的模型无关的强化学习算法[5-6],但由于在评估动作值过程中包含1个最大化操作,有时学习到的动作值比真实值会高很多,这直接导致了动作值的过高估计.

深度学习(deep learning, DL)已经成为机器学习领域的一大研究热点[7].其能够从原始图像中获取特征,通过线性或者非线性组合来获得更好的数据表征.DL已经在模型压缩、神经语言模型、情感分析等领域取得了很大的突破[8-10].深度学习和强化学习有着不同的特性,结合这两者得到深度强化学习(deep reinforcement learning, DRL)[11-12],可以帮助agent在一些复杂的环境中更好地学习和决策.

深度Q网络(deep Q-network, DQN)是第1个成功结合非线性函数逼近技术——深度神经网络(deep neural network, DNN)和Q学习的算法[13].DQN已经被证明能够在不同Atari 2600游戏中学习到人类级别的控制策略.DQN从当前游戏状态中评估每个可能动作的Q值.考虑到网络中的Q值估计足够精……

登录APP查看全文

猜你喜欢

动作游戏
下一个动作
动作描写要具体
让动作“活”起来
游戏
动作描写不可少
疯狂的游戏
爆笑游戏
第八章直接逃出游戏
非同一般的吃饭动作
第八章 直接逃出游戏