APP下载

拟双曲动量梯度的对抗深度强化学习研究

2021-12-21马志豪朱响斌

计算机工程与应用 2021年24期
关键词:动作环境

马志豪,朱响斌

浙江师范大学 数学与计算机科学学院,浙江 金华321004

在过去的几年中,深度强化学习领域获得了广泛关注,其应用领域也得到迅速增长。深度强化学习领域的一个重要吸引力是将深层神经网络特征学习功能与经典强化学习结合使用,因而可以通过将原始观察结果直接映射到操作行为来实现端到端策略学习。凭借深层神经网络作为函数逼近器,深度强化学习在各种挑战性任务(例如,视频游戏、机器人技术和经典控制[1])上均取得了显著成果,但最近的研究表明,这些策略易受对抗性攻击,对手对输入的微小干扰,会导致模型预测的输出不正确[2-4]。

深度学习算法之所以如此强大,是因为其利用了深层神经网络的多层结构。这意味着当尝试对输入进行分类时,可以从输入的许多不同特征中找到判断结果的依据。接受过识别大熊猫训练的agent可能会发现诸如色块、纹理或形状之类的特征,这与人们眼中显而易见的事物(如黑白)一样可预测。但这也意味着利用输入的微小变化可以使agent观察到明显不同的状态。深度神经网络(Deep Neural Network,DNN)构建的模型在图像任务中已取得显著成果。但研究表明,DNN极易被对抗样本攻击。

强化学习(RL)任务与分类任务不同的地方在于强化学习是通过一系列动作来收集样本,同时这些动作也改变了环境状态,每次执行动作后,agent通过观察获得环境更新后当前状态,这个观察可能包含不确定性,该不确定性源于环境的改变、观察的不准确和黑客的有意攻击。……

登录APP查看全文

猜你喜欢

动作环境
长期锻炼创造体内抑癌环境
一种用于自主学习的虚拟仿真环境
下一个动作
孕期远离容易致畸的环境
不能改变环境,那就改变心境
环境
孕期远离容易致畸的环境
动作描写要具体
让动作“活”起来
动作描写不可少