基于深度强化学习的黑盒对抗攻击算法
2021-04-23韩立新
计算机与现代化 2021年4期
李 蒙,韩立新
(河海大学计算机与信息学院,江苏 南京 211100)
0 引 言
随着深度神经网络(Deep Neural Network, DNN)的广泛应用,人脸识别[1]、目标检测[2]、目标跟踪[3]等领域都出现了与DNN相结合的方法。在图像识别领域中,基于深度神经网络的方法甚至已经超越了人眼的识别效率。尽管在许多领域中DNN取得了成功,但一些研究发现DNN很容易受到一些人为的微小扰动的干扰,从而产生错误的结果。Szegedy等[4]首次提出将微小扰动添加到图像上的方法并成功欺骗了当时最先进的图像分类DNN模型,这些被误分类的图像被称为对抗样本,这种对模型输入进行微小扰动,试图使模型产生错误输出的算法被称为对抗攻击算法。当DNN模型部署到涉及安全、隐私等领域的应用上时,对抗样本的存在会对这些应用的可靠性造成重大影响,因此研究对抗攻击方法具有重要意义。
对抗攻击算法可以根据攻击目的分为2类[5]:1)目标攻击,攻击者使受攻击的模型将对抗样本误分类到指定的类别;2)非目标攻击,不指定攻击的类别,使受攻击模型产生错误的分类结果即可。根据攻击者获得的受攻击模型知识,还可以将对抗攻击方法分为2类[5]:1)白盒攻击,攻击者可以利用受攻击模型的所有信息,如模型的结构、参数和训练方法等;2)黑盒攻击,攻击者只能与受攻击模型进行交互以获得有限的知识,如模型的输出等,目前主要有基于对抗样本迁移性的攻击和基于交互的攻击。根据模型输出信息的特点,可以将基于交互的攻击分为基于分数的攻击和基于决策的攻击[6],基于分数的攻击需要模型输出样本的预测分数,基于决策的攻击仅需要模型离散的标签输出。……
登录APP查看全文
