针对深度学习的对抗攻击综述*
2021-05-15郭嘉宝彭钺峰
密码学报 2021年2期
刘 会, 赵 波, 郭嘉宝, 彭钺峰
武汉大学 国家网络安全学院, 武汉430072
1 引言
深度学习被广泛应用于计算机视觉、自然语言处理、语音识别等多个领域并取得了重大突破.尤其在图像识别和图像分类的任务中, 深度学习具备非常高的准确度, 甚至表现出了超越人类的工作能力.然而,即使深度神经网络通过模拟人类大脑神经网络结构取得了显著的效果, 但是深度神经网络的理解方式与人类认知仍然存在较大差异, 深度学习的工作原理缺乏可解释性, 其输出结果的可信性难以得到有效的保障.深度学习缺乏可解释性由其自身结构和运行机理决定, 具体表现在以下3 个方面: (1) 深度神经网络的神经元数量大、参数多; (2) 神经网络采用分层结构, 层次之间连接方式多样; (3) 神经网络自主学习样本特征, 而许多特征人类无法理解.在探索深度学习的可解释性、揭示深度学习的工作原理的过程中, Szegedy等人[1]发现深度神经网络对加入特定扰动的图像样本表现出极高的脆弱性, 并将这种带有对抗扰动的样本称之为“对抗样本”(见图1).

图1 对抗样本生成示例Figure 1 Adversarial example
在计算机视觉领域, 对抗样本现象是指对输入图像加入人眼视觉难以感知的轻微扰动, 导致基于深度学习的图像分类器以高置信度的方式输出错误的结果.在数字水印领域[2], 对抗扰动会影响嵌入模式的完整性, 使得水印无法检测, 数字媒体的真实性无法得到有效验证.Sharif[3]通过优化方法计算扰……
登录APP查看全文
