文本对抗样本攻击与防御技术综述
2021-10-12杜小虎吴宏明易子博李莎莎
中文信息学报 2021年8期
杜小虎,吴宏明,易子博,李莎莎,马 俊,余 杰
(1. 国防科技大学 计算机学院, 湖南 长沙 410073;2. 中央军委装备发展部 装备项目管理中心,北京 100034)
1 介绍
1.1 对抗样本
深度神经网络在解决各种现实任务中有着广泛的应用并取得了不错的效果,如计算机视觉[1-2]、图像分类[3]和自然语言处理[4-5]等领域。但是,近年来,人们开始关注神经网络的安全性与鲁棒性问题[6],神经网络容易受到对抗样本的攻击,例如,指纹识别[7],攻击者可以利用对抗样本来做伪装,非法破解指纹识别器。在垃圾邮件检测[8]中,攻击者也可以通过伪装逃避检测。在NLP任务中,神经网络可能受到经过精心修改的文本欺骗,这种修改后的文本与原始文本有着相当高的相似性,鲁棒的神经网络模型会对相似的文本做出与原文本一致的预测,但神经网络会对这种修改后的文本做出文本预测错误,这种经过微小修改后的文本称为对抗样本,使用这些对抗样本使神经网络发生错误的过程叫做对抗攻击。
1.2 相关术语
鲁棒性(robustness): 鲁棒性[9]反映了自然语言处理模型对不同输入样本的适应程度,一个鲁棒性高的模型更加不易受到对抗样本的攻击。模型在意义相似或相近的输入文本上能够表现出一致的性能。
词向量(word embedding): 也叫词嵌入,由于深度神经网络的输入只能是连续的向量,所以其不能处理实际的文本,词向量即是文本在词空间中映射出的由实数组成的向量。
扰动(perturbation): 对原始文本做出的细微修改称为扰动,如对文本中单词的修改、删除和增加等操作。……
登录APP查看全文
