面向自然语言处理的对抗攻防与鲁棒性分析综述
2021-08-17郑海斌陈晋音张旭鸿葛春鹏欧阳亦可纪守领
郑海斌 陈晋音,2 章 燕 张旭鸿 葛春鹏 刘 哲 欧阳亦可 纪守领
1(浙江工业大学信息工程学院 杭州 310023) 2(浙江工业大学网络空间安全研究院 杭州 310023) 3(浙江大学控制科学与工程学院 杭州 310063) 4(南京航空航天大学计算机科学与技术学院 南京 211106) 5(华为技术有限公司南京研究所 南京 210029) 6(浙江大学计算机科学与技术学院 杭州 310063)
深度神经网络(deep neural networks, DNNs)的突破性发展使其成为人工智能技术的重要分支之一,在图像识别、无人驾驶、自然语言处理(natural language processing, NLP)、网络图谱分析、生物医疗诊断等领域得到广泛应用.尤其是在NLP领域中,DNNs被广泛应用在机器翻译[1]、自动文本摘要[2]、语音识别及文本转换[3]、信息抽取与过滤[4]、文本分类与聚类[5]等任务中.与此同时,研究发现DNNs在图像识别领域中极易受到对抗性扰动[6]的影响,使得DNNs预测错误.目前普遍认为,神经网络容易受到对抗性扰动的主要原因在于它们在高维空间中的线性行为[7].
不仅计算机视觉领域的DNNs容易受到攻击,NLP领域的DNNs(即NLP模型)同样面临着安全威胁,具体表现为NLP模型在使用过程中容易受到精心制作的对抗文本的干扰.由于图像和文本数据存在数据结构的内在差异,因此并不能直接将图像上的攻击方法直接应用到文本数据中.针对图像数据的扰动是人眼难以察觉的像素级别的微小变化,因此人类仍然可以正确地对受扰动的图像进行正确分类而DNNs不行.但是对于文本的对抗性攻击,由于语言阅读的习惯和前后文的逻辑关系,人类此……
