APP下载

基于BERT模型的文本对抗样本生成方法

2023-10-21李宇航杨玉丽马垚于丹陈永乐

计算机应用 2023年10期
关键词:关键单词文本

李宇航,杨玉丽,马垚,于丹,陈永乐

基于BERT模型的文本对抗样本生成方法

李宇航,杨玉丽,马垚,于丹,陈永乐*

(太原理工大学 计算机科学与技术学院(大数据学院),太原 030600)( ∗ 通信作者电子邮箱chenyongle@tyut.edu.cn)

针对现有对抗样本生成方法需要大量访问目标模型,导致攻击效果较差的问题,提出了基于BERT (Bidirectional Encoder Representations from Transformers)模型的文本对抗样本生成方法(TAEGM)。首先采用注意力机制,在不访问目标模型的情况下,定位显著影响分类结果的关键单词;其次通过BERT模型对关键单词进行单词级扰动,从而生成候选样本;最后对候选样本进行聚类,并从对分类结果影响更大的簇中选择对抗样本。在Yelp Reviews、AG News和IMDB Review数据集上的实验结果表明,相较于攻击成功率(SR)次优的对抗样本生成方法CLARE(ContextuaLized AdversaRial Example generation model),TAEGM在保证对抗攻击SR的前提下,对目标模型的访问次数(QC)平均减少了62.3%,时间平均减少了68.6%。在此基础之上,进一步的实验结果验证了TAEGM生成的对抗样本不仅具有很好的迁移性,还可以通过对抗训练提升模型的鲁棒性。

对抗样本;注意力机制;BERT;对抗攻击;聚类算法

0 引言

针对机器学习模型容易受到对抗样本威胁的问题[1],国内外学者开展了关于对抗样本生成技术的深入研究,并取得一系列的研究成果。目前的研究主要集中在图像领域[2],涉及文本领域的研究较少[3-4]。原因主要为以下两方面:1)文本领域中单词的离散属性。与具备连续性的图像空间不同,句子中的单词是离散的,在图像领域,像素级别的改变并不会影响图片表达的意思;……

登录APP查看全文

猜你喜欢

关键单词文本
高考考好是关键
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
看图填单词
看完这些单词的翻译,整个人都不好了
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
获胜关键
如何快速走进文本
生意无大小,关键是怎么做?
单词拾趣