APP下载

基于对抗样本生成的验证码反爬虫机制研究

2021-12-15马军王效武朱永川王海兮

应用科技 2021年6期
关键词:数据库文本信息

马军,王效武,朱永川,王海兮

1.深圳市网联安瑞网络科技有限公司,广东 深圳 518000 2.中国电子科技集团公司第三十研究所,四川 成都 610041

近年来,互联网信息呈现出指数级增长的趋势,而数据对于商家则至关重要。通过海量互联网数据分析,不仅能降低企业的运营成本,还能提前预估产品的需求,进而降低生产和库存成本。然而,用户对海量互联网数据的采集,使得互联网服务器承受巨大的压力;尤其是大量网络爬虫机器人的存在,造成数据采集的频次和速度超过人类的浏览速度,影响网络服务器的正常运行[1]。因此,大量网站都采用了多种反爬虫的机制,验证码识别则是众多反爬机制中的一种[2]。

对于普通的验证码,部分人工智能的技术能自动识别验证码,突破验证码识别机制,并配合网络爬虫实现全自动化的信息采集。但人工智能技术不是无懈可击,其自身也存在潜在的漏洞[3-5]。为了确保验证码图片不被基于智能算法的机器人识别,利用人工智能技术的弱点,构造出基于图像扰动技术的扰动样本,这些样本能有效降低机器人的识别准确度,使网络机器人自动识别验证码的功能失效,从而提高系统安全性。

对抗样本可作为机器学习或深度学习模型的输入,最终导致模型得出错误的分类结果[6-7]。其设计的基本思想是攻击者在原始图片中添加较小的扰动,就能使模型结果产生截然不同的错误判断,这些扰动被称为对抗样本。……

登录APP查看全文

猜你喜欢

数据库文本信息
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
订阅信息
数据库
数据库
数据库
数据库
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
展会信息
如何快速走进文本