基于对抗样本生成的验证码反爬虫机制研究
2021-12-15马军王效武朱永川王海兮
应用科技 2021年6期
马军,王效武,朱永川,王海兮
1.深圳市网联安瑞网络科技有限公司,广东 深圳 518000 2.中国电子科技集团公司第三十研究所,四川 成都 610041
近年来,互联网信息呈现出指数级增长的趋势,而数据对于商家则至关重要。通过海量互联网数据分析,不仅能降低企业的运营成本,还能提前预估产品的需求,进而降低生产和库存成本。然而,用户对海量互联网数据的采集,使得互联网服务器承受巨大的压力;尤其是大量网络爬虫机器人的存在,造成数据采集的频次和速度超过人类的浏览速度,影响网络服务器的正常运行[1]。因此,大量网站都采用了多种反爬虫的机制,验证码识别则是众多反爬机制中的一种[2]。
对于普通的验证码,部分人工智能的技术能自动识别验证码,突破验证码识别机制,并配合网络爬虫实现全自动化的信息采集。但人工智能技术不是无懈可击,其自身也存在潜在的漏洞[3-5]。为了确保验证码图片不被基于智能算法的机器人识别,利用人工智能技术的弱点,构造出基于图像扰动技术的扰动样本,这些样本能有效降低机器人的识别准确度,使网络机器人自动识别验证码的功能失效,从而提高系统安全性。
对抗样本可作为机器学习或深度学习模型的输入,最终导致模型得出错误的分类结果[6-7]。其设计的基本思想是攻击者在原始图片中添加较小的扰动,就能使模型结果产生截然不同的错误判断,这些扰动被称为对抗样本。……
登录APP查看全文
