海量网站中博彩类违法网站的捕获方法
2021-10-27刘家银印杰牛博威诸葛程晨贺海辰
数据采集与处理 2021年5期
刘家银,印杰,牛博威,诸葛程晨,贺海辰
(1.江苏警官学院计算机信息与网络安全系,南京210031;2.江苏警官学院江苏省电子数据取证分析工程研究中心,南京210031;3.江苏警官学院江苏省公安厅数字取证重点实验室,南京210031;4.江苏省公安厅网络安全保卫总队,南京210024;5.南京市公安局大数据中心,南京210005)
引 言
随着互联网技术的蓬勃发展,博彩行业中一些不法分子利用互联网庞大的流量、便捷的支付和强互动性等特点,构建了组织架构严密、分工明确、公司化、制度化运作的线上博彩网站和APP等,重构了另一个网络博彩世界。网络赌博严重影响人们的身心健康,危害正常的经济秩序,败坏社会风气[1⁃2],因此开展网络博彩的检测与阻断,对于维护社会公序良俗,保障经济健康发展具有重要的现实意义。
违法博彩类网站的捕获问题其实质是网页分类问题。早期网页分类常采用黑名单方法[3],具有检测速度快的优点,但是不能处理完全未知的网站,且黑名单数据库的及时更新也是该方法面临的一大难点。然而博彩类违法网站为规避封堵,经常变换其域名,因此基于黑名单的方法在博彩类违法网站的检测中表现不佳。为解决黑名单方法存在的上述问题,部分研究人员通过分析统一资源定位符(Uni⁃form resource locator,URL)[4]、网页文本以及网页图像[5]等来实现网站的分类。基于URL的方法只需从URL中提取特征,因此检测速度极快。然而URL不能完整地表达网站的特征,其应用领域极其有限。网页内容能提供丰富的信息,因此基于网页内容的网站分类方法成为当前研究的主流。……
登录APP查看全文
