APP下载

基于BiGRU-Attention-CNN模型的垃圾邮件检测方法

2021-04-23赵宇轩胡怀湘

计算机与现代化 2021年4期
关键词:分类文本实验

赵宇轩,胡怀湘

(华北计算技术研究所基础一部,北京 100083)

0 引 言

电子邮件自从20世纪70年代诞生以来距今已有50年,它已成为人们日常生活、工作中最常用的通信工具之一。然而随着邮件技术的普及,垃圾邮件也变得越发猖獗。根据奇安信和Coremail联合编撰的2019中国企业邮箱安全性研究报告[1]显示,2019年全国企业邮箱用户收到的各类垃圾邮件约占企业级用户邮件收发总量的47.2%,是企业级用户正常邮件数量的1.2倍。垃圾邮件已经成为困扰企业邮件安全的重大问题,因此如何快速准确地识别垃圾邮件是一个重要的研究课题。

目前识别垃圾邮件主要有2类方法:一类是基于邮件特征的识别,比如发件人的发信频率,发件地址黑名单RBL[2]、DBL等;另一类是基于邮件内容的识别,传统方法包括字符匹配、词频统计(TF-IDF、LDA[3]、朴素贝叶斯等算法)。近年来随着深度学习网络的不断发展,卷积神经网络(Convolutional Neural Network, CNN)、循环神经网络(Recurrent Neural Network, RNN)等技术也逐渐应用在垃圾邮件识别领域。CNN模型通过“端到端”的学习,能够有效地学习并提取数据样本特征,在图像处理、人脸识别、自动驾驶等领域有着广泛的应用。RNN模型是一种序列模型,研究人员在RNN的基础上提出了变体模型:双向门控循环单元(BiGRU)。BiGRU更适合对文本建模、获取文本全局的结构信息。对于邮件文本的分类,邮件中的关键词提取也非常重要。注意力机制(Attention)可以对邮件中重要的词赋予更高的权重,可以更好提取关键信息。本文综合3种模型的优点,提出基于BiGRU-Attention-CNN模型的垃圾邮件检测方法。……

登录APP查看全文

猜你喜欢

分类文本实验
记一次有趣的实验
分类算一算
在808DA上文本显示的改善
做个怪怪长实验
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
NO与NO2相互转化实验的改进
实践十号上的19项实验
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本