结合TFIDF的Self-Attention-Based Bi-LSTM的垃圾短信识别①
2020-09-22吴思慧陈世平
计算机系统应用 2020年9期
关键词:机制
吴思慧,陈世平
1(上海理工大学 光电信息与计算机工程学院,上海 200093)
2(复旦大学 上海市数据科学重点实验室,上海 201203)
21世纪以来,手机用户不断增加,特别是智能手机的使用越来越多,人们可以通过短信快速高效的获取信息,但随之而来的是垃圾短信的泛滥,垃圾短信不仅仅影响到人们正常的手机使用和体验,更主要的是垃圾短信会带来严重的安全隐患,很多不法分子通过垃圾短信获取用户的私人信息,危害到用户隐私安全.因此,垃圾短信的识别具有重要的现实意义.治理垃圾短信不仅需要有关部门的持法监督和相应手机安全厂商的屏蔽,同时应该利用先进的技术,直接在源头上消灭垃圾短信.
目前常用的垃圾短信识别的方法主要包括基于黑白名单的方法,基于规则的方法和基于短信内容的方法这样3 种[1],前两种方法要人工手动添加发送垃圾短信号码的名单或者手动添加与垃圾短信对应关键词,由于手动添加的数据量有限且效率低,因此目前主要是使用基于短信内容的方法来进行短信识别,即将文本分类技术用于识别垃圾短信.
文本分类是计算机应用于根据特定的分类系统或者标准自动分类文本[2,3].随着深度学习在自然语言预处理领域的应用,相对于传统的文本分类算法如朴素贝叶斯,支持向量机等[4-6],深度学习在文本分类上获得了令人满意的结果.目前长短时记忆网络(Long Short-Term Memory,LSTM)已经广泛应用在文本分类……
登录APP查看全文
