APP下载

基于SVM的网络不良信息识别方法

2021-03-04陆向艳,陆生权,刘峻

电脑知识与技术 2021年34期

陆向艳,陆生权,刘峻

摘要:当前用户在互联网中发布的一些文本信息中包含色情、暴力、政治敏感或恶意广告等不良信息,对网络生态环境造成破坏,特别对广大青少年网民的健康成长影响较大。本文提出一种基于SVM的不良信息识别方法,该方法包括文本标记、文本分词、Doc2Vec文本向量化、SVM不良信息分类器训练、SVM不良信息测试5个步骤。实验结果表明该方法能有效识别网络不良信息,为网络不良信息的甄别提供了一种方法参考。

关键词:不良信息 ;SVM;识别;Doc2Vec;Jieba分词

中图分类号:TP391      文献标识码:A

文章编号:1009-3044(2021)34-0097-02

1引言

当前互联网进入了快速发展的阶段,第44次《中国互联网络发展状况统计报告》[1]显示,截至2019年6月,我国网民数量达8.54亿。互联网信息发布呈指数级的快速增长,其中一些信息内容涉及色情、暴力、政治敏感或为恶意广告,这些信息对网络生态环境造成了不良影响,若不加甄别将对广大青少年网民的健康成长带来不利影响。将网络不良过滤后,再呈现给青少年具有重要意义。当前互联网不良信息识别主要有基于语义和基于机器学习两种方法[2-5],基于后者本文提出一种基于SVM的不良信息識别方法,为不良信息识别,净化网络提供参考。

2  基于SVM的网络不良信息识别方法

2.1 识别模型

基于SVM的网络不良信息识别方法包括文本标记、文本分词、Doc2Vec文本向量化、SVM不良信息分类器训练、SVM不良信息测试5个步骤,方法模型如图1所示。

2.2文本标记

用爬虫收集网络文本数据集,将数据集分成训练集和测试集两部分,并进行分类标记,不包含色情、暴力、政治不良和广告这四种敏感词的文本数据集标记为正面数据,包含的则标记为负面数据,并按类别分开训练和测试。……

登录APP查看全文