基于文本聚类算法的网络舆情话题检测研究
2021-02-05李丽蓉
山西警察学院学报 2021年1期
□李丽蓉
(山西警察学院,山西 太原 030401)
随着互联网技术的快速发展和网民数量的日益增长,网络媒体逐渐成为一种主流信息传播形式,占据主导地位。网络媒体具有全球性、开放性、便捷性、互动性、隐蔽性等特点,在给信息传播带来便捷的同时,也使得网络舆情传播走向放大化和无序化,容易引发舆情热点和敏感话题,有时会造成巨大负面影响。因此,及时准确地发现并监控热点和敏感话题,有针性地做出反应,对构建和谐网络舆论环境,维护社会稳定具有积极的作用。
一、网络舆情检测系统结构
网络舆情检测系统主要包括舆情采集、舆情预处理、舆情分析和舆情处理四部分。
(一)舆情采集
舆情采集主要是对web页面信息采集,通过网络爬虫工具定时、自动从被监测网站上采集信息。“当前主要的爬虫技术有通用型爬虫、主题爬虫和分布式爬虫”,[1]只有高质量的信息采集才能保证后续舆情分析的可靠性和及时性。
(二)舆情预处理
舆情预处理指初步整理采集的web页面信息,包括文本分词、去除停用词、数据清洗等过程,经过结构化处理将原始的半结构化或非结构化数据转换成规范的结构化数据集,存储到舆情数据库中,便于后续的舆情分析使用。
(三)舆情分析
舆情分析是系统的核心部分,指对经过预处理后的舆情信息进行热点挖掘,产生出热点话题,并对话题进行敏感性分析,包括特征提取、话题聚类、热点分析等过程。
(四)舆情处理
舆情处理包括舆情预警和舆情报告,系统根据分析统计得到的舆情信息及相关网络舆情预警指标,实施舆情报警,提交舆情报告。……
登录APP查看全文
