基于改进LDA模型的信息安全事件提取算法
2021-01-10吴君戈张笑笑邹春明宋好好
网络空间安全 2020年12期
吴君戈,张笑笑,邹春明,宋好好
(公安部第三研究所/上海网络与信息安全测评工程技术研究中心,上海 200031)
1 引言
随着互联网技术的不断发展,信息化已经深入到人们生活的方方面面,信息化高速发展也导致了各式各样信息安全事件的出现,给人民的财产安全造成了严重的威胁[1]。与此同时,信息安全事件往往被淹没在海量的新闻事件中,研究人员较难快速地定位到信息安全事件之上,难以有针对性地提出解决方案[2]。因此,如何有效地从海量的新闻事件中抽取出信息安全事件,对于维护社会稳定和公共利益具有积极而重要的意义[3]。
近年来,国内外学者针对信息安全事件的分类提取工作进行了大量的研究。文献[4]中,作者利用TextRank和隐含狄利克雷分布(Latent Dirichlet Allocation,LDA)模型对信息安全热点事件进行分类和提取,然而LD模型需提前预设参数,参数选择对于其分类性能有着直接的影响。文献[5]中,G Jelena等人提出了基于K最近邻(k-Nearest Neighbor,KNN)分类算法和支持向量机(Support Vector Machine, SVM)的多层文本分类算法,并证明了所提算法的有效性。然而,实验中所用数据需提前进行主标签分类,当数据量增加时分类效率必然会有所降低。文献[6]中,A Ritter等人提出利用弱监督学习算法从Twitter上提取信息安全事件,但是由于Twitter属于文本表现自由的短文本,较之新闻文本有较大差别,因此该算法用于新闻文本中进行信息安全事件的分类抽取时并无优势。
对于信息安全管理而言,如何快速、准确地从大量新闻事件中提取信息安全事件是一个挑战。……
登录APP查看全文
