基于Word2Vec 的疫情虚假信息检测方法
2021-02-25齐浩翔马莉媛朱翌民
智能计算机与应用 2021年10期
齐浩翔, 马莉媛, 朱翌民
(上海工程技术大学 电子电气工程学院, 上海 201620)
0 引 言
互联网的发展催生了微博、推特、贴吧、微信公众号等社交网络,新媒体时代人们获取信息更加便捷,但是随之而来的信息造假、虚假信息传播等问题也不容忽视。 在信息传播的过程中,如若虚假信息传播过甚,并形成一定规模的网络舆情,就可能引发群体性事件,甚至造成不可估量的后果。 在信息爆炸的大数据时代,人工识别虚假信息已然不能够满足当下需求,因此如何快速、精准地识别虚假信息是当前研究的热点之一。
识别虚假信息可以转换为文本分类问题。 对于文本分类问题的研究,大多基于传统的向量空间模型。 Salton 等人[1]提出的向量空间模型是现阶段使用最广泛的一种文本表示模型(VSM),传统的VSM模型的主要问题是维度高或者文本表示向量稀疏。降维一般从2 个方面进行,一是特征选择,二是特征提取,通过这两个方面的改进来提高文本分类的准确率。 近年来,对于文本分类大多采用主题模型(LDA),该模型由Blei 等人提出,主要优点就是能够发现语料库中潜在的主题信息[2-3];方东昊[4]利用LDA 对微博进行分类,取得了不错的效果,但该方法需要大量的外部语料,复杂度相对较高;Kim[5]提出了一种利用卷积神经网络来处理句子分类问题的模型,该方法证明了深度学习相关技术在文本分类中具有很好的效果;Mikolov 等人[6-8]提出了Word2Vec 模型用于计算文本中特征的词的分布式表示,该方法可以很好地表达句子中的语义信息,但却无法区分文本中词汇的重要程度。……
登录APP查看全文
