新闻类短文本聚类新方法的研究
2021-01-15傅承涛谢佳璇牛永洁
延安大学学报(自然科学版) 2020年4期
傅承涛,谢佳璇,牛永洁
(延安大学继续教育学院,陕西延安716000)
随着信息技术的发展和自媒体的迅速普及,各领域迅速积累了大量的文本资源,对这些文本资源的处理、挖掘进而得到感兴趣的知识显得日益重要。文本聚类是根据文本内容对文本进行归类处理,属于非监督学习的一种,文本聚类可以为信息检索[1]、知识图谱[2,3]、自动摘要[4]、人机对话、知识问答等领域提供支持,因此文本聚类已经逐渐成为自然语言处理和文本数据挖掘的研究热点[5]。
对新闻类文本聚类可以对相同类别的新闻展开研究,比如研究同一事件在不同时间、不同地点的处理方式不同,对研究不同国家、不同地区、不同政党、不同时期政策的变化具有重要的参考价值。而且新闻类文本聚类可以出现某些新闻之间内在的关联,为社交网络、知识国谱、知识问答等提供一定的数据支持。文本聚类首先要解决的问题是文本表示,目前对文本表示的方法有基于词频的TF-IDF模型[6],基于词语关联度的TextRank模型[7],这些模型词语出现的频率和词语之间关联度的大小对词语进行编码,尽管解决了文本的表示问题,也一定程度上反映了文本的内容,但是它们都基本没有考虑文本的语义信息,而且由于采用词袋的思想,往往会造成数据维度高的问题。
Mikolov等在2013年提出Word2vec模型,利用神经网络模型将词语转换到带有一定语义特性的高维空间,Word2vec模型的词语向量具有一定的语义信息,一定程度上可以进行语义运算,比如:国王+女人=女王,但Word2vec对文本编码的过程中仅限于微观,失去了词序在语义表达方面的作用[8]。……
登录APP查看全文