基于特征矩阵优化与数据降维的文本聚类算法
2021-06-22卢佳伟
数据采集与处理 2021年3期
陈 玮,卢佳伟
(上海理工大学光电信息与计算机工程学院,上海200093)
引 言
文本文档作为互联网舆情信息的主要载体,一直是数据信息时代的研究重点,能否监控并处理好这些文本信息是实现社会和谐发展的重要前提。伴随着自然语言处理技术的不断发展,各类文本信息处理的技术愈发完善,对舆情信息的处理也越来越高效,其中文本聚类是文本挖掘、机器学习和模式识别领域最具代表性的技术之一。作为一种无监督学习的方法,文本聚类在数据分析处理上承担着重要的角色,通过将大型的文本文档分解为具有各类特征代表的文档子集,从而实现对文档的管理与监控[1]。
在文本数据处理的过程中,向量空间模型(Vector space model,VSM)是一种被广泛采用的模型,模型内每一个词都被认定为文档的一个特征从而映射到向量空间中[2]。文本文档一般会形成一个高维度的向量空间模型,每一个维度依次对应一个权重值,初始文本文档通常包含高维信息和噪声信息特征,后者以其非相关性、冗杂性和分布散乱性的特点成为聚类工作中一个处理难点[3]。特征选择的主要目的是确定文本中最具代表性和高辨识度的特征。传统文本特征的选择处理有3种方法:基于文档频率(Document frequency,DF)的特征选择、基于词频(Term frequency,TF)的特征选择和基于文档频率和逆词频(Term frequency inverse document frequency,TF⁃IDF)的混合特征选择,这些方法主要依靠词频统计来完成矩阵特征的提取[4]。文献[5]通过确定词对文本密集度的贡献来评定该词的价值,从而找出不损失文本有效信息的最小特征词语集,创造出更为合理的权重计算方案。……
登录APP查看全文
