APP下载

基于特征矩阵优化与数据降维的文本聚类算法

2021-06-22卢佳伟

数据采集与处理 2021年3期
关键词:特征文本

陈 玮,卢佳伟

(上海理工大学光电信息与计算机工程学院,上海200093)

引 言

文本文档作为互联网舆情信息的主要载体,一直是数据信息时代的研究重点,能否监控并处理好这些文本信息是实现社会和谐发展的重要前提。伴随着自然语言处理技术的不断发展,各类文本信息处理的技术愈发完善,对舆情信息的处理也越来越高效,其中文本聚类是文本挖掘、机器学习和模式识别领域最具代表性的技术之一。作为一种无监督学习的方法,文本聚类在数据分析处理上承担着重要的角色,通过将大型的文本文档分解为具有各类特征代表的文档子集,从而实现对文档的管理与监控[1]。

在文本数据处理的过程中,向量空间模型(Vector space model,VSM)是一种被广泛采用的模型,模型内每一个词都被认定为文档的一个特征从而映射到向量空间中[2]。文本文档一般会形成一个高维度的向量空间模型,每一个维度依次对应一个权重值,初始文本文档通常包含高维信息和噪声信息特征,后者以其非相关性、冗杂性和分布散乱性的特点成为聚类工作中一个处理难点[3]。特征选择的主要目的是确定文本中最具代表性和高辨识度的特征。传统文本特征的选择处理有3种方法:基于文档频率(Document frequency,DF)的特征选择、基于词频(Term frequency,TF)的特征选择和基于文档频率和逆词频(Term frequency inverse document frequency,TF⁃IDF)的混合特征选择,这些方法主要依靠词频统计来完成矩阵特征的提取[4]。文献[5]通过确定词对文本密集度的贡献来评定该词的价值,从而找出不损失文本有效信息的最小特征词语集,创造出更为合理的权重计算方案。……

登录APP查看全文

猜你喜欢

特征文本
初中群文阅读的文本选择及组织
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
論《柳毅傳》對前代文本的繼承與轉化
如何快速走进文本
线性代数的应用特征