融合词语统计特征和语义信息的文本分类方法研究
2021-08-06张丽,马静
计算机工程与科学 2021年7期
张 丽,马 静
(南京航空航天大学经济与管理学院,江苏 南京211106)
1 引言
文本分类是文本挖掘的关键技术之一,其最直观的作用是将文本进行归类,使得复杂错乱的海量文本能够分门别类地进行存储、查找,在此基础之上,通过对特定领域语料的分析,也能够获得更加深入的文本语义信息。因此,文本分类具有很大的研究价值。
向量空间模型VSM(Vector Space Model)[1]文本表示法是典型的基于统计的方法之一。基于VSM的分类方法,以特征项作为文本表示的基本单位,用特征项及相应权重来代表特征信息,通常利用TF-IDF(Term Frequency-Inverse Document Frequency)方法计算特征项权重,将特征项表示为向量,权值大小代表了这个特征项能在多大程度上将其表示的文本与其他文本区分开来,最终文本被表示为多维向量空间中的一个向量,通过计算向量夹角大小来衡量文本相似度,如KNN(K-Nearest Neighbor)、SVM (Support Vector Machine)等,进而对文本分类。该类方法操作性强,计算简单高效,但这种方法基于词袋法思想,假设特征词之间相互独立,从而忽略了词语之间的语义关系和词语在文本中的上下文结构信息[2]。并且,向量空间模型在处理海量数据时,特征维度会非常高,因此易产生向量空间高维性问题。因此,目前亟需解决的问题就是向量空间的维数灾难和语义缺失,从而进一步提高海量文本分类的效果。裴颂文等[3]针对TF-IDF中存在的不足,提出一种动态自适应特征权重计算方法,不仅考虑了特征项词频和逆文档频率,并且还考虑了文本动态变化情况下特征项的分散度和特征向量梯度差,对特征项权重进行动态调整,有效提高了文本分类的性能。……
登录APP查看全文
