基于聚类的文本分类算法框架研究*
2021-02-25黄细凤
计算机与数字工程 2021年1期
黄细凤
(中国电子科技集团公司第十研究所 成都 610036)
1 引言
如何对文本进行更高效和准确的分类是目前计算机领域学者们探究的热点。随着网络讯息日益增长,对文本分类任务的性能需求也在不断提升。就目前而言,广泛应用于文本分类工作的分类方法主要有人工神经网络[1~2]、KNN[3~5]、决策树[6~7]、支持向量机[8~9]以及朴素贝叶斯[10]等。
文本分类的核心思想为通过已知类别的文本,将待分类文本进行归类操作,使其从属于类别中的某一类或几类。而KNN 因其算法的理论成熟、易于理解等优点,在实际分类工作中应用广泛。针对传统KNN 在训练集样本规模宏大或样本维度较高时计算开销巨大的问题,殷亚博等[11]提出了基于卷积神经网络的文本分类算法CKNN,首先从短文本中获取更多的抽象特征值,之后再进行文本的相关分类工作。胡元等[12]提出了基于划分区域的KNN算法,首先确定待测样本与各区域的联系密切程度,其次运用KNN 对其进行相应的归类。张著英等[13]提出了基于粗糙集的KNN 算法,以属性约简的方式,对样本空间中的向量进行降维,进而提升对文本进行归类的效率。史淼等[14]提出了一种新的分类算法PCA&KNN,采用较小的邻居集来进行KNN 分类,有效降低了分类计算的复杂度。谭学清等[15]提出了一种新判定方式下的KNN 算法,待测样本所属类别由其与训练集各类别中所有文本的相似度均值来确定,使时间复杂度有效降低,得到一种适合在大数据文本分类情况下的分类算法。……
登录APP查看全文
