APP下载

基于聚类的文本分类算法框架研究*

2021-02-25黄细凤

计算机与数字工程 2021年1期
关键词:分类文本实验

黄细凤

(中国电子科技集团公司第十研究所 成都 610036)

1 引言

如何对文本进行更高效和准确的分类是目前计算机领域学者们探究的热点。随着网络讯息日益增长,对文本分类任务的性能需求也在不断提升。就目前而言,广泛应用于文本分类工作的分类方法主要有人工神经网络[1~2]、KNN[3~5]、决策树[6~7]、支持向量机[8~9]以及朴素贝叶斯[10]等。

文本分类的核心思想为通过已知类别的文本,将待分类文本进行归类操作,使其从属于类别中的某一类或几类。而KNN 因其算法的理论成熟、易于理解等优点,在实际分类工作中应用广泛。针对传统KNN 在训练集样本规模宏大或样本维度较高时计算开销巨大的问题,殷亚博等[11]提出了基于卷积神经网络的文本分类算法CKNN,首先从短文本中获取更多的抽象特征值,之后再进行文本的相关分类工作。胡元等[12]提出了基于划分区域的KNN算法,首先确定待测样本与各区域的联系密切程度,其次运用KNN 对其进行相应的归类。张著英等[13]提出了基于粗糙集的KNN 算法,以属性约简的方式,对样本空间中的向量进行降维,进而提升对文本进行归类的效率。史淼等[14]提出了一种新的分类算法PCA&KNN,采用较小的邻居集来进行KNN 分类,有效降低了分类计算的复杂度。谭学清等[15]提出了一种新判定方式下的KNN 算法,待测样本所属类别由其与训练集各类别中所有文本的相似度均值来确定,使时间复杂度有效降低,得到一种适合在大数据文本分类情况下的分类算法。……

登录APP查看全文

猜你喜欢

分类文本实验
记一次有趣的实验
分类算一算
在808DA上文本显示的改善
做个怪怪长实验
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
NO与NO2相互转化实验的改进
实践十号上的19项实验
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本