APP下载

基于FastText和关键句提取的中文长文本分类①

2021-09-10汪家成

计算机系统应用 2021年8期
关键词:关键分类文本

汪家成,薛 涛

(西安工程大学 计算机科学学院,西安 710048)

1 引言

随着互联网技术的高速发展,网络中每天都会产生海量的数据,从杂乱的信息中获取有效信息已成为业界的研究热点[1].文本分类任务是自然语言处理(NLP)领域中最基础的任务之一,其不仅能有效的筛选信息,而且在信息检索、情感分类和自动文摘等方面有着重要的应用.随着人工智能行业的兴起,文本分类也有了更为广泛的应用,如人机通信,问答系统等[2].

文本分类最初使用的是基于规则的方法[3],由相关领域的专家根据知识和经验制定相应的规则,然后根据这些规则进行文本分类.基于规则的文本分类方法虽然在某些领域上有很好的效果,但是制定分类规则会耗费大量的人力成本,且如果出现了新的分类标签需要制定新的规则,因此基于规则的文本分类方法适用性较差[4].

近年来,机器学习算法在文本分类中的应用成为自然语言处理研究热点,机器学习算法中文本分类任务采用的是有监督学习[5],主要包含模型训练和结果预测两个过程.在数据进入模型训练之前,需要对文本进行表示,将其转化成计算机能够处理的形式.文本的表示方法大多基于词袋模型和向量空间模型[6],词袋模型将文本看成词的集合,文本中的词越多,词袋表示的文本向量维度就越大,且词袋模型不考虑词的语义和语序,会损失一些语义上的特征信息;为了克服词袋模型无法表……

登录APP查看全文

猜你喜欢

关键分类文本
高考考好是关键
分类算一算
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
获胜关键
如何快速走进文本
生意无大小,关键是怎么做?