APP下载

BERT-TECNN模型的文本分类方法研究

2021-09-26李铁飞

计算机工程与应用 2021年18期
关键词:分类文本信息

李铁飞,生 龙,吴 迪

1.河北工程大学 信息与电气工程学院,河北 邯郸056107

2.河北工程大学 河北省安防信息感知与处理重点实验室,河北 邯郸056107

文本分类是根据文本所蕴含的信息将其映射到预先定义带主题标签的两个或几个类的过程[1]。文本分类是自然语言处理领域一项重要的任务类型,文本分类可对包含巨大数据量的信息进行组织、管理,降低搜索信息成本[2]。文本分类被广泛应用到内容审核、舆情分类、广告标注、情感分析、邮件过滤、新闻主题划分、问题甄别、意图识别、指代消解等场景[3]。

文本分类最初通过专家规则进行分类,它利用知识工程定义数量巨大的推理规则来判断文本属于哪个类别,人力成本巨大,且主观因素对结果影响较大,不同领域有不同的推理规则,不具备扩展性[4]。随着机器学习算法的兴起,特征工程&浅层分类器的模型被广泛使用。机器学习方法具有完备的理论做基础,不需要专业人员总结推理规则,具有一定扩展性,相比知识工程大大减小了总结规则的成本[5-8],性能优于专家规则方法。

随着自然语言处理技术的发展,深度学习网络模型越来越多地应用到文本分类问题上,深度学习网络模型之所以在图像和声音处理领域非常成功,是因为图像数据和声音数据是连续的、稠密的。所以把深度学习模型用于解决文本分类问题,首先要把文本数据映射成连续的、稠密的词向量。这种“文本表示”方法称为文本的分布式表示。……

登录APP查看全文

猜你喜欢

分类文本信息
分类算一算
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
订阅信息
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
展会信息
如何快速走进文本
健康信息
健康信息(九则)