基于多卷积核DPCNN的维吾尔语文本分类联合模型
2021-08-13加米拉吾守尔吴迪王路路古丽尼格尔阿不都外力买合木提买买提吐尔根依布拉音
加米拉·吾守尔,吴迪,王路路,古丽尼格尔·阿不都外力买合木提·买买提,吐尔根·依布拉音
(1.新疆大学信息科学与工程学院,新疆乌鲁木齐830046;2.新疆大学软件学院,新疆乌鲁木齐830046;3.新疆多语种信息技术实验室,新疆乌鲁木齐830046)
0 引言
文本分类,是自然语言处理(natural language processing,NLP)的一个经典问题。文本包含丰富的语义信息,但是由于其非结构化的性质,如何准确地从文本中提取关键语义信息并完成分类是一项极具挑战性的任务。可以按照文本的长度将文本划分为长文本分类和短文本分类,其中短文本语义稀疏,处理难度更大。
深度学习方法在文本分类中取得了巨大的成功,如Zhang H 等[1]在CNN 上引入了聚类控制的方法,有效缓解了英文短文本分类中存在的数据稀疏问题,Choi B J等[2]提出的自适应卷积方法在多个英文长文本分类任务中取得较好的效果。虽然深度学习方法在大语种文本分类任务中已经取得非常可观的结果,但对于维吾尔语而言,资源匮乏和语言形态复杂等难点导致各项自然语言处理任务发展较为缓慢。维吾尔语文本分类早期的研究多使用传统的机器学习方法,如陈洋[3]在贝叶斯算法中加入权重完成了维吾尔语文本分类任务,但该方法需要考虑多个特征权重的影响,若继续引入其他特征,该文提出的调整函数将不再适用。近年来,部分学者在深度学习的基础上考虑使用语言特性,如Parhat等[4]、沙尔旦尔·帕尔哈提等[5]和Li Z等[6]使用词素序列对维吾尔语短文本分类进行研究,即更小的词粒度,以此来克服语言形态复杂等问题,但是这种方法的不足之处是过于依赖词素切分工具,而切分精度会直接影响自然语言处理任务的精度。……
