基于BiLSTM-CNN-CRF模型的维吾尔文命名实体识别
2018-08-17买买提阿依甫
买买提阿依甫,·,·,
(新疆大学 信息科学与工程学院,乌鲁木齐 830046)
0 概述
命名实体识别[1](Named Entity Recognition,NER)是自然语言处理(Natural Language Processing,NLP)工作中具有挑战性的任务之一,通过它可以准确地从文本中识别出人名、机构名、地名、时间、日期、货币、百分号等信息,为话题识别、话题跟踪、信息检索、机器翻译、舆情分析等高级NLP任务提供重要的特征信息。过去NER任务多采用基于规则的识别方法、基于统计机器学习的识别方法(包括隐马尔可夫模型、条件随机场模型、支持向量机等)和基于规则和统计相结合的混合识别方法[2]。近年来,深度神经网络在自然语言处理领域受到了广泛的关注,相比于上述方法,基于深度神经网络的方法具有泛化性更强、更少依赖人工特征的优点。因此,面向汉语和英语等大语言,研究人员已提出了许多基于深度神经网络的NER模型,但针对以维吾尔语为代表的低资源少数民族语言的研究较少。维吾尔命名实体识别研究大多只针对维吾尔人名的识别,关于人名、地名、机构名的通用研究较少,目前多数研究都是基于规则或统计模型的方法。
针对维吾尔文命名实体识别问题,本文构建基于BiLSTM-CNN-CRF的混合深度学习模型。首先利用卷积神经网络(Convolutional Neural Network,CNN)模型捕获单词的字符级特征向量;然后将字符级特征向量、词性向量和词向量拼接的混合向量作为BiLSTM模型的输入进行训练,获取语句单词之间隐含的语义特征;最后通过CRF模型得到最优标注序列。
1 神经网络体系结构
本节将详细描述BiLSTM-CNN-CRF[1]神经网络体系结构的各组成部分,从下至上逐一介绍神经网络中的各神经层。……
