结合实体关联标注器的中文命名实体识别模型
2021-05-10刘建华
刘建华,吴 超
(1.西安邮电大学 信息中心,陕西 西安 710121;2.西安邮电大学 计算机学院,陕西 西安 710121)
命名实体识别(Named Entity Recognition,NER)是指在一段自然语言文本中标注实体词的位置和类型,其支撑着关系抽取、事件抽取以及知识图谱构建[1]等任务。基于统计机器学习的方法,如隐马尔可夫模型(Hidden Markov Model,HMM),条件随机场[2](Conditional Random Field,CRF)和支持向量机(Support Vector Machine,SVM)等,这些方法对人工制作特征的依赖性较强。随着深度神经网络的发展,利用监督学习将命名实体识别任务转为序列标注任务。特征提取采用卷积神经网络[3](Convolutional Neural Networks,CNN)或者循环神经网络[4](Recurrent Neural Network,RNN),求解最优标注序列运用CRF,这些模型泛化能力大幅度增强。但是,中文字向量[5]和英文词向量[6]的本质不同,造成中文命名实体识别任务在字嵌入层编码时会出现未登录词(Out of Vocabulary,OoV)以及分词错误等诸多问题,因而影响命名实体识别的任务表现。
早期将深度神经网络应用在命名实体识别领域的是Hammerton等人[7],他们提出了单向长短期记忆神经网络(Long Short-Term Memory,LSTM)。Lample 等[8]对传统的Bi-LSTM-CRF模型进行了改造,使用了结合词汇特征的字符级LSTM对句子进行编码。Strubell等[9]提出了一种基于IDCNN的命名实体识别方法,使用CNN代替RNN,很大程度上提升了训练的速度。Lin等[10]提出了一种触发词机制,用少量样本训练达到大量样本训练的效果。文献[11]加入了Dropout机制,减少训练时的过拟合现象。Zhang等[12]提出结合了词汇信息的网格网络。文献[13]提出结合特征的网络安全领域实体识别方法。文献[14]利用迁移学习思想将分词和命名实体识别融合在一个模型中训练。……
