基于MHA-Lattice LSTM的中文命名实体识别
2021-05-19于敏
北京工业职业技术学院学报 2021年2期
于 敏
(北方工业大学,北京 100144)
0 引言
命名实体识别(Named Entity Recognition,NER)任务是指从非结构化自然语言中识别出特定的重要信息即命名实体,该任务作为自然语言处理的基础任务,在问答系统、机器翻译和信息抽取等自然语言处理下游任务中占据重要作用。命名实体的概念最初是在第六届MUC会议(the Sixth Message Understanding Conferences,MUC-6)中被首次提出[1],用于识别文本中组织机构、地理位置和人名等信息单元,以及时间和百分比等数字表达式。早期命名实体识别工作以基于规则和词典构建的方法为主,该方法的性能直接由规则和词典决定,可移植性较差而且建设周期长。基于统计机器学习的方法则是依赖于标注完备的大量训练语料,主要使用最大熵模型、隐马尔可夫模型、支持向量机以及条件随机场等相关模型,实现了较好的识别效果;然而,识别效果依赖于大量的标注语料的条件限制了该方法在实际生产中的广泛应用。随着深度学习的发展,各种神经网络渐渐被应用于命名实体识别,神经网络可以找到命名实体更多非线性的内在联系,并能从由有限的标注数据中学习有用的数据表示,从而达到好的识别效果。
传统的中文命名实体识别大多是基于中文分词任务,进而在目标语句上进行词级别的序列标注任务,从而达到确定命名实体边界和类型的目的。然而,分词任务不可避免地会出现错误,错误传播会一直延续到标注任务,最终影响到实体识别的性能。Zhang等[2]1554-1558提出了……
登录APP查看全文
