基于主动学习的命名实体识别算法
2021-07-27张岑芳
张岑芳
(南京理工大学计算机科学与工程学院,江苏 南京 210094)
0 引 言
命名实体识别(Named Entity Recognition, NER)是信息抽取(Information Extraction)的一个子任务,作为自然语言处理领域的关键技术,主要任务目标是在句子序列中提取人名、地名、机构名等命名实体[1-2]。
早期的命名实体识别技术主要通过模式匹配或者统计的方法进行实体提取与标注。模式匹配[3]主要通过基于规则的方法实现,即通过人为构建各类实体的统一规则,再从任意文本序列中提取出符合指定规则的命名实体,例如NTU系统[4]、FAILE系统[5]等,使用这种方法得到的模型虽然能够在一定的范围内发挥作用,但模型规则的制定依赖大量的人工,对于不同的语言需要指定不同的规则,因此费时费力,成本高昂[6]。基于统计的方法实现的模型主要依据概率学的一些假设,从大量文本语言中提取出特征,对人类语言进行建模,通过序列标注[7](Sequence Labeling)将文本序列中的字或词对应到预先设计的标签系统上,实现命名实体识别。统计模型依据语言的统计特性,可以适应不同的语种,具有一定的普遍性[8]。例如隐马尔可夫模型[9](Hidden Markov Mode, HMM)把文本序列看作观测序列,将标签序列看作隐藏序列实现文本建模。最大熵马尔可夫模型[10](Maximum Entropy Markov Models, MEMM)通过加入上下文特征,增强了模型对文本特征的捕获能力。条件随机场[11](Conditional Random Field, CRF)在MEMM的基础上结合HMM加入了对模型输出的约束,提高了模型的准确率。曹波等[12]基于最大熵[13]原理结合最大概率分词法与Viterbi算法分别进行分词和角色标注,在1998年的人民日报语料中取得了89.43%的识别精度。……
