APP下载

Bert-BLSTM-CRF模型的中文命名实体识别

2021-03-14王远志曹子莹

关键词:信息方法模型

王远志,曹子莹

(安庆师范大学计算机与信息学院,安徽安庆246133)

命名实体识别(Named Entity Recognition,NER)是自然语言文本数据处理工作中的一项基础且至关重要的环节[1],其在信息的查询和抽取、智能问答以及机器翻译等领域均有广泛应用。

随着计算机硬件的迅速发展,神经网络能够有效地处理命名实体识别任务。与统计机器学习方法相比,基于神经网络的深度学习方法拥有较低的人工依赖性和较强的泛化性[2],得到了NLP(Natural Language Processing)领域研究者的广泛关注。Collobert等[3]提出采用CNN(Convolutional Neural Networks)与CRF(Conditional Random Field)相结合的方法进行命名实体识别研究,获得了较好的实体识别结果。马建红等[4]采用基于Attention的双向长短期记忆网络BLSTM(Bidirectional Long Short-Term Memory)与CRF相结合实现了新能源汽车专利文本实体的识别。Huang等[5]将BLSTM和CRF应用于NLP的基准标注数据集,减少了对字词嵌入的依赖并提高了准确率。Li等[6]在生物学文本研究中采用了基于条件随机场的BLSTM神经网络模型,识别出了不规则的实体,准确率达81.09%。

采用BLSTM模型能够解决当前机器学习中存在的人工标注特征和领域知识依赖性较强的问题。但是,在BLSTM模型输出的结果中,会存在词的标注结果分散的情况,这导致识别结果无法形成合理的标注序列,因此添加CRF层作为BLSTM输出的解码层。CRF可以更好地关注预测结果,优化标注序列。采用BLSTM模型和CRF模型相结合的方法能够有效提高命名实体识别的准确率。

中文与英文最大的不同点是中文有字和词的区别,因此在中文NER中有3种识别方案,分别为关于字的、关于词的、关于字和词结合的命名实体识别。……

登录APP查看全文

猜你喜欢

信息方法模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
订阅信息
3D打印中的模型分割与打包
用对方法才能瘦
四大方法 教你不再“坐以待病”!
捕鱼
展会信息
健康信息
健康信息(九则)