基于ALBERT的中文医疗病历命名实体识别
2021-03-31奚雪峰盛胜利崔志明
陈 杰,奚雪峰,2,皮 洲,盛胜利,崔志明,2
(1.苏州科技大学电子与信息工程学院,江苏 苏州 215009)(2.苏州智慧城市研究院,江苏 苏州 215009)(3.Computer Science Department,Texas Tech University,Texas 79431,USA)
随着电子病历的应用范围越来越广,各级医院和研究机构产生了海量的电子病历. 如何对电子病历中的自然语言文本进行分析,从而生成有效的医疗信息,逐渐成为近年来的研究热点. 其中,医疗病历命名实体识别(named entity recognition,NER)就是该领域的基础性研究工作,其研究成果能够为医学知识库的构建、药物安全性检测、临床决策及个性化患者精准医疗服务提供支撑.
目前国内外关于命名实体识别的绝大部分研究都是基于英文[1-3],面向中文的命名实体识别相对较少[4-6],尤其在电子病历文本分析处理领域[7-8]. 针对电子医疗病历命名实体识别任务,本文基于ALBERT模型,融合双向长短记忆网络(BiLSTM)及条件随机场模型,构建了一个ALBERT-BiLSTM-CRF(ALBBC)模型,并针对中文医疗病历命名实体识别任务,开展了多个模型的比对实验,发现所构建的ALBBC模型在识别精度及时间开销上均优于同类模型.
1 相关工作
Bikel等[1]最早提出了基于隐马尔可夫模型的英文命名实体识别方法,其在 MUC-6 测试文本集的测试结果为:英文地名、机构名和人名的识别精度分别达到了97%、94%和95%,召回率分别达到了95%、94%和94%. Liao等[2]提出了基于条件随机场模型,采用半监督的学习算法进行命名实体识别. Ratinov等[3]采用未标注文本训练词类模型(word class model)的办法,有效提高了NER系统的识别效率,并针对 CoNLL-2003数据集开发出精确度和召回率的调和平……
