基于深度表示的中医病历症状表型命名实体抽取研究*
2018-06-21卢克治袁玉虎舒梓心张润顺李晓东周雪忠
原 旎,卢克治,袁玉虎,舒梓心,杨 扩,张润顺,李晓东,周雪忠**
(1.北京交通大学计算机与信息技术学院 北京 100044;2.湖北省中医院 武汉 430061;3.中国中医科学院广安门医院 北京 100053)
中医临床记录通常由医生在日常临床诊疗工作中记载,其中包含大量的表型信息、检查记录病人的治疗信息[1]。随着现代化生物医学电子病历的快速发展,应用现代技术实现对临床病历文本中数据的深度挖掘[2],对其进行数据分析,以发现中医诊疗规律是一项非常有价值的工作。但由于中文语言的灵活性和中医临床的个体化表达[3],使得自动从中医电子病历数据中提取有意义的信息和知识具有挑战性。
目前为止,命名实体识别技术在许多领域取得了显著的成果,其F-评测值(F)已经高达90%以上[4],但是在生物医学领域,命名实体识别的研究尚处于初级阶段。因此,对生物医学领域的命名实体识别的相关研究正在引起人们的重视。Wang等[5]比较了条件随机场(Conditional Random Field,CRF),支持向量机(Support Vector Machines,SVM)和最大熵(Maximum Entropy,ME)三种机器学习算法的性能,并应用这三种算法识别中国古代医案中的症状和发病机制,发现CRF更具有优势。Wang等[6]对中医临床文本中的症状名称的识别进行了初步研究。Xu等[7]研究提出一种将分割和命名实体识别相结合的联合模型,以提高对出院数据的命名实体识别的性能。Zhou等[8]在中医方面使用Bootstrapping方法自动识别中医题录文献中的疾病名称和复方名称,取得了很好的效果。Xu等[9]应用CD-REST提取系统从化学诱导疾病的生物医学文献中提取化学关系,该系统使用的是CRFs方法进行的化学和疾病名称的命名实体识别。……
