基于BERT+BiLSTM+CRF深度学习模型和多元组合数据增广的渔业标准命名实体识别
2021-09-17杨鹤于红刘巨升杨惠宁孙哲涛程名任媛张思佳
大连海洋大学学报 2021年4期
杨鹤,于红,2*,刘巨升,杨惠宁,孙哲涛,程名,任媛,张思佳,2
(1.大连海洋大学 信息工程学院,辽宁省海洋信息技术重点试验室,辽宁 大连 116023;2.设施渔业教育部重点试验室,辽宁 大连 116023)
渔业标准化是提高渔业生产效益、提升水产品质量和保障渔业生产安全的重要手段之一,渔业标准文本是渔业标准化的载体,也是渔业生产人员获取渔业标准知识的主要途径[1]。为高效地获取渔业标准知识,需对渔业标准文本中命名实体进行识别。渔业标准命名实体识别是从渔业标准文本中识别“渔业标准号”、“渔业标准指标”[2]及“水产品名称”等命名实体。早期的命名实体识别任务主要采用基于规则和词典的方法[3],这类方法需要由有经验的专家总结规则,识别效果依赖于专家的经验,在数据量较少且不同专家总结的规则一致性较高的情况下效果较好。随着数据量的不断增加,规则提取工作量增大,保持规则一致性难度加大,基于规则和词典方法的识别效果无法满足人们的进一步需求,学者们提出了基于词典与条件随机场的命名实体识别方法[4],该类方法采用统计学习的方法统计语料库中文本信息的分布情况并进行命名实体识别。与基于规则方法相比,统计学习方法的性能取得了较大提升,但是由于此类方法需要手工选择特征,算法性能依赖于特征模板的结构,缺乏泛化能力。随着深度学习的发展,深度学习被应用于命名实体识别领域[5]。孙娟……
登录APP查看全文
