APP下载

基于深度学习和语法规约的需求文档命名实体识别

2021-01-27许梦笛王金华

计算机与现代化 2021年1期
关键词:实验方法模型

许梦笛,王金华

(中国电子科技集团公司第三十二研究所,上海 201808)

0 引 言

命名实体识别(Named Entity Recognition,NER)[1]是知识图谱乃至自然语言处理领域的关键任务,在机器翻译、智能问答、信息检索等领域的研究和应用中都扮演着不可忽视的角色。在知识图谱构建的流程中,NER是第一个步骤,它所识别的实体会用于后续的属性识别、关系识别以构成三元组,如(马化腾,董事长,腾讯),这样的三元组又用于实体消歧和实体链接等后续工作,因此NER造成的误差将对形成的整个知识图谱产生非常大的影响。

需求文档是面向产品开发的重要指标。其中包含了针对产品的需求描述、定位、目标、结构、业务流程、具体用例描述、功能内容描述等详细的指标,在软件工程的进步与迭代中,逐渐形成了一种规范化的形式,因此需求文档拥有相对固定的内容架构和规范的描述方式,以方便制定者和使用者快速定位所需的内容。即使如此,由于需求文档的独一性,不同的文档之间对同一组件的定义与功能需求仍有不同,对于专业的开发团队,想要从众多的需求文档中获取相应的知识体系是非常困难的。

从需求文档中进行NER,有以下几个难点:1)需求文档中的实体与常用的实体不同,存在很多由多个实体、动词构成的虚功能(Virtual Function),如果使用常见的NER方法进行识别,这些实体容易被分开成多个实体或非实体,从而导致识别出错;2)需求文档中有结构化、半结构化和非结构化的文本,不同类型的文本,识别的方式也有所不同,如果使用纯粹的深度学习方法[2-3]或语法规约的方法都会产生一定的误差;……

登录APP查看全文

猜你喜欢

实验方法模型
一半模型
记一次有趣的实验
重尾非线性自回归模型自加权M-估计的渐近分布
做个怪怪长实验
3D打印中的模型分割与打包
NO与NO2相互转化实验的改进
实践十号上的19项实验
用对方法才能瘦
四大方法 教你不再“坐以待病”!
捕鱼