中文命名实体识别技术综述
2021-12-22庞海婷冯珊珊韩东辰
长春工业大学学报 2021年5期
赵 辉,庞海婷,冯珊珊,韩东辰
(长春工业大学 计算机科学与工程学院,吉林 长春 130012)
0 引 言
在计算机科学人工智能大发展下,信息抽取IR 作为自然语言处理领域的一个重要分支,主要用来对文本信息进行结构化处理。信息抽取包含命名实体识别、关系提取、事件抽取和共指消解等多个子任务。命名实体识别NER是信息抽取研究中的子任务,是关系抽取、语义角色标注、自动问答等基础工具。命名实体识别主要用来识别非结构化文本中指代性强的真实具体相互区别的实体,比如特定实体人名、地名、机构名、专有名词等,并对所识别的实体属类进行标注类型。例如台风“烟花”不在宁波登陆为何宁波雨量浙江第一。台风“烟花”为专有名词,宁波和浙江是地名。因此,命名实体识别能将大量非结构化、半结构化数据中的实体识别出来,对未来收集、整理、查询对应数据具有很强的现实意义和应用价值。
1 概 述
1.1 命名实体识别的研究背景
近几年,命名实体识别在持续发展和进步中,在各个模型中产生很好的效果,并在多个领域得以运用。命名实体识别这个词是在1995年第6届消息理解会议MUC-6[1]上首次提出并命名,将命名实体识别设置为测评任务。此次会议主要关注3类专业名词的识别,分别是人名、地名、组织机构名,之后在MUC-7会议又将类别划分为3大类和7小类。进入21世纪后,CoNLL国际会议将命名实体定义为包含名称的短语。
MUC-1~MUC-4会议都只针对英语语料,开始针对日语语料是在MUC-5会议上,开始针对中文语料的测评则是在MUC6会议上,当时这些语料主要是从电子新闻、广播新闻、纸质报纸等获得的。……
登录APP查看全文
