中文领域命名实体识别综述
2021-08-19焦凯楠朱容辰
焦凯楠,李 欣,2,朱容辰
1.中国人民公安大学 信息网络安全学院,北京100038
2.安全防范技术与风险评估公安部重点实验室,北京100026
命名实体识别(Named Entity Recognition,NER)是自然语言处理(Natural Language Processing,NLP)领域的子任务,通常解释为从一段非结构化文本中,将那些人类通过历史实践规律认识、熟知或定义的实体识别出来,同时也代表了具有根据现有实体的构成规律发掘广泛文本中新的命名实体的能力。实体是文本中意义丰富的语义单元,识别实体的过程分为两阶段,首先确定实体的边界范围,然后将这个实体分配到所属类型中去[1]。
1991年Rau[2]隐式地提出了NER任务,需求是从文本中提取公司名称。在1996年之后,NER作为信息抽取的一项子任务的属性在第六届消息理解会议(Message Understanding Conference 6,MUC-6)上被正式确立。
NER的提取对象随着相关评测会议的进行不断丰富。最先开始的英文文本实体集中在三大基本类[3]——person(人物)、organization(组织机构)、geographical location(地理位置)上,同时辅助于currency(货币)、time(时间日期)、percentage expression(百分数表达式)的识别,前者属于实体类(entity type),后者属于数字类(numeric type)。而person类下包含了名字、昵称、代称[4]、外文译名[5]等识别任务,location类对城市、道路、区划等名词进行识别。随着NER研究的推进,提取实体范围更广,实体分类更加精细,不同语种、不同学科领域被包含进来。
NER技术随着相关评测会议的举办逐渐明确研究目标[6]。英文NER技术对于中文NER发展具有借鉴意义,中英文的构成差异和中文显著区别于英文的特性,促进了相关中文评测会议的发展。英文是单词和符号的组合,英文单词由空格隔开,具有大小写、词根词缀等特性。……
