中文维基百科的实体分类研究
2015-04-21徐志浩惠浩添钱龙华朱巧明
中文信息学报 2015年5期
徐志浩,惠浩添,钱龙华,朱巧明
(1. 苏州大学 自然语言处理实验室,江苏 苏州 215006;2. 苏州大学 计算机科学与技术学院,江苏 苏州 215006)
中文维基百科的实体分类研究
徐志浩1,2,惠浩添1,2,钱龙华1,2,朱巧明1,2
(1. 苏州大学 自然语言处理实验室,江苏 苏州 215006;2. 苏州大学 计算机科学与技术学院,江苏 苏州 215006)
维基百科实体分类对自然语言处理和机器学习具有重要的作用。该文采用机器学习的方法对中文维基百科的条目进行实体分类,在利用维基百科页面中半结构化信息和无结构化文本作为基本特征的基础上,结合中文的特点使用扩展特征和语义特征来提高实体分类性能。在人工标注的语料库上的实验表明,这些额外特征有效地提高了ACE分类体系上的实体分类性能,总体F1值达到96%,同时在扩展实体分类上也取得了较好的效果,总体F1值达95%。
维基百科;实体分类;半结构化信息;信息框
1 引言
维基百科作为一个开放的知识库系统,其中的条目都是对一个概念或者实体的内容描述,每个条目的页面中包含了丰富的结构化、半结构化的信息和文本资源。维基百科实体分类是指对维基百科中的条目进行识别和分类,从中提取出各种类型的实体(如人物、组织、地名等)。对于这些实体的分类有助于进一步从维基百科中挖掘出更丰富的信息(如实体关系、语义关系等),同时维基百科中丰富的文本也为自然语言处理和机器学习提供了高质量的语料来源[1-2]。
2 相关工作
对维基百科条目进行实体的识别和分类,目前主要有两种方法: 基于启发式规则的方法和基于机器学习的方法。……
登录APP查看全文
