基于并列结构的概念实例和属性的同步提取方法
2012-06-29李文杰穗志方
中文信息学报 2012年2期
李文杰,穗志方
(1. 北京大学 计算语言学研究所,北京 100871;2. 北京大学 计算语言学教育部重点实验室,北京 100871)
1 引言
概念是反映客观事物及其特有属性的思维对象,它是知识表示的核心要素。对概念的提取研究分为: (1)概念实例提取。例如,提取“疾病”概念下的所有疾病名,包括: “感冒”、“心肌炎”等;(2)提取概念的属性名(例如,提取“疾病”概念的属性名“症状”、“并发症”、“用药”等)。对概念实例和属性的提取研究,不仅对Ontology的自动构建,而且对其他的自然语言处理任务比如自动问答、文本分类等都具有重要地指导作用。
在概念实例和属性的自动提取方面,当前已有很多研究。有一些方法是利用手工构造的模式去进行提取,比如文献[1-5],这种方法准确率比较高,但是人工干预比较大,召回率也比较低;还有一些是利用半自动或自动的方法去进行提取,比如文献[6-10],监督性比较小,但准确率比较低。
文献[1] Hearst提出了一种利用手工指定的模式从非限定性文本中自动获取上下位关系的方法,这种方法可以获得很高地准确率,但是需要人工制订模式,这种方法提取出的结果往往都是有限的。文献[2-3,6]从Web文档中提取实例,其中文献[6]利用迭代的方式对种子实例集合进行扩展,文献[2-3]利用给定的概念和上下位模式通过在搜索引擎中构造查询请求来自动获取实例。文献[7]是利用搜索引擎的查询日志来进行实例提取,文献[8]提出一种无指导的方法从半结构化的HTML文档中提取属性和属性值对,文献[9]利用给定的概念和概念的实例集合从结构化的网页文本中提取概念属性,文献[4]利用手工指定的模式分别对网页文件和查询记录中提取属性的结果进行了比较。……
登录APP查看全文
