基于条件随机场与Web数据的缩略语预测
2012-06-29王厚峰张龙凯
中文信息学报 2012年2期
焦 妍,王厚峰,张龙凯
(1. 北京大学 计算语言学教育部重点实验室,北京 100871;2. 北京大学 计算机科学技术系,北京 100871)
1 引言
缩略语是由较长的语词缩短省略而成的语词。在语言学里严格的说是一种词语的简易格式,又称“缩写”和“简称”。例如,“北京大学”的缩略语即“北大”。
由于缩略语在表达上简洁精炼,在自然语言中被大量使用;但另一方面,缩略语是未登录新词的一大“贡献者”,给自然语言处理带来了诸多困难。汉语的分词、词性标注、命名实体识别、机器翻译和信息检索等领域都受到了缩略语问题的困扰。大规模的完整形式与缩略语对照库是解决上述问题的重要资源。从完整形式出发预测缩略形式是构建对照库的途径之一。本文称这一过程为缩略语预测。
从语言学的角度来看,缩略语具有一定的生成规则。但语言上的规则大都有例外。不同的语言中缩略语的形成方式也不太一样。在英文中,通常取出一个单词的一部分作为缩略语,如“abbreviation”的缩略语为“abbrv.”或“abbrev.”或者取出一个词组中每个单词的首字母,如“National Basketball Association”的缩略语即为“NBA”。余富林将英文缩略语大体划分为四类,包括首字母缩略语(Acronym),缩写(Initialism),截短语(Clipping)和拼缀词(Blend)[1]。而汉语则与英文有着较大的差异,英文的缩略语以字母为单位进行删减,字母本身并无意义,中文缩略语则以字为单位,注重保留的字是否具有代表性的意义。
中文缩略语的生成方式是语言学中的一个重要问题。文献[2-3]将中文缩略语的生成过程主要分为三种形式,包括压缩、节略和统括。……
登录APP查看全文
