APP下载

商品品牌名称挖掘

2012-07-09何正焱王厚峰

中文信息学报 2012年2期
关键词:排序定义分类

何正焱,王厚峰

(北京大学 计算语言学教育部重点实验室,北京 100871)

1 引言

词汇的获取是语言学研究的一个重要内容。传统的词典通常需要大量的人力编撰,同时具有覆盖面小,实时性不强等缺点,不能为一些任务如命名实体识别提供足够有效的信息。

在中文命名体识别中, 对识别人名、地名和机构名的研究较为深入。使用的方法主要有基于规则的命名体识别和基于序列标注的命名实体识别[1]。

商品和品牌名称的识别较人名、地名的识别较难。人名有一定的规律可循,且用字比较固定;地名相对变化不大。品牌名称的取名较随意,规律性不强,并且有很多来自外文译名,识别相对困难。

虽然命名实体在用字和上下文有一定规律,但命名实体识别通常是一个严重依赖人类知识的领域,在地名识别中经常用做特征的地名词典(gazetteer)[2],机构名词典便是人类知识的体现。因此挖掘和收集同类别实例,例如,地名、机构名和商品品牌名称对该类别命名体识别有很大作用。本文考虑从网络资源中收集和挖掘大量的同一类别的实体名称,为中文命名实体识别提供足够的领域信息。

近年来,利用网络信息获取大量同类别实例逐渐成为一个研究的热点。如文献[3]使用分布相似性抽取Web表格中的分类实例;文献[4-5]介绍了使用基于二次优化的半指导的 Adsorption 算法综合多个信息源抽取类别实例的方法。这类方法的优点是只利用少量需人工标记的种子节点,利用网页文本的表格或共享属性等信息,获取大量同类别实例,既解决了人工标注的时间代价和覆盖率小的问题,而又不损失准确率。……

登录APP查看全文

猜你喜欢

排序定义分类
分类算一算
恐怖排序
节日排序
刻舟求剑
教你一招:数的分类
成功的定义
修辞学的重大定义
山的定义
教你正确用(十七)