APP下载

一种面向网店商品搜索的中文分词系统设计

2012-09-03叶宽余

合肥工业大学学报(自然科学版) 2012年6期

王 敏, 叶宽余, 薛 峰

(1.安徽工商职业学院 工商管理系,安徽 合肥 230041;2.合肥工业大学 计算机与信息学院,安徽 合肥 230009)

0 引 言

在电子商务领域,随着在线商品数量、种类的急剧增加,商品搜索显得越来越重要,而要实现快速、精确的搜索,“分词”是其中最为关键的一步。英文行文以词为单位,词与词之间以空格作为自然分节符,而中文行文则是通过标点、段落等明显的分界符来简单划界,没有一个形式上的分界符对词进行有效、准确的分割,因此对于中文字符串,需要经过特殊的中文分词处理才能进行有效的检索,这就需要研究一套真正适合电子商务网店商品搜索的中文分词系统[1]。

中文分词(Chinese Word Segmentation)指的是将一个汉字序列(如句子)切分成一个一个单独的词,是文本挖掘的基础。近10余年来,中文自动分词研究取得了很大成就,如清华大学的SEGTAG系统、北京航空航天大学的CDWS系统等。主要的分词算法有:基于字符串匹配的分词方法、基于理解的分词方法和基于统计的分词方法[2]。基于字符串匹配的分词方法又叫机械分词法,它是按照一定的策略将待分析的汉字串与一个“充分大的”机器词典中的词条进行匹配,若在词典中找到某个字符串,则匹配成功(识别出一个词)。机械分词从切分程度或切分策略上看,可以分为部分切分和全切分2种,部分切分只取得输入序列的一种或几种可接受的切分形式,全切分则要求获得所有可接受的切分形式[3]。建立在全切分基础上的分词方法从根本上避免切分形式的遗漏,保证分词结果的准确性,但最终的分词结果是否正确和完全,还要依赖于歧义处理方法的选择与设计[4-5]。……

登录APP查看全文