基于Lucene的中文分词器的改进与实现
2015-09-21罗惠峰郭淑琴
网络安全与数据管理 2015年11期
关键词:文本
罗惠峰,郭淑琴
(浙江工业大学 信息工程学院,浙江 杭州 310023)
0 引言
随着网络的发展和数据存储技术的成熟,如何在大量的数据中快速、准确地获取到我们所需要的信息成为一个亟待解决的问题,也是信息检索技术的核心问题。
信息检索的核心是全文检索技术,全文检索是指以各种计算机数据诸如文字、声音、图像等为处理对象,提供按照数据资料的内容而不是外在特征来实现的信息检索手段。当前对全文数据的检索主要有两种方法:顺序扫描法(Serial Scanning)和倒排索引法(Inverted Index)。前者较为原始,对于小数量的数据是最直接和最方便的方法;但随着数据量的增多,倒排索引法具有更快的检索速度和更全的应用范围[1]。Lucene并不是一个完整的搜索引擎应用,而是一个开放源代码的高性能、可伸缩的信息搜索库,可以方便地嵌入到各种应用中,实现针对应用的全文索引/检索功能,并且已经在许多搜索项目中得到了广泛的应用[2]。
中文分词技术作为信息检索的核心技术之一,它的研究与发展促进了全文检索技术的应用。本文主要研究了中文分词的最大匹配算法,并通过该算法对原始中文分词器进行了改进,改进后的分词器更加适用于中文条件下的搜索。
1 Lucene架构及简介
图1描述了基于Lucene的全文检索过程,Lucene对索引的创建和搜索是通过不同的流程来实现。创建索引时,需要通过文件、数据库、Web或人工输入方式来对数据进行采集;其次则需要建立索引的Document,一条Document就类似于数据库的一条记录[3];……
登录APP查看全文
