基于数据挖掘的面向话题搜索引擎研究
2011-07-31张佳骥吴立德刘海娟
无线电通信技术 2011年5期
陈 勇,张佳骥,吴立德,刘海娟
(1.中国电子科技集团公司第五十四研究所,河北石家庄050081;2.复旦大学,上海 200433)
0 引言
目前,无论是在互联网上还是在机构内部,电子文本文档的数量都在快速地增加着。通常这些文档未经处理,杂乱地堆积在一起。这种原始状态大大降低了文档的可利用性,文档的信息价值无法实现。文本搜索引擎的作用就是帮助人们快速准确地找到符合其检索需求的相关文档。因此,文本搜索引擎技术是开发和利用现有文本文档的基础,有着很好的应用前景。
1 问题分析
目前,大多数文档检索技术都是以单个词为处理对象的[1,2]。这种技术有以下缺点。首先,从用户角度来讲,有时让用户仅仅使用几个关键词就把检索要求描述清楚是一件很困难的事情。检索需求的模糊不清必然会导致检索结果的混乱;其次,从关键词检索技术本身来讲,只要一个文档中出现了检索关键词,就认为此文档满足检索要求,这样的简单匹配方法常常会检索出很多非相关文档。
在文档表示技术方面,目前许多文档表示方法主要是基于向量空间模型(Vector Space Model)理论的[3,4]。向量空间模型理论也是以单个独立词为处理对象,并且假定词与词之间是相互独立的。首先从词汇表中选择若干词作为特征词,由这些特征词构成向量空间,然后把文档集合中的每一个文档表示为向量空间中的一个向量。基于向量表示就能够计算两两文档之间的相似度。向量空间模型理论是以词与词之间互不关联和相互独立为前提的。……
登录APP查看全文
