文本检索的聚类分布式索引
2021-11-24刘宇松江苏经贸职业技术学院
灌篮 2021年17期
刘宇松 江苏经贸职业技术学院
一、前言
随着信息技术的发展,各种数据的可用性呈爆炸性增长。它带来了一个前所未有的机会,可以开发自动数据驱动的技术来提取有用的知识,这就产生了数据挖掘的概念。数据挖掘是知识发现过程中的一个重要步骤,它由发现知识的方法组成隐藏在数据中的有趣、非平凡和有用的模式。大量的非结构化文档在许多领域都是可用的,当我们使用网络时,可以从世界各地检索文档。为了检索到对用户有用的信息,必须移动大量文本。快速有效的聚类是无监督学习的基本工具。现在已经开发出了各种方法来支持对文本文档集合的高效搜索和检索,包括后缀数组、倒排文件或倒排索引和签名文件等。
一个粗略但得到广泛认可的框架是,根据生成的聚类的属性,将聚类技术分为层次聚类和分区聚类。距离度量必须根据数据的基本形状进行适当选择,无论是球形数据还是椭球数据。查询可以是布尔查询,也可以是排序查询。布尔查询由逻辑运算符AND、OR和NOT连接的术语组成,可用于标识包含给定术语组合的文档,类似于关系表上使用的查询类型。
另一方面,排名是一个将非正式查询与文档相匹配的过程,并根据文档与查询的相似程度为文档分配分数。主要问题是组织和存储大量数据。当对这些数据进行搜索时,搜索的质量应该非常好。搜索还应具有成本效益和时间效益,非常重要的是,搜索查询得到的结果应该与我们实际搜索的结果相同。……
登录APP查看全文
