基于TF-IDF算法的分层搜索引擎设计∗
2021-04-04
计算机与数字工程 2021年3期
(江苏科技大学电子信息学院 镇江 212003)
1 引言
目前,在互联网上搜集、提取、处理信息的最常用的方式是使用搜索引擎[1]。随着互联网上信息量的迅速增加,以及信息组织方式变得愈加散列和多样性,要求搜索引擎算法必须更加的高效准确[2]。
为此,各国学者对其进行了大量研究,提出了许多搜索引擎算法与框架。如基于分类目录、文本检索的方法[3];使用基于网页被访问概率的PageR⁃ank算法[4];通过网页被链接的数量和质量来确定搜索结果的排序权重的Hilltop算法[5]等。
本文提出了一种基于词语频率-逆文档频率(Term Frequency-Inverse Document Frequency,TF-IDF)算法的分层搜索引擎设计方案。该方案分为两个阶段。在第一阶段,利用网络爬虫技术爬取网络词条,并构造一个语料库粗燥集;在第二阶段,则基于TF-IDF算法在本地对语料库进行精确高效搜索,得到与待搜索语句最相近的结果。实验中,将该搜索引擎应用于百度百科[6]的有关词条。整个搜索过程显示在基于Flask框架构建的本地Web上,能够提供给用户良好的搜索输入环境与搜索结果显示区域,点击搜索结果可以进入详细显示页面。
2 TF-IDF算法
在信息检索中,TF-IDF算法是一种采用词语加权方案的数字统计方法,旨在反映单词对集合或语料库中文档的重要性[7]。它通常用作搜索信息检索、文本挖掘和用户建模的加权因子。TF-IDF值与单词在文档中出现的次数成比例地增加,并且被包含该单词的语料库中的文档数量抵消,这有助于调整某些单词通常更频繁出现的实际情况[8]。……
登录APP查看全文
