文本信息检索系统的设计与实现
2019-08-23李高鹏艾山·吾买尔郑炅王路路
李高鹏 艾山·吾买尔 郑炅 王路路
摘 要: 随着信息化的发展,互联网上出现了越来越多的文档信息,如何根据用户的需要从海量的文档中快速获取相关信息成为了研究的热点。采用Python编程语言、Django Web应用框架、UWSGI Web服务器、Nignx代理服务器,基于TextRank关键词提取算法、倒排索引结构、Jaccard相似度计算以及MySQL数据库技术构建了汉英文本信息检索系统。该系统包含文本注册、文本检索和文本注销三个模块,可实现千万量级文本数量上的快速注册和快速检索功能,为构建舆情分析系统提供服务,并可根据人们特定的需求,扩展文本检索服务。
关键词: 信息检索; 算法介绍; 倒排索引; 检索系统构建; 快速注册; 快速检索
中图分类号: TN911.2?34; TP391 文献标识码: A 文章编号: 1004?373X(2019)16?0062?05
0 引 言
随着信息技术的飞速发展和我国人民生活水平的提高,互联网已经成为人们日常生活学习的一部分。我国已经进入了知识爆炸的时代,互联网上的汉语、英语相关的文档数量不断增加,并且未来还会继续增多。如何帮助用户快速有效地从海量的文本数据中找到需要的文本信息,成为学者们研究的重要课题。文本检索是指根据用户输入的信息从大量的文本集合中查找出相关文本的一种技术。文本检索作为信息检索[1]的一种,常用于搜索引擎、数字图书馆、舆情系统等领域。文本检索已经成为信息处理领域中不可获取的工具。常用的文本检索模型[2]可以分为三类:基于集合论的检索模型、基于代数的检索模型和基于概率论的检索模型。……
