APP下载

Web信息检索中N层向量空间模型及特点分析

2019-12-21开磊

大众投资指南 2019年7期
关键词:信息检索特征内容

开磊

(安徽省合肥市安徽新华学院国际教育学,安徽 合肥 230088)

处在当前互联网信息时代的背景下,互联网信息总量不仅种类增多,而且数量不断增长,这就需要探索出精确、快速和高效提取信息的途径,这同时也是研究核心所在,备受社会各界的关注。

一、传统向量空间模型

随着社会的逐步发展和进步,不同类型的信息检索算法模型已经形成和应用。其中,Sallon等学者就对向量空间模型算法进行了构建,借助TFIDF对文档进行了转换,形成向量的形式,极大地简化了运算过程,有着大规模的应用。基于典型向量空间检索模型算法下,借助涵盖特征项构成向量可以对查询、文档进行表示,同时借助查询、文档二者间的向量夹角余弦当成度量相似性的过程,并且随着夹角的减小会使相似度逐渐增大。在对特定向量进行查询的过程中,通常需要将其同全部文档向量相似性进行比较,同时以相似度为标准,按照降序的规则来排列文档,并对最终的检索结果进行提交。上述方式具有多种优势,例如:简便化、处理速度较快和直观化等。然而文档集合下特征项总量比各篇查询、文档下特征项数量要大,所以查询、文档二者的向量代表形式下多数均是0。零项能够基于运算特征项相似度、权重,从而在空间、实践繁琐性方面存在问题,影响数据稀疏的状况。除此之外,抽取、查询匹配特征项时,相同特征项可以在文档各区域内出现,在显示文档内容能力方面有所差异。……

登录APP查看全文

猜你喜欢

信息检索特征内容
内容回顾温故知新
如何表达“特征”
不忠诚的四个特征
主要内容
医学期刊编辑中文献信息检索的应用
基于神经网络的个性化信息检索模型研究
线性代数的应用特征
教学型大学《信息检索》公选课的设计与实施
公共图书馆信息检索服务的实践探索——以上海浦东图书馆为例