Web信息检索中N层向量空间模型及特点分析
2019-12-21开磊
大众投资指南 2019年7期
开磊
(安徽省合肥市安徽新华学院国际教育学,安徽 合肥 230088)
处在当前互联网信息时代的背景下,互联网信息总量不仅种类增多,而且数量不断增长,这就需要探索出精确、快速和高效提取信息的途径,这同时也是研究核心所在,备受社会各界的关注。
一、传统向量空间模型
随着社会的逐步发展和进步,不同类型的信息检索算法模型已经形成和应用。其中,Sallon等学者就对向量空间模型算法进行了构建,借助TFIDF对文档进行了转换,形成向量的形式,极大地简化了运算过程,有着大规模的应用。基于典型向量空间检索模型算法下,借助涵盖特征项构成向量可以对查询、文档进行表示,同时借助查询、文档二者间的向量夹角余弦当成度量相似性的过程,并且随着夹角的减小会使相似度逐渐增大。在对特定向量进行查询的过程中,通常需要将其同全部文档向量相似性进行比较,同时以相似度为标准,按照降序的规则来排列文档,并对最终的检索结果进行提交。上述方式具有多种优势,例如:简便化、处理速度较快和直观化等。然而文档集合下特征项总量比各篇查询、文档下特征项数量要大,所以查询、文档二者的向量代表形式下多数均是0。零项能够基于运算特征项相似度、权重,从而在空间、实践繁琐性方面存在问题,影响数据稀疏的状况。除此之外,抽取、查询匹配特征项时,相同特征项可以在文档各区域内出现,在显示文档内容能力方面有所差异。……
登录APP查看全文
