基于随机森林的图书馆集成信息检索方法
2021-09-22钟伟
安徽电子信息职业技术学院学报 2021年4期
钟 伟
(汕头职业技术学院图书馆,广东 汕头 515078)
一、引言
现阶段,图书馆建设已经发展成为评价国家发展基础水平的重要标志。建立图书馆的主要目的是实现数据资源共享,同时还能够有效完成数字资源对应系统的可用性和集成性[1-2]。随着互联网技术以及计算机技术的迅猛发展,现阶段图书馆面临十分严峻的挑战,例如异构数据集成以及统一检索。相关专家针对该方面的内容进行了大量的研究,例如施少芳[3]对图书馆建设过程中所需要的全部资源以及教育政策进行分析,同时网络资源利用教育的形式引入到图书馆集成信息机检索中,实现检索。张路路等人[4]通过内容分析法完成图书馆集成信息检索。以上两种方法虽然取得了较为满意的研究成果,但是仍然无法满足现阶段的发展需求,为此提出一种基于随机森林的图书馆集成信息检索方法,实验结果表明,所提方法能够全面提升检索效率以及检索结果准确性。
二、方法
(一)随机森林算法
随机森林算法是由两种不同的算法组成,决策树为整个算法的基本组成单元,主要通过投票结果完成未知样本的划分。假设要解决回归问题,则需要输出所有决策树结果的平均值[5-6]。
设定初始数据集T中含有N个样本,其中Xi1,Xi2,…,XiM代表数据的属性或者特征,共计M个;Y代表类别标签,以下给出整个算法的具体操作流程:
在属性子集K中选取最佳分类节点,选取属性集中最佳分类属性,同时将属性值作为下一步进行分裂的主要判定依据,如果属性值为连续变量,则需要选取对应的分裂点。……
登录APP查看全文
