基于网络爬虫的网页大数据抓取方法仿真
2021-11-17谢蓉蓉郑帅位
计算机仿真 2021年6期
谢蓉蓉,徐 慧,郑帅位,马 刚
(1. 西安石油大学计算机学院,陕西 西安 710065;2. 西安石油大学石油工程学院,陕西 西安 710065;3. 西安石油大学信息中心,陕西 西安 710065)
1 引言
伴随互联网行业迅速发展以及计算机的广泛应用,以数字作为主要标志的数据内容、将网络作为主要载体的文化信息,逐渐成为现阶段信息传播的主要方式之一。由于网络自身具有全球性以及开放性的特点,在一定程度上为恶意信息的传播提供了机会,因此,面对该问题,如何采用网络数据[1]信息实行有效地控制及监督,并快速截取有害信息、防止不良数据信息的扩散,已成为当前网络研究的主要对象。经研究发现,网络大数据的搜索与挖掘是解决上述问题的一种重要途径,也是数据信息查找最有效的方法之一。
针对上述问题,文献[2]提出了基于Spark下遥感遥感大数据特征提取的加速策略。首先,采用Landsat8作为数据来源;其次,利用归一化计算方式计算植被指数(NDVI)、差值植被指数(DVI)、比值植被指数(RVI)值;最终通过仿真数据结果表明:在统一硬件环境条件下,执行相同的处理任务以及数据量,利用所提方法处理遥感大数据的速度提高了将近2倍,与基于Hadoop分布式文件系统(HDFS)方式相比,所提方法的处理速度提升了将近1.2倍,与基于HDFS方法相比,所提方法在栅格切分上处理速度提高了将近1.5倍,充分证明Spark方法的提取效率优秀。文献[3]针对民航飞机在飞行过程中需使用快速存取记录仪(QAR),同时QAR数据也是飞行安全评估的重要依据。……
登录APP查看全文
