基于OutbackCDX的增量式Web信息采集研究
2020-07-13白如江
山东理工大学学报(社会科学版) 2020年4期
高 婷,白如江
一、引言
当今社会互联网信息技术飞速发展,随着网络信息资源数量和种类飞速增加,网络信息资源逐渐变为人类数字文化遗产中重要的组成部分。由于网络信息资源具有更新快、易丢失的特点,导致其消亡的速度很快,特别是一些重要的历史性的网页信息会随着网页的消失而丢失,这些信息如果消失就难以找回或复原,从而造成难以估量的损失。
2015年,互联网数据传输协议的缔造者之一,谷歌副总裁温特·瑟夫(Vint Cerf)指出了一个令人们为之一颤的忧虑,他担心随着数字技术的不断迭代演化,今天人类保存在互联网上的图片、文档或文件等信息可能彻底丢失,在进入一个“数字黑暗时代”后,未来的人类可能根本没有关于21世纪的历史记录。
美国数字信息基础架构和保存项目(NDllP)的报告中指出,网络信息的平均寿命为44天,这就导致相当一部分有价值的网络信息资源面临着消失的危险[1]。由此来看,人类将失去大量具有重要价值的学术、文化、科学信息。随着对网络信息资源保存的认识日益深入,越来越多的国家政府和机构将网络信息资源作为文化遗产进行保存。
目前,世界各国的政府、组织、机构纷纷开始开展与Web Archive相关的研究和实践,其中,美国、加拿大、西班牙和澳大利亚等国家的政府、档案馆和图书馆对网页归档的研究和实践应用较多。
在国内,对Web Archive进行研究的项目主要有中国国家图书馆网络信息资源保存实验(Web Information Collection and Preservation,WICP)和中国Web信息博物馆两个项目。……
登录APP查看全文