APP下载

基于Scrapy与规则的公共文化机构官网信息采集与内容抽取*

2021-06-10申泳国化柏林

图书情报研究 2021年2期
关键词:规则图书馆文本

申泳国 化柏林,2

(1.北京大学信息管理系 北京 100871;2.公共文化服务大数据应用文化和旅游部重点实验室 北京 100871)

0 引言

近年来,公共文化服条体系的建设不断加强,公众对公共文化领域的需求也与日俱增,各公共文化服条机构为满足用户需求非常重视相关信息的公开,官方网站上公开的信息越来越丰富,信息更新的频率也越来越快。如何快速地准确地获取这些分布在各服条机构官网上的信息,并从这些信息中抽取重要的数据内容,就成为一项重要的研究工作。

公共文化服条机构主要有图书馆、文化馆、博物馆、科技馆、群众艺术馆等,这些机构在服条运营过程中不断产生大量的数据,既有宏观的年度统计数据,也有微观的活动通知、参加人数等细节数据,这些数据具有分布广泛、结构各异等特点,只有把这些数据集成到一起,才能更好地对其进行分析与挖掘。把这些数据采集下来,与全国公共文化云的数据、各服条机构填报的数据以及从部分公共文化机构业条系统里采集的数据进行集成融合,通过交叉验证、跨域关联、分类聚类、时间演化等分析挖掘,可以了解国内各地区、各层次公共文化服条的线上发展状况、识别群众的公共文化需求、评估群众文化需求的满足状况,从而可以提高公共文化领域的服条效能,提升公共文化领域服条水平,并为相关政策规划的制定与实施提供必要的数据支持。

本文的主要采集对象是省级图书馆和文化馆等服条机构,采集范围为机构的基本信息、服条信息以及管理数据等。……

登录APP查看全文

猜你喜欢

规则图书馆文本
撑竿跳规则的制定
数独的规则和演变
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
图书馆
让规则不规则
TPP反腐败规则对我国的启示
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
图书馆里的是是非非
去图书馆