基于豆瓣读书网站大数据技术分析我国图书市场现状
2021-07-13陈珂
苏州市职业大学学报 2021年2期
关键词:评价
陈 珂
(苏州市职业大学 计算机工程学院, 江苏 苏州 215104)
图书市场情报分析在图书出版和发行[1]、图书编辑[2]、图书馆管理[3],在健全学术图书的质量评价体系等领域有着重要的研究和应用价值[4-6]。
豆瓣(book.douban.com)是国内大型读书网站的代表,本研究基于豆瓣读书网站的图书信息,利用数据爬取、数据挖掘和清洗、回归分析等技术手段对豆瓣读书网站数据资源进行解析、清洗和处理,揭示我国当前图书市场的现状和特点。
1 数据来源与研究方法
1)本研究的原始数据来自于豆瓣读书网站(book.douban.com),利用python编程语言的Scrapy框架(一种对网站内的结构性数据进行高效挖掘的技术工具集),实现对36 850条有效数据进行网站内的所有图书网页的数据爬取和数据挖掘。
2)实施过程中,通过降低爬虫请求新网页的频率(设置每次请求之间的随机延时)和利用随机用户代理机制(使网站误以为爬虫发出的请求来源于不同的多个主机)成功地绕过网站针对传统爬虫设置的反爬虫机制,爬取了该读书网站内几乎所有的图书条目数据,共计36 873条。首先数据被存成cvs格式文件,通过数据清洗剔除了重复或包含非法值的数据,最后得到了整个豆瓣网站的有效图书条目共计36 850条。
2 图书重要指标分布
2.1 图书评价数与售价之间的关系
由图1可知,通过回归分析降低其他因素的干扰,发现图书售价与评价数之间的确存在着一种近似的负相关线性关系,评价数量随售价提高而下降。就每个售价区间而言,评价数越高则图书数量越小。……
登录APP查看全文
