“计算”的边界:互联网大数据与社会研究
2018-06-21
中南大学学报(社会科学版) 2018年2期
(武汉大学社会学系,湖北武汉,430072)
社会学的量化研究以数据资料为基础,大数据时代的到来,使运用海量数据和新的数据处理技术,对人类行为、群体互动乃至社会复杂适应系统进行研究成为可能。可用于社会研究的大数据,依其生成方式大体可分为三类:第一类是基于人机互动在互联网和移动互联网平台上生成采集的互联网大数据①,包括社交关系数据、网络文本数据、电子踪迹数据等;第二类是通过各种传感器采集而来的物联网大数据,手机位置信息是其典型类型;第三类则是通过数字化与数据化手段由既有信息资料转制而成的大数据,例如谷歌图书语料库(Google Books Corpus)[1]。在三类数据中,互联网大数据由于承载着大规模、长时段、连续关系性和意义性信息,被认为将赋予社会学“改变我们对生活、组织和社会的理解”的潜力[2]。
单从名称上看,“大数据”好像是在强调与传统量化数据相比所具有的更大个案数量或信息规模。然而实际上,两种数据无论是在数据性质还是生产逻辑上都存在着质的差异:传统计量方法分析的是数值型数据(numerical data),这些数据是出于特定研究目的而运用实验、问卷调查等方法有计划地观测的结果,即数据生产本身就构成了研究的一项重要组成部分。新型计算方法所处理的则是计算机代码型数据(code data) ——“作为数据的可解释代码和作为代码的数据”[3],这些数据独立于社会研究之外。数据生产的独立性,也决定了其在社会研究中的边界。……
登录APP查看全文
