APP下载

数据的身份与污染

2016-08-31陈禹安

中国服饰 2016年7期
关键词:污染用户信息

陈禹安

自“大数据”成为热门以来,几乎一夜之间,很多公司都开始标榜自己“具备强大的数据挖掘能力”。但实际上,大数据正值萌芽期,所谓的大数据应用远远没有到达“神乎其神”的程度。

4月21日,亚马逊中国与新华网联合开展“2016全民阅读调查”,通过覆盖全国500多个城市、11800多位受访用户的数据调查,并结合多年来对中国市场的深入研究以及读者在线消费行为的分析,发布了一份调查报告。

不过,这份报告的结论却难有说服力。比如,70后爱读生活和少儿类图书,80后对经管以及孕产育儿类书籍情有独钟。

不同年龄段的读者在题材选择上确实会有所不同,但着重突出70后对于生活类和少儿类图书的热爱,与身边的现实情形相差较大。70后中年纪最大的已经46岁、最小的37岁,这一头一尾的差别显然不能用“爱读生活和少儿类图书”来统一。

而且,70后确实可能买少儿类图书,但未必就是“爱读”。

显然,亚马逊对于数据的解读太过粗疏,也经不起推敲。而导致这一结果的原因可能是调查样本偏差,也可能是数据在采集时就已经被污染。

前者是调查方式的问题,如是后者,则与“数据身份归属”密切相关,因为无论是通过亚马逊网站还是kindle采集的信息,都可能无法精准认证。

在互联网技术支撑下,数据采集已经不是什么难题,但针对任何数据的分析、评估、研判乃至具体的应用,首先就要明确数据的身份归属。

也就是说,某一组数据到底是由哪一个具体的鲜活个体产生的。……

登录APP查看全文

猜你喜欢

污染用户信息
坚决打好污染防治攻坚战
坚决打好污染防治攻坚战
订阅信息
关注用户
关注用户
关注用户
对抗尘污染,远离“霾”伏
如何获取一亿海外用户
展会信息
污染觅踪(下)