大数据污染与用户画像
2016-08-03陈禹安
销售与市场·管理版 2016年7期
陈禹安
心理管理学家,杭州出版集团副总经理,微信公众号:wanjusiwei
互联网技术与大数据应用无疑是大势所趋,但高楼万丈平地起,如果从一开始就无法提供高纯净度的数据基础,任何美好设想都将是无本之木、无源之水。
自“大数据”成为热词以来,几乎一夜之间,很多公司就开始标榜自己“具备强大的数据挖掘能力”。但实际上,大数据时代刚刚萌芽,所谓的大数据应用远远没有达到“神乎其神”的程度。
2016年4月21日,亚马逊中国联合新华网开展了“2016全民阅读调查”,通过覆盖全国500多个城市、11800多位受访用户的数据调查,并结合多年来对中国市场的深入研究以及读者在线消费行为的分析,发布了一份调查报告。
这份报告的一些结论颇令人奇怪。比如,“70后”爱读生活和少儿类图书,“80后”对经管以及孕产育儿类书籍情有独钟。不同年龄段的读者在题材选择上确实会有所不同,但“70后”中年纪最大的已经46岁,最小的也已37岁,这一头一尾的差别显然不能用“爱读生活和少儿类图书”来统一,而且“70后”确实可能买少儿类图书,但未必就是“爱读”。
亚马逊对于数据的解读实在是太过粗疏了,而且也经不起推敲。导致这一结果的原因可能是调查样本偏差,也可能是数据在采集时就已经被污染。前者是调查方式的问题,如是后者,则与“数据身份归属”密切相关,因为无论是通过亚马逊网站还是Kindle采集的信息,都可能无法精准认证。
在当下的互联网技术支撑下,数据采集已经不是什么难题,但针对任何数据的分析、评估、研判乃至具体的应用,首先就要明确数据的身份归属。……
登录APP查看全文
