作者 | 橙子
审核 | gongyouliu
编辑 | auroral-L
大数据从来不是免费的午餐
从今天开始会为大家带来《决战大数据:大数据的关键思考》的新系列文章,这次和大家分享的是“大数据从来不是免费的午餐”。
大数据从来不是免费的午餐,伴随着大数据热潮的到来,关于大数据的一些新问题层出不穷。目前,在大数据方面无法深入应用的原因在于,从收集到使用的大数据价值链出现了问题。从理论上来说,只有先数据化运营,然后才能运营数据。而现在的情况是,用数据的人不知道大数据从哪里来,做数据的人不知道大数据如何使用,想用的人不敢用,因为担心大数据的真实性,做的人不知道怎么用,因为大数据的复杂性,这一问题造成的结果就是数据量变得越来越大,而且越来越无法有效的使用。
做大数据基本上都要从大量收集数据开始,因为这些数据在未来会大有用处,但是你是不可能无止境的收集下去的。在这里,你已经看到了一个再清晰不过的伪命题,大数据的确能够备份,但是成本会增加两三倍。
大数据会夹杂着虚假信息,大数据的数据量很大,但有用的信息不一定多,甚至还会破坏核心信息。大数据的来源是多渠道的,偏移,随机的误差总是存在。但是我们也需要客观地认识到大数据现在面临的这些问题,其实就是把小数据中的一些问题放大了。小数据中难道就没有噪音会破坏我们的核心信息嘛?当然也有,只不过当大数据把数据量放大和变多的时候,噪音的破坏性也会相应变。大小数据中难道就没有渠道偏移和随机的问题吗?当然也有,但是在大数据的背景下,问题被更明显的放大了。
很多人会问,大数据能带来什么价值,怎么衡量大数据创造的价值?实际上,最直接的衡量标准就是在运营上,它为你赚了多少钱,带来了多少实际的利润提升。对于这些问题的解决,现在很多人倾向使用的方法是计算在用了大数据之后,点击率提高了多少,转化率提高了多少。但是要知道,转化率和点击率能提高的数据,可能根本不是投资人或公司最高管理者对大数据的期望。对于业务人员来说,转化率能提升五个百分点就已经很好了。如果将转化率从2%提高到3%,简直就是奇迹了。但对于公司最高管理者来说,这并不是他想要的大数据。
我们需要认识到,断层才是大数据所面临的最严重的问题。收集数据的人并不清楚未来使用数据的人想要做什么,这是目前大数据运用的一大关键命门。
在使用大数据时,我们通常的做法是先把数据收集起来,因为我们知道,在未来的某一时刻,这些数据对我们可能有用。不过,未来可能有用,就注定会引发一个问题,收集数据的人不知道未来使用数据的人想要做什么。这时候,如果你再问收集数据的人如何才能更好地收集数据,那么数据的使用就会陷入一个死循环。
事实上,不仅是收集数据的人,就连使用数据建模的人,同样也不清楚当前的数据是如何获得的。数据建模是数据使用的关键环节,使用数据建模就是根据以往的经验中或寻找到一些潜在的规则,然后把这些规则结合起来去解决问题。
本文的视频版本可以直接点击下面视频观看,欢迎关注数据与智能视频号获取更多精彩视频。





