×
支持199IT发展可加入知识交流群(8K+用户),最有价值数据分享和讨论!
点击即可加入!
关闭

数据科学的整合与细分

自从大数据这个词出来以后,数据已经成为一个非常明确的科学领域。在这当中很少有人详细地探讨数据科学的结构和它面临的问题,包括我们行业面临的问题。

数据科学有三个非常重要的层次:数据的获取、数据的描述和数据的分析,这三件事是不同的,不要把它混淆了。

1.数据的获取

d63bc4145151b5fdfd1a7e0b97b5c578

以前数据的稀缺导致行业内出现非常大的非良性循环。

c4963ba44c4c31de31bd57c170fc8cbb6223fbf14e8c4f9dd162bb29a16976c5

在这个过程当中,又正好赶上了一个新的时代——机器化数据横空出世,突然之间,甚至一夜之间数据不再稀缺了。单靠获得数据,你能拿到高额利润的可能性微乎其微,这样就必然导致执行公司如果要继续作弊必死无疑,未来五年内我们可以清楚的看到,研究公司不好好做研究,也照样是必死无疑,无论你是国际的,还是国内的,因为时代变了。所以数据获取这一块,要有非常清醒的认识。

3d5b02ddd89ccf73b4f42379ff8c474d

在这个时候大数据,正常的讲叫机器化数据已经被神话,而市场研究公司被积压在这里,市场研究数据的结构化,它必须满足两个条件,一是真的,二是价格是低的,这两件事造成的后果是什么,我相信业内的所有公司都会有体会。

2f5ffade02f4e16c95ebed9b3f74be4b

2.数据的描述

再看数据的描述,由于整个社会大环境巨大的变化,在描述环节上出现了非常大的问题,这个问题中你会发现形成了新的、不同的非良性循环。为什么?数据不稀缺了。而在这个时候,机器化数据出来的东西做点频率表,做点交互表很简单。如果数据描述能够替代数据分析,这个世界一定会毁掉,因为数据想骗人太容易了。

e01aa02ca9964c4d545a84c0d9b96354

接下来的过程当中,机器化数据由于资料收集简单,整理数据的过程非常容易。所以直接面向销售,这个面向销售就出现了充满荆棘的历程。

a754dfcb48e392294d773dd2062cad69
再看研究公司的结构化数据,大型公司由于没有应对,我在行业这么多年,一直在这些时期,有机会就在呼吁洞察这个词。实际上我们的研究员正在日益变成填数工具,而不是洞察。数据不再稀缺,你在机器化数据面前,你填数的过程当中,数据的真假还在存疑,这时候你不败谁败,必然败。而且别忘了机器化数据的成本趋近于零,所以大中型研究公司的解体、兼并、重组在不远的将来一定会频现,这是没有办法的趋势。

3f4b2040b8a8fa633d44af4902d6217c

现在数据科学有七大危险趋势:

90d2c0804272d3566cb1c2d2a19a0246
e6f5481b9ff6439e46a5dd65777ae6c3
dc011468b7b7b7d3e35e2b8b00d1da12
1b49ad82be7a9988ee40a0431ebfb252
1ff69ae3490d9c96dc3db086e58b2a87
::__IHACKLOG_REMOTE_IMAGE_AUTODOWN_BLOCK__::13
d4a1917de036927e632304e5ddb5f9fe

3.数据的分析

以上七个危险趋势将直接导致数据分析中的危险,什么是数据分析?我先从最简单的案例说起。

案例一:简单表格的危险

7ac5b8955e8e7d026d8efb4cc3e349e1f147eacd6146ae9f2d4a34ae6bc27ad5

这个数据的结果,意味着什么?老年人比年轻人更喜欢这个东西。实际的结果呢?老年人和年轻人没有任何差异。高低文化之间有差别吗?所有的结果都显示高文化程度的比低文化程度的人更喜欢,总体上它就是相同的。

再看一个更加实际的案例。我们知道房价是怎么算的,房价是加权算术平均数。现在看一看房价,房子的均价跟房子的成交价格没有关系,跟销售结构有关系。所以在这个时候,房价的均价大约是这样的,我告诉大家房价在下一个季度全面上涨10%,但是销售结构略微有一点变化。房价下跌2.63%,大看清楚定价了吗?任何一个地方都上涨了10%,接下来销售结构一定会再变,房价又涨了10%,房价又下跌了,但是统计数字会告诉你下跌4%。

9545d266839b9e2b3343c4c76441b65c
6ec07c8e8224b0f09bfc645de0f5ed29
c569df4780be993a36903dc797fd3465

案例二:无关转相关系列

976c6e63e1e27ba8ff0e10f54afea84c
acb121baaa2341bf569a43eae4e2bc21
f8a7b21627c562d62e7834f8afeb48bc
这是我1998年获宝洁论文奖的时候得到的模型,表面上一大堆无差别、无差异的情况,导致了什么情况呢?看起来没有差异,一个是男的比女的喜欢,一个是女的比男的喜欢,整体上没有差异。但是差别大吗?规律性强吗?

案例三:建模预测

ff3f346ddeef2ae2bde588ce84901d97

我们在2011年用的词叫苹果熟透了,苹果在一个领域发展。2012年我在互联网大会上,在我们这个会场上我都说过华为将崛起。2013年我说过三星必然下滑,去年2014年也是一样的,这两个大会我都说过小米将面临问题,我不是神,但是模型能。2015年什么情况?我不想对任何一个品牌现在来说,大家关注我们要发布的手机人报告,那个时候我再开会,会详细地把这个结果告诉大家。

我让大家看一个结果,模型的基点预测点是这张图:

2ff67b81de8b7dff697c4ddba88f208b

这个模型你能不能做出来?我一直在说,中国调查业从来不缺数据,从来不缺所谓的描述,只缺分析。如果被这些互联网公司,被码农牵着走,那不是笑话吗?他们能代表中国的分析能力吗?中国的分析能力不是他们,而一定是我们。

4.小结

41ba64462aab5df82501948fda1dcac0a4f6a9e79afc09cf209351618be215b5
cc00a011ff4a50651102e4eb91a79236
69dd0c403639a9acf9dd7f643e2e3bb5

感谢支持199IT
我们致力为中国互联网研究和咨询及IT行业数据专业人员和决策者提供一个数据共享平台。

要继续访问我们的网站,只需关闭您的广告拦截器并刷新页面。
滚动到顶部