论坛与新闻

数据科学家应该拥有的好习惯(2)

数据科学家应该拥有的好习惯(二)

(2017年1月8日)

4、永远不要轻信自己的分析结果,多用业务和常识去检验

很多时候,我们的分析都是含有一些潜在的假设,而在分析过程中被忽略。比如最经典的案例是在1948年,盖洛普错误地预测了杜威能击败杜鲁门而当选总统。

原因是多方面的,但是抽样中的潜在不平均是不可否认的! 再比如有个人分析结果得到刚毕业的专科的平均薪资比同专业的本科要高,就找一堆理由来说明这个结论。

但是领导说这个不符合常识,打回去重新分析。之后发现是因为样本男女比例不均衡导致的。

所以,我们不要轻信自己的分析结果,尤其是不能给自己的分析找正向的理由!

因为只有你找理由,总会能给自己的结论找到一堆理由。有多从实际出发,如果不符合常识,那就更要多方面论证,才能发声!否则,就会是个笑话!

5、阅读人文:数据科学不仅是一门科学,也是一门艺术

数据科学,你可以认为是一门探索人性的科学。

我经常跟周围做数据或者IT人的说的一点是,因为我们是做数据或者写一些代码的,这里的数字是1就是1,不会是2,TRUE了就不会是FALSE,所以做久了,人容易偏执,不会享受生活,那就无法把艺术引进!

这里也举一个例子,美国有一家大型商场,业务经理想能否预测一个客户是否是孕妇,以此来针对性的营销呢?

他们的数据科学家通过分析找到了一个模型来预测。那么他们是直接把孕妇相关产品推荐给客户吗?

不是的,因为这个数据科学家不仅是数学好还是一个社会学家,他说如果全部推荐相关产品,那么客户会觉得自己的隐私被侵犯,甚至会觉得反感,所以他的策略是把真正想要推荐的东西放在一堆其他东西里。

当然,这里只是简写,实际过程非常有趣。

6、了解行业信息和业务信息

这一点非常重要。分析和挖掘,最终都是要落到具体的业务上来的。所以做数据,不能脱离业务和行业规律。了解行业信息,能够让你在分析的时候更加的接地气、更好的把握分析框架!

尤其是,联系刚才说的第一点,你积累的行业信息和业务信息都会帮助你检验你的分析,同时让你更还的认识到什么样的分析是有价值的分析。

对于业务中的乱七八糟的各种概念更是要深入理解,不能停留在表面。有时候,一个业务概念理解失误(比如0是否有参与计算),会导致分析出完全相反的结论。

据说,数据分析会导致经验累积加速,简单的说一般业务人员工作10年的工作经验,数据分析5年就能掌握。

(未完待续)

(摘编自 微信公众号 数据分析 \ 编辑严进军)