3.4 数据治理:地基不牢,上面全是空中楼阁
系列文章目录:《组织基因、利益格局与系统驱动——数字化变革的底层逻辑》
一节我们讲了数字化买不来中后台能力。这一节,我们来讲其中一个最基础、也最容易被忽视的能力:数据治理。
这一节我会分五个部分来讲:
-
先讲一个例子,说明数据不准的时候,系统算出来的东西有多离谱。
-
再讲一个经典理论——Garbage in, Garbage out,说明数据质量是一切的前提。
-
然后讲数据治理的三个核心:准确、及时、完整。
-
接着讲为什么数据治理这么难——它不是技术问题,是人的问题。
-
最后讲一个我们自己的教训,以及怎么一步一步把数据洗干净。
一个例子:系统很聪明,数据很蠢
先讲一个例子。
有一家零售企业,上了很先进的需求预测系统。系统用了最新的AI算法,花了大几百万,号称能精准预测每个门店每天的销量。
上线第一个月,系统预测的结果偏差很大。大家觉得可能是磨合期,正常。第二个月,偏差更大。第三个月,运营部门的人直接把系统关了,说“还不如我用Excel拍脑袋准”。
老板很生气,问技术团队:系统是不是有问题?
技术团队查了很久,发现系统没问题。问题出在数据上。
库存数据不准。门店卖了货,有时候当天录入,有时候隔两三天才录入。系统以为某天销量是零,实际卖了几十件。销售数据不全。线上线下的数据没有打通,线上的订单,线下的系统看不到。客户数据重复。同一个客户,在系统里有三条记录,三条记录的信息还不一样。
系统很聪明。但系统吃进去的是脏数据,吐出来的就是脏预测。再聪明的算法,也救不了垃圾数据。
这就叫:Garbage in, garbage out。进去的是垃圾,出来的也是垃圾。
一个经典道理:地基不牢,上面全是空中楼阁
数据治理有一个经典的比喻。
你盖一栋楼。地基没打好,上面装修得再漂亮,也是危楼。数据治理就是地基。所有数字化的东西——BI报表、AI预测、自动决策——都盖在这块地基上。地基不牢,上面全是空中楼阁。
可惜的是,大多数公司做数字化的时候,都把精力花在了“上面”——系统选了哪个品牌、算法用了什么模型、报表做了多少张。地基没人管,因为地基不性感。老板不会因为“我们把数据录准了”而表扬团队,客户不会因为“我们的数据很干净”而多下单。于是数据治理就成了姥姥不疼舅舅不爱的苦活、累活、没人愿意干的活。
但地基不打好,上面盖什么都白搭。这是最朴素的道理,也是最容易被忽略的道理。
数据治理的三个核心
数据治理到底在治什么?简单说就是三件事。
第一,数据准不准。
库存数据准不准?系统里显示还有50个,实际仓库里有没有50个?销售数据准不准?今天卖了多少,系统里记录了多少?客户数据准不准?客户的地址、电话、会员等级,对不对得上?
数据不准的原因有很多。录入错误、漏录、重复录、格式不统一。但最根本的原因只有一个:没有人对数据的准确性负责。
采购录入错了,没人追责。仓库盘点错了,没人追责。门店漏录了,没人追责。没人负责,数据就不会准。数据不准,系统就不会准。系统不准,大家就不用。大家不用,数字化就失败了。
第二,数据及时不及时。
数据准,但晚了,也没用。
门店早上卖了货,隔两天才录入。系统以为这两天库存没动,就不会补货。等库存真的空了,来不及了。运营部门要做周报,销售数据还停留在上周三。他们只能自己手工补,补着补着就乱了,数据就再也对不上了。
数据不及时,本质上是一个流程问题。你规定“当天必须录入”,但制度没有约束力。你不录,也没人管。你录晚了,也没人说。于是大家都觉得“晚一两天也没事”。结果就是系统里的数据永远是“过去时”,不是“现在时”。
第三,数据完整不完整。
数据准了,也及时了,但不全,也不行。
线上线下数据没打通,线上会员的消费记录,线下系统看不到。不同区域的数据格式不统一,A区用“男/女”,B区用“M/F”,合并分析的时候乱成一锅粥。历史数据缺失,去年三个月的数据丢了,你跟今年同比,比不了。
数据不完整,本质是一个架构问题。你一开始没有设计好数据标准,后面就永远在补窟窿。
为什么数据治理这么难
数据治理难,不是因为技术难。数据清洗的工具很多,数据治理的平台也很成熟。技术问题,花钱都能解决。
数据治理难,是因为它不是技术问题,是人的问题。
录入数据的是人。销售顾问忙了一天,下班前还要录数据,他烦不烦?烦。他能不能录准?能。他愿不愿意?看心情。没人盯着,他就随便录。有人盯着,他可能也随便录,因为他觉得数据不重要。
核对数据的是人。仓库盘点,发现账实不符,谁的责任?运营说采购的问题,采购说仓储的问题,仓储说门店的问题。最后不了了之。没人愿意认错,也没人愿意背锅。
使用数据的是人。运营部门觉得系统数据不准,就自己搞一套Excel。Excel录着录着,就跟系统数据对不上了。问他为什么不用系统,他说“系统不准”。问他系统为什么不准确,他说“数据不是我录的”。
数据治理,本质上是在跟“人的惰性”和“人的本位主义”作斗争。你不设计一套机制,让“录准数据”这件事对每个人都有好处,让“录错数据”这件事对每个人都有代价,数据就永远干净不了。
我们自己的教训
我们公司在这件事上,是有教训的。
数据不准最严重的时候,采购部门不敢用系统下单,因为他们不知道系统里的库存数据是真的还是假的。运营部门不敢用系统做预测,因为他们知道系统里的销售数据不全。财务部门月底对账,经常发现系统里的数据跟实际对不上,要花好几天人工核对。
我们曾经想过一个办法:上一个更贵的系统,功能更强的系统。但后来想明白了,这不是系统的问题。系统再强,也解决不了“门店录错数据”的问题。你不可能在每个门店装一个摄像头,盯着店员录数据。你能做的,是设计机制。
后来我们做了三件事:
第一,谁录入谁负责。 数据录错了,追溯到人。第一次警告,第二次扣绩效。不是要罚谁,是要让大家知道:数据不是“随便填填就行”的东西。
第二,谁使用谁监督。 运营部门发现数据不准,有权驳回,要求重新录入。驳回的次数,计入数据提供部门的考核。这样,用数据的人也有了监督的动力,因为数据不准直接影响他自己的工作。
第三,把数据质量纳入KPI。 每个部门的数据准确率、及时率、完整率,每个月打分,跟奖金挂钩。不是做个样子,是真扣真奖。
这三件事做了一年,数据质量才慢慢好起来。很慢,但有效。没有捷径。
一个总结
回到这一节的问题:数据治理,地基不牢,上面全是空中楼阁。
数据治理不是什么高深的东西。它做的就是三件事:让数据准一点、快一点、全一点。
但它难在:这不是技术问题,是人的问题。不是买套系统能解决的,是每天、每笔、每个人一点一点抠出来的。
没有捷径。谁告诉你数据治理可以速成,谁就是在骗你。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)