符合业务目标的数据战略建设

企业数据建设二十年反思(上)

自2006年Apache Hadoop第一个版本发布已经过去了20年。大数据、数据中台这些曾经炙手可热的词汇,如今已经越来越少人提起。过去十年,不少传统企业在数据架构上经历了一次代价高昂的“绕路”。 

当年,互联网大厂拥抱 Hadoop 生态的动机很朴素:便宜、能存、能算。Teradata 太贵,Oracle 撑不住 PB 级,HDFS+Hive 几乎零成本起步。于是互联网大厂率先把核心系统数据库迁到了 Hadoop 上。

但很快发现了几个残酷现实:

  • 运维成本爆炸:Hadoop 生态组件太多,一个集群出问题要排查 HDFS、YARN、Hive、Spark、Zookeeper……小团队根本扛不住。

  • SQL 体验倒退:Hive 的 SQL 支持残缺,性能不稳定,一个简单的 JOIN 可能跑半小时。

  • 实时性为零:MapReduce 天生批处理,想做实时报表还得引入 Storm/Kafka/Flink,复杂度再次飙升。

很多传统企业认为互联网大厂先进,将核心报表、ETL 甚至部分交易分析迁到了 Hadoop 上。折腾三五年后,发现花了不比 Teradata 少的钱(人力+硬件),得到了更差的体验。这时候看到 Doris、ClickHouse 这类 MPP 产品,自然会觉得:“这不就是当年 Teradata 那套吗?绕了一大圈又回来了。”

欧美同样走了 Hadoop 弯路,而且踩得更早。

Hadoop 本来就是欧美的产物:Google 的 GFS/MapReduce 论文(2003)→ Yahoo 养出 Hadoop 项目(2006)→ Facebook 搞出 Hive(2008)→ Cloudera/Hortonworks 两家上市(2010s 初)。欧美企业(零售、保险、银行、制药)当年砸的钱不比中国少:

  • 某大型零售企业数千万美元建 Hadoop 集群,三年后只用来跑月度销售报表,实时库存、个性化推荐因数据质量和链路问题落不了地。

  • 一家保险 PBM 公司 2700 万会员的 Teradata 还没来得及换,中间也被忽悠上了 Hadoop 做“数据湖”,后来才直奔 Snowflake。

  • Cloudera 2019 年停更 CDH 逼用户迁 CDP 被骂“割韭菜”,2021 年被 PE 收购私有化退市——这标志着 Hadoop 商业化全球崩盘,并非中国独有的问题。

所以,“以为 Hadoop 能替代 EDW,结果发现运维炸、SQL 慢、业务用不起来”这个坑,欧美企业先踩的。

但中国的“弯度”确实更大,原因有三 :

同样是踩 Hadoop,欧美退出来的比中国快,路径差异如下:

图片

关键差异:欧美从 Hadoop 退下来时,Snowflake 已经在那里等着了——纯 SaaS、零管理、按秒计费,企业直接“弃 Teradata + 弃 Hadoop”一步到位。

中国当时(2018-2021)公有云在传统行业推不动(合规、数据主权、预算模式),所以退不回云,只能退到“另一个开源 MPP”继续私有化跑。

但是,Cloudera/Hortonworks 国内中台化继承者们把 Hadoop 动物园(HDFS/Hive/Spark/YARN/ZK)包成一个“数据中台产品”卖给传统企业,再加一套“全域数据资产、标签画像、数据服务 API”的叙事。实际走的是欧美已经弃用的路径。

互联网大厂的角色:放大器,不是起源 

Hadoop 热本身不是中国大厂掀起的——Google/Yahoo/Facebook 才是源头,Cloudera/Hortonworks 才是商业化推手,欧美银行业/零售业才是第一批买单的。

但中国互联网大厂确实放大了“弯路感”:阿里 2016 年前后推“数据中台”概念,把 Hadoop 生态(HDFS/Hive/Spark)+ 调度 + 治理打包成一个“你必须有的中台”,影响了大量传统企业 IT 选型。互联网大厂又推了自家开源(Doris、ClickHouse 国内推广、Pulsar 等),让传统企业觉得“互联网大厂都这么干,我也得这么干”。

更大的放大器是人才流动:Hadoop/Spark committer 中国人比例很高,大厂出来的人去传统行业做 CTO,自然把那套栈带过去——这套叙事在欧美也有(FB/Google/LinkedIn 的人出来搞了 Confluent、Cloudera、Databricks),但欧美传统企业 IT 更敢直接买 Snowflake SaaS,不肯养 Hadoop 团队,所以放大效应没中国强。

中国多叠了一层“互联网中台叙事”的坑。阿里的中台叙事 + 传统企业 IT 对互联网大厂的模仿心理 + 公有云渗透率低,三者叠加。

Snowflake 是从 EDW 侧“降维替代”,Databricks 是从数据湖侧“升级重生”

Snowflake 成立(2012)公测(2014)那年,业界所有人都在搞“Hadoop 上加 SQL”(Hive/Impala/Presto),Cloudera 喊的是“Replace EDW with Hadoop”。Snowflake 创始人(原 Oracle 团队)偏偏选了反向:不碰 Hadoop 栈,直接给云做一个 Shared-Data 的“新式数仓”。所以,Snowflake 接的不只是 Hadoop 逃兵,更多是 Teradata/Oracle 老用户想“云化降级”。

Snowflake 的杀手锏是“简单到不需要 DBA”——某零售企业 Hadoop 集群养 6 个工程师,Snowflake 那边 1 个数据工程师 + SQL 就能跑。这对欧美传统企业(银行/零售/保险)杀伤力极大,因为他们本来就被 Teradata 贵怕了,又被 Hadoop 复杂怕了,Snowflake 一出现就是“两边都不用受”。

Snowflake 和 Databricks 都不是来“继承 Hadoop”的,而是来“给被 Hadoop 搞烦的人另一条路”的:

  • Snowflake 接的是“我想换掉 Teradata,但又不想跳进 Hadoop 坑”的那批(EDW → 云数仓)。

  • Databricks 接的是“我已经在 Hadoop/Spark 上了,但 YARN/ZooKeeper 快把我逼疯”的那批(数据湖 → Lakehouse)。

中国用户把欧美降成本的解决方案理解成了“更先进”。中国用户本质上是被“先进”驱动的,而不是成本效率驱动的。

另一边,欧美继续降成本的解决方案就是云数仓。两条路都要求企业愿意把数据栈交给云 SaaS。中国传统企业这一步迈不出去,所以“接住”这事在中国没发生,变成了 MPP 这种“开源+私服”的折中方案——技术上是回归 MPP,商业上是无奈。现状就是国内企业想“假装自己在用 Snowflake”,私服里凑一套类 Lakehouse。

国内传统企业这一波湖仓一体,本质是用开源组件(MPP + Iceberg/Paimon + 对象存储)拼出一个“看起来像 Snowflake”的架构,但 Snowflake 真正值钱的那几样东西(Serverless 自动优化、零运维、统一治理)其实没接住。

总结一下,过去十年,企业数据建设的真正进步,不是发明了新类型的数据库,而是转了一大圈把 OLAP 的成本降到了原来的十分之一。

当前欧美传统企业(银行、保险、零售、制造)他们把 Teradata 时代设计好的 EDW 模型(总线矩阵、一致性维度、星型/雪花型 schema)整体迁移到 Snowflake/BigQuery 上,存储从专用硬件换成了对象存储(S3/GCS),计算从专用 MPP 换成了云原生虚拟仓库,运维从原厂保姆变成了 SaaS 零管理。核心收益就是“省成本、省运维”,业务抽象层几乎原封不动。

共 1 页 1 条数据