企业数据建设二十年反思(上)
自2006年Apache Hadoop第一个版本发布已经过去了20年。大数据、数据中台这些曾经炙手可热的词汇,如今已经越来越少人提起。过去十年,不少传统企业在数据架构上经历了一次代价高昂的“绕路”。
当年,互联网大厂拥抱 Hadoop 生态的动机很朴素:便宜、能存、能算。Teradata 太贵,Oracle 撑不住 PB 级,HDFS+Hive 几乎零成本起步。于是互联网大厂率先把核心系统数据库迁到了 Hadoop 上。
但很快发现了几个残酷现实:
运维成本爆炸:Hadoop 生态组件太多,一个集群出问题要排查 HDFS、YARN、Hive、Spark、Zookeeper……小团队根本扛不住。
SQL 体验倒退:Hive 的 SQL 支持残缺,性能不稳定,一个简单的 JOIN 可能跑半小时。
实时性为零:MapReduce 天生批处理,想做实时报表还得引入 Storm/Kafka/Flink,复杂度再次飙升。
很多传统企业认为互联网大厂先进,将核心报表、ETL 甚至部分交易分析迁到了 Hadoop 上。折腾三五年后,发现花了不比 Teradata 少的钱(人力+硬件),得到了更差的体验。这时候看到 Doris、ClickHouse 这类 MPP 产品,自然会觉得:“这不就是当年 Teradata 那套吗?绕了一大圈又回来了。”
欧美同样走了 Hadoop 弯路,而且踩得更早。
Hadoop 本来就是欧美的产物:Google 的 GFS/MapReduce 论文(2003)→ Yahoo 养出 Hadoop 项目(2006)→ Facebook 搞出 Hive(2008)→ Cloudera/Hortonworks 两家上市(2010s 初)。欧美企业(零售、保险、银行、制药)当年砸的钱不比中国少:
某大型零售企业数千万美元建 Hadoop 集群,三年后只用来跑月度销售报表,实时库存、个性化推荐因数据质量和链路问题落不了地。
一家保险 PBM 公司 2700 万会员的 Teradata 还没来得及换,中间也被忽悠上了 Hadoop 做“数据湖”,后来才直奔 Snowflake。
Cloudera 2019 年停更 CDH 逼用户迁 CDP 被骂“割韭菜”,2021 年被 PE 收购私有化退市——这标志着 Hadoop 商业化全球崩盘,并非中国独有的问题。
所以,“以为 Hadoop 能替代 EDW,结果发现运维炸、SQL 慢、业务用不起来”这个坑,欧美企业先踩的。
但中国的“弯度”确实更大,原因有三 :
同样是踩 Hadoop,欧美退出来的比中国快,路径差异如下:
关键差异:欧美从 Hadoop 退下来时,Snowflake 已经在那里等着了——纯 SaaS、零管理、按秒计费,企业直接“弃 Teradata + 弃 Hadoop”一步到位。
中国当时(2018-2021)公有云在传统行业推不动(合规、数据主权、预算模式),所以退不回云,只能退到“另一个开源 MPP”继续私有化跑。
但是,Cloudera/Hortonworks 国内中台化继承者们把 Hadoop 动物园(HDFS/Hive/Spark/YARN/ZK)包成一个“数据中台产品”卖给传统企业,再加一套“全域数据资产、标签画像、数据服务 API”的叙事。实际走的是欧美已经弃用的路径。
互联网大厂的角色:放大器,不是起源
Hadoop 热本身不是中国大厂掀起的——Google/Yahoo/Facebook 才是源头,Cloudera/Hortonworks 才是商业化推手,欧美银行业/零售业才是第一批买单的。
但中国互联网大厂确实放大了“弯路感”:阿里 2016 年前后推“数据中台”概念,把 Hadoop 生态(HDFS/Hive/Spark)+ 调度 + 治理打包成一个“你必须有的中台”,影响了大量传统企业 IT 选型。互联网大厂又推了自家开源(Doris、ClickHouse 国内推广、Pulsar 等),让传统企业觉得“互联网大厂都这么干,我也得这么干”。
更大的放大器是人才流动:Hadoop/Spark committer 中国人比例很高,大厂出来的人去传统行业做 CTO,自然把那套栈带过去——这套叙事在欧美也有(FB/Google/LinkedIn 的人出来搞了 Confluent、Cloudera、Databricks),但欧美传统企业 IT 更敢直接买 Snowflake SaaS,不肯养 Hadoop 团队,所以放大效应没中国强。
中国多叠了一层“互联网中台叙事”的坑。阿里的中台叙事 + 传统企业 IT 对互联网大厂的模仿心理 + 公有云渗透率低,三者叠加。
Snowflake 是从 EDW 侧“降维替代”,Databricks 是从数据湖侧“升级重生”
Snowflake 成立(2012)公测(2014)那年,业界所有人都在搞“Hadoop 上加 SQL”(Hive/Impala/Presto),Cloudera 喊的是“Replace EDW with Hadoop”。Snowflake 创始人(原 Oracle 团队)偏偏选了反向:不碰 Hadoop 栈,直接给云做一个 Shared-Data 的“新式数仓”。所以,Snowflake 接的不只是 Hadoop 逃兵,更多是 Teradata/Oracle 老用户想“云化降级”。
Snowflake 的杀手锏是“简单到不需要 DBA”——某零售企业 Hadoop 集群养 6 个工程师,Snowflake 那边 1 个数据工程师 + SQL 就能跑。这对欧美传统企业(银行/零售/保险)杀伤力极大,因为他们本来就被 Teradata 贵怕了,又被 Hadoop 复杂怕了,Snowflake 一出现就是“两边都不用受”。
Snowflake 和 Databricks 都不是来“继承 Hadoop”的,而是来“给被 Hadoop 搞烦的人另一条路”的:
Snowflake 接的是“我想换掉 Teradata,但又不想跳进 Hadoop 坑”的那批(EDW → 云数仓)。
Databricks 接的是“我已经在 Hadoop/Spark 上了,但 YARN/ZooKeeper 快把我逼疯”的那批(数据湖 → Lakehouse)。
中国用户把欧美降成本的解决方案理解成了“更先进”。中国用户本质上是被“先进”驱动的,而不是成本效率驱动的。
另一边,欧美继续降成本的解决方案就是云数仓。两条路都要求企业愿意把数据栈交给云 SaaS。中国传统企业这一步迈不出去,所以“接住”这事在中国没发生,变成了 MPP 这种“开源+私服”的折中方案——技术上是回归 MPP,商业上是无奈。现状就是国内企业想“假装自己在用 Snowflake”,私服里凑一套类 Lakehouse。
国内传统企业这一波湖仓一体,本质是用开源组件(MPP + Iceberg/Paimon + 对象存储)拼出一个“看起来像 Snowflake”的架构,但 Snowflake 真正值钱的那几样东西(Serverless 自动优化、零运维、统一治理)其实没接住。
总结一下,过去十年,企业数据建设的真正进步,不是发明了新类型的数据库,而是转了一大圈把 OLAP 的成本降到了原来的十分之一。
当前欧美传统企业(银行、保险、零售、制造)他们把 Teradata 时代设计好的 EDW 模型(总线矩阵、一致性维度、星型/雪花型 schema)整体迁移到 Snowflake/BigQuery 上,存储从专用硬件换成了对象存储(S3/GCS),计算从专用 MPP 换成了云原生虚拟仓库,运维从原厂保姆变成了 SaaS 零管理。核心收益就是“省成本、省运维”,业务抽象层几乎原封不动。