从Copilot到Agent
AI正从辅助工具演变为自主执行任务的智能体。
AI正从辅助工具演变为自主执行任务的智能体。
80%的AI项目因数据不可信而失败。
只有具备语义理解与血缘追踪的数据底座,才能驱动Agent。
Datablau企业的AI操作系统
高可信、高质量的数据资产。
通过AI大模型自动生成业务本体模型。
为AI Agent提供实时、可信、合规的系统MCP。
Make AI Real for Business
可控、可追溯、可审计的AI智能体Datablau以统一建模为核心,打通数据模型与本体语义体系,构建面向AI的数据智能底座,驱动企业数据治理与AI智能应用的双轮效应。
DOM是面向企业数据与语义一体化的本体建模与数据智能系统,从传统数据管理方式升级为以本体模型为核心的统一语义表达与治理体系。通过本体建模能力,对企业数据对象、业务概念与关系规则进行统一抽象与结构化表达,实现数据与语义的深度融合。结合智能体能力,DOM支持数据的自动理解、关联与推理,让数据从“结构化管理”走向“语义化智能”,为企业数据治理与AI应用提供统一的数据智能底座。
DDM从经典数据模型工具升级为企业级统一建模平台,覆盖数据模型、语义模型与本体模型,贯通标准落标、模型设计、管控与协作全流程。通过一体化建模能力,打通数据与语义之间的壁垒,让数据从“可建、可管”走向“可理解、可智能”,为企业数据治理与AI应用提供统一基础。
数据为AI筑基,赋智千行百业,开启智能未来。
立即部署专属 DDM / DAM AI 独立沙箱测试仓,开启您十万张物理级表结构的智能映射与自诊断。
加入官方微信公众号、数据官沙龙,与上万名首席数据官(CDO)、架构总监直通、共享数据合规标准。
在这个言必称AI的时代,为什么大多数企业的智能化转型依然举步维艰?我们正站在一场由人工智能驱动的巨大变革起点。算法在进化,算力在飙升,但无数企业在投入重金后却发现:喂给AI的“食材”(数据)往往是腐烂、过期或混杂的。 无论菜谱(算法)多么精湛,灶火(算力)多么猛烈,没有新鲜、优质的核心食材,最终呈上的绝无可能是美味佳肴,反而可能是充满偏见、引发合规风险的“毒药”。这正是《数据治理之道:构筑AI时代的基石》一书诞生的初衷。 本书并非空谈理论的学术著作,而是一套面向未来、为智能应用赋能的“道”与“术”相结合的实战体系。它旨在帮助企业跳出传统数据治理的樊笼,以终为始,直接面向AI应用的核心诉求,构筑坚实、平滑、承重能力极强的“智能基础”。核心洞见:为AI“专项治理”,而非全面铺开面对企业复杂的数据环境,试图“一口吃成胖子”往往会导致失败。《数据治理之道》创造性地提出了 “专项治理” 框架。本书指出,企业应围绕AI落地最依赖的数据核心要素,开展有针对性的攻坚战:可发现性(元数据)一致性(标准)可信度(质量)可追溯性(血缘)安全性每完成一个专项,就如同为AI大厦加固了一个关键承重节点。这种打法让数据治理从耗时耗力的“基建工程”变成了可以分步交付、快速见效的“攻坚战役”。三大收获助您决胜智能时代无论您是AI时代的数据管理者、企业决策者,还是数据治理的一线从业者,本书都将为您带来切实的帮助:清晰的认知升级:深刻理解为何“Data for AI”是成功的先决条件,厘清数据战略与AI战略的捆绑关系。成熟的体系与方法:掌握一套将数据治理与AI战略紧密结合的框架,学会如何制定贴合业务场景的治理路径。实用的专项工具:获得从元数据管理、数据标准制定、质量监控到数据入湖的落地实践指南,并了解如何利用AI技术反向赋能治理工作(AI for Data),实现自动化和智能化。内容抢“鲜”看基础知识篇:重新定义AI时代数据治理的战略意义,描绘全新的治理蓝图。专项攻坚篇:深入剖析元数据、标准、质量、安全、血缘等十一大关键领域,每一章均融入AI视角。实战案例篇:通过制造业不良件追溯、金融智能风控等真实场景,展示高质量数据如何直接驱动预测性维护、自动化风险识别,实现业务价值倍增通往AI的旅程已经开启,而这条道路正是由高质量的数据铺就的。如果您渴望告别“数据沼泽”,避免AI模型“水土不服”,让数据真正成为企业的核心竞争力,那么《数据治理之道:构筑AI时代的基石》将是您团队不可或缺的案头手册。
理论看了不少,,却不知道本体到底该怎么落地?领导一直在问:""本体到底能解决什么业务问题?AI 为什么需要本体?做了知识图谱、语义模型,却始终跑不通真实业务场景?缺少专家指导,不知道如何迈出企业本体建设的第一步?3 天,让你的企业本体真正跑起来。Ontology Bootcamp 是一场为期3天的企业本体实战加速营,不讲概念,不做演示,只解决一个问题:让你的企业本体真正落地。
里约热内卢,2026年6月——6月8日至11日,全球科技盛会Web Summit Rio在里约Riocentro盛大开幕,汇聚了来自全球3,000多位顶尖创始人、投资人与AI产业力量。Datablau作为AI基础建设领域的先行者,携最新AI原生数据治理产品受邀亮相本次峰会。凭借服务超60家财富全球500强公司,以及在金融、制造、能源等十余个行业的300余家国内外大型企业的深厚积累,Datablau正为企业构建从数据到AI的可信基础设施,致力于成为连接亚洲与拉丁美洲AI发展的重要桥梁。作为Web Summit Rio期间最受关注的边会之一,GO SUMMIT Rio:Transforme Ideias em Produtos 由AGI Villa(中国最大AI初创社区)与字节跳动旗下AI编程IDE——TRAE联合主办,并获巴西软件协会(ABES)全力支持,旨在打通亚洲与拉丁美洲的AI科技生态。创始人兼CEO王琤先生受邀出席Go SUMMIT Rio并发表《Data governance - AI fundamental》主题演讲,并与来自拉丁美洲的AI创业者、投资人及技术领袖深入交流,现场展示的AI原生的数据治理产品引发与会嘉宾与媒体的高度关注。王琤先生在演讲中表示,企业私有化大模型的最大挑战在于数据治理——LLM幻觉、知识过时、上下文缺失等问题的根源均是数据基础薄弱。过去18个月,许多企业盲目要求“用AI”,却缺乏策略与权责分工,导致价值难见。他指出,通过本体模型(Ontology)为AI提供完整数据上下文,可将问答准确率从76%提升至95%以上。同时,Datablau智能数据治理平台以AI Agent实现元数据补全、业务术语自动创建、数据分类与血缘链路追踪,形成“Data Governance for AI”与“Data Governance by AI”双轮驱动,让AI真正成为企业可信赖的副驾驶。此次Web Summit Rio之行,不仅展示了Datablau在AI原生数据治理领域的前沿成果,也标志着中国企业正积极输出AI基础设施建设方案,深度参与全球AI生态共建。未来,Datablau将持续打磨“Data Governance for AI”与“Data Governance by AI”双轮驱动的产品体系,进一步深化与亚洲、拉丁美洲及全球市场的生态合作,助力更多企业构建可信、可进化、可落地的人工智能基础设施,为全球AI生态的繁荣贡献中国智慧与力量。
自2006年Apache Hadoop第一个版本发布已经过去了20年。大数据、数据中台这些曾经炙手可热的词汇,如今已经越来越少人提起。过去十年,不少传统企业在数据架构上经历了一次代价高昂的“绕路”。 当年,互联网大厂拥抱 Hadoop 生态的动机很朴素:便宜、能存、能算。Teradata 太贵,Oracle 撑不住 PB 级,HDFS+Hive 几乎零成本起步。于是互联网大厂率先把核心系统数据库迁到了 Hadoop 上。但很快发现了几个残酷现实:运维成本爆炸:Hadoop 生态组件太多,一个集群出问题要排查 HDFS、YARN、Hive、Spark、Zookeeper……小团队根本扛不住。SQL 体验倒退:Hive 的 SQL 支持残缺,性能不稳定,一个简单的 JOIN 可能跑半小时。实时性为零:MapReduce 天生批处理,想做实时报表还得引入 Storm/Kafka/Flink,复杂度再次飙升。很多传统企业认为互联网大厂先进,将核心报表、ETL 甚至部分交易分析迁到了 Hadoop 上。折腾三五年后,发现花了不比 Teradata 少的钱(人力+硬件),得到了更差的体验。这时候看到 Doris、ClickHouse 这类 MPP 产品,自然会觉得:“这不就是当年 Teradata 那套吗?绕了一大圈又回来了。”欧美同样走了 Hadoop 弯路,而且踩得更早。Hadoop 本来就是欧美的产物:Google 的 GFS/MapReduce 论文(2003)→ Yahoo 养出 Hadoop 项目(2006)→ Facebook 搞出 Hive(2008)→ Cloudera/Hortonworks 两家上市(2010s 初)。欧美企业(零售、保险、银行、制药)当年砸的钱不比中国少:某大型零售企业数千万美元建 Hadoop 集群,三年后只用来跑月度销售报表,实时库存、个性化推荐因数据质量和链路问题落不了地。一家保险 PBM 公司 2700 万会员的 Teradata 还没来得及换,中间也被忽悠上了 Hadoop 做“数据湖”,后来才直奔 Snowflake。Cloudera 2019 年停更 CDH 逼用户迁 CDP 被骂“割韭菜”,2021 年被 PE 收购私有化退市——这标志着 Hadoop 商业化全球崩盘,并非中国独有的问题。所以,“以为 Hadoop 能替代 EDW,结果发现运维炸、SQL 慢、业务用不起来”这个坑,欧美企业先踩的。但中国的“弯度”确实更大,原因有三 :同样是踩 Hadoop,欧美退出来的比中国快,路径差异如下:关键差异:欧美从 Hadoop 退下来时,Snowflake 已经在那里等着了——纯 SaaS、零管理、按秒计费,企业直接“弃 Teradata + 弃 Hadoop”一步到位。中国当时(2018-2021)公有云在传统行业推不动(合规、数据主权、预算模式),所以退不回云,只能退到“另一个开源 MPP”继续私有化跑。但是,Cloudera/Hortonworks 国内中台化继承者们把 Hadoop 动物园(HDFS/Hive/Spark/YARN/ZK)包成一个“数据中台产品”卖给传统企业,再加一套“全域数据资产、标签画像、数据服务 API”的叙事。实际走的是欧美已经弃用的路径。互联网大厂的角色:放大器,不是起源 Hadoop 热本身不是中国大厂掀起的——Google/Yahoo/Facebook 才是源头,Cloudera/Hortonworks 才是商业化推手,欧美银行业/零售业才是第一批买单的。但中国互联网大厂确实放大了“弯路感”:阿里 2016 年前后推“数据中台”概念,把 Hadoop 生态(HDFS/Hive/Spark)+ 调度 + 治理打包成一个“你必须有的中台”,影响了大量传统企业 IT 选型。互联网大厂又推了自家开源(Doris、ClickHouse 国内推广、Pulsar 等),让传统企业觉得“互联网大厂都这么干,我也得这么干”。更大的放大器是人才流动:Hadoop/Spark committer 中国人比例很高,大厂出来的人去传统行业做 CTO,自然把那套栈带过去——这套叙事在欧美也有(FB/Google/LinkedIn 的人出来搞了 Confluent、Cloudera、Databricks),但欧美传统企业 IT 更敢直接买 Snowflake SaaS,不肯养 Hadoop 团队,所以放大效应没中国强。中国多叠了一层“互联网中台叙事”的坑。阿里的中台叙事 + 传统企业 IT 对互联网大厂的模仿心理 + 公有云渗透率低,三者叠加。Snowflake 是从 EDW 侧“降维替代”,Databricks 是从数据湖侧“升级重生”Snowflake 成立(2012)公测(2014)那年,业界所有人都在搞“Hadoop 上加 SQL”(Hive/Impala/Presto),Cloudera 喊的是“Replace EDW with Hadoop”。Snowflake 创始人(原 Oracle 团队)偏偏选了反向:不碰 Hadoop 栈,直接给云做一个 Shared-Data 的“新式数仓”。所以,Snowflake 接的不只是 Hadoop 逃兵,更多是 Teradata/Oracle 老用户想“云化降级”。Snowflake 的杀手锏是“简单到不需要 DBA”——某零售企业 Hadoop 集群养 6 个工程师,Snowflake 那边 1 个数据工程师 + SQL 就能跑。这对欧美传统企业(银行/零售/保险)杀伤力极大,因为他们本来就被 Teradata 贵怕了,又被 Hadoop 复杂怕了,Snowflake 一出现就是“两边都不用受”。Snowflake 和 Databricks 都不是来“继承 Hadoop”的,而是来“给被 Hadoop 搞烦的人另一条路”的:Snowflake 接的是“我想换掉 Teradata,但又不想跳进 Hadoop 坑”的那批(EDW → 云数仓)。Databricks 接的是“我已经在 Hadoop/Spark 上了,但 YARN/ZooKeeper 快把我逼疯”的那批(数据湖 → Lakehouse)。中国用户把欧美降成本的解决方案理解成了“更先进”。中国用户本质上是被“先进”驱动的,而不是成本效率驱动的。另一边,欧美继续降成本的解决方案就是云数仓。两条路都要求企业愿意把数据栈交给云 SaaS。中国传统企业这一步迈不出去,所以“接住”这事在中国没发生,变成了 MPP 这种“开源+私服”的折中方案——技术上是回归 MPP,商业上是无奈。现状就是国内企业想“假装自己在用 Snowflake”,私服里凑一套类 Lakehouse。国内传统企业这一波湖仓一体,本质是用开源组件(MPP + Iceberg/Paimon + 对象存储)拼出一个“看起来像 Snowflake”的架构,但 Snowflake 真正值钱的那几样东西(Serverless 自动优化、零运维、统一治理)其实没接住。总结一下,过去十年,企业数据建设的真正进步,不是发明了新类型的数据库,而是转了一大圈把 OLAP 的成本降到了原来的十分之一。当前欧美传统企业(银行、保险、零售、制造)他们把 Teradata 时代设计好的 EDW 模型(总线矩阵、一致性维度、星型/雪花型 schema)整体迁移到 Snowflake/BigQuery 上,存储从专用硬件换成了对象存储(S3/GCS),计算从专用 MPP 换成了云原生虚拟仓库,运维从原厂保姆变成了 SaaS 零管理。核心收益就是“省成本、省运维”,业务抽象层几乎原封不动。
Gartner发布的2026年数据与分析顶级趋势报告显示,AI智能体、语义层进步以及数据与分析平台的融合,将成为引领未来发展的三大核心趋势。对于希望识别关键业务和技术主题的数据与分析(D&A)领导者而言,这些领域是实现高性价比价值、更快成为AI FIRST企业的关键。 概览机遇与挑战AI FIRST企业能够通过战略性方法最大化AI在D&A中的收益,从而超越同行,取得更好的业务成果。阻碍这一愿景规模化落地的因素包括:组织内部碎片化、复杂的IT系统、互不关联的数据孤岛泛滥,以及分析技术。智能体驱动的数据与分析利用AI智能体加速实时数据的操作闭环,带来更敏捷的运营、精简的数据管理、更高质量的决策和更快的业务价值。但D&A领导者必须克服风险,通过实施决策治理来确保在使用生成式AI(GenAI)并扩展AI工程实践时,获得透明且合乎伦理的结果。将语义置于核心可提升AI的理解力。复合语义层和图检索增强生成(GraphRAG)等策略为改善AI智能体的响应质量、一致性和可靠性提供了必要的上下文。上下文工程是一项新兴实践。挑战在于许多组织面临架构碎片化、数据分散在互不通信的系统之间,这阻碍了AI智能体充分发挥潜力。D&A平台化用融合的数据管理和AI治理平台取代零散的单用途解决方案,通过一致的策略部署建立信任。以往的技术整合涉及繁琐的迁移,给本地化控制带来了额外挑战。这些因素进一步增加了对灵活且合理化的平台工程的需求,以简化D&A运营。 您需要了解的内容AI FIRST企业通过将智能体、语义和平台融入其D&A战略而胜过竞争对手。成功的组织将利用统一平台,通过AI FIRST举措推动业务成功。· 智能体驱动的数据与分析通过将AI智能体与实时数据流集成到运营中,加速数据到影响的闭环。这使得工作流程更加敏捷、自动化,但需要强有力的决策治理来降低GenAI风险并确保安全结果。· 语义核心化对AI的准确性和可靠性至关重要,通过复合语义层和GraphRAG提供上下文含义,消除碎片化架构。采用这些策略的组织可提高AI智能体响应的准确性。· 统一的D&A平台可以将数据管理、分析、治理和智能体能力整合到一个更简单的融合环境中,从而创造所需的清晰度以建立信任。这种整合减少了复杂性和冗余,使组织在应对各国日益涌现的往往相互冲突的主权AI战略时,具备所需的灵活性以实现AI FIRST。 战略规划假设· 到2030年,超过十分之一的企业将成为AI FIRST企业,通过采用智能体、语义和融合的D&A平台超越竞争对手。· 到2029年,20%的D&A领导者将拥抱智能体驱动的数据与分析,由AI智能体自动完成数据管理和数据流处理,以及用于安全的决策治理。· 到2028年,采用复合语义策略结合GraphRAG以降低推理成本的组织,将使其智能体AI的响应能力和可靠性提升50%。· 到2030年,超过50%的企业将利用一个融合数据、分析、治理和智能体功能的单一平台,推进其AI FIRST战略。 专家洞察AI FIRST企业由D&A平台、智能体和语义核心化赋能根据Gartner 2026年首席数据和分析官议程调查¹,越来越多的D&A领导者现在是“以AI为中心”而非“以技术为导向”。要获得一项明确利用AI的战略承诺,利用这种自我改进和自适应的技术做出更好的决策、采取行动并大规模创造新型价值。成本压力不会阻止AI,但在语义和工具孤岛上偷工减料会阻止AI价值的实现。您应从这些顶级趋势中获得的关键教训是:在2026年,在迈向AI FIRST企业的过程中,需要聚焦于这些主题。立即选择您的首要趋势,并使用演示材料、图表、预测、证据点、真实案例、建议和事实依据来展示远见和思想领导力。 行动概述“AI FIRST”是一种指导企业及其部门最大化AI收益的战略方法。AI FIRST企业是指整个组织承诺采用AI FIRST战略的企业,即在核心决策和投资中始终将AI与其他选项一并考虑,并在最合理的时候使用AI,以此最大化AI的收益。本研究的执行层面洞见是:2026年的D&A趋势由三大主题驱动: 智能体驱动的数据与分析、语义核心化和D&A平台化,如图1所示。 图1. 2026年数据与分析顶级趋势 智能体、语义和平台塑造了2026年AI FIRST企业的趋势,包括智能体驱动的数据管理、复合语义层和AI治理平台。这些主题的结合推动了上下文感知分析和稳健数据管理的进步。关于AI FIRST企业的更多详情,请参阅《AI FIRST解读:含义、重要性及行动时机》和《IT 2030:用AI重塑IT以实现长期成功》。 研究亮点智能化D&A来自:Ramke Ramakrishnan智能体驱动的数据与分析是一种AI FIRST的战略和运营模式,它推进AI智能体在D&A运营中的有效部署,并为其性能建立信任基础。企业采用智能体驱动的数据与分析,以便组织资源和AI无缝协作,适应并优化数据驱动的决策和结果。智能体驱动的数据与分析是构建真正AI FIRST企业的基础。通过部署AI智能体来管理完整的数据到行动的闭环(通过智能体数据管理),利用智能体数据流实现实时数据流动,并强制执行稳健的决策治理,组织可以实现灵活性、可扩展性和信任。智能体驱动的数据与分析涉及受治理的数据和分析端到端自动化。它将D&A的功能演变为对AI智能体比对人类更有用。它优先考虑机器消费,即AI赋能的非人类参与者访问服务并代表人类团队、客户或组织行事。参见《AI智能体采纳如何改变数据与分析战略和运营》。智能体驱动的数据与分析是优化数据到执行闭环的下一个浪潮。通过在资源稀缺的地方集成AI智能体,组织通过敏捷的D&A运营最大化业务价值。 智能化D&A赋能AI FIRST企业智能体驱动的数据与分析通过使用AI智能体驱动智能体数据管理和智能体数据流,并辅以稳健的决策治理,为AI FIRST企业奠定基础。将AI智能体集成到数据管理工作流程中,可以对整个数据生命周期进行自主和自适应监督。它还通过智能体数据流促进实时数据流动和响应能力,确保高速、近乎实时的数据无缝到达下游分析和AI系统。此外,由于应用了决策治理,每项决策仍然可解释、可问责、透明且合规。证据点:· 根据2025年Gartner软件工程AI调查²,对AI智能体的评估主要通过三个指标:任务执行质量、用户反馈和整体用户体验。· 根据2024年Gartner探索数据、分析与软件开发交集调查³,使用共享数据服务构建AI智能体的组织比不使用共享服务的组织使用了更多样化的技术组合,包括事件流(41%)和事件流处理(25%)。· 随着AI智能体承担更多的决策自动化,人类监督的必要性显而易见。基于2024年Gartner决策智能调查⁴,76%的IT和商业领袖已将决策监控和治理评为对其组织决策智能“始终重要”,这凸显了这一趋势是安全和可扩展的智能体驱动的数据与分析运营的必要保障。真实案例:· 智能体数据管理可自动化和强化关键功能,包括资源缩放、实时错误修正、元数据管理、数据隐私、工作流调整以及跨银行业与金融服务、医疗保健和制造业等。· 智能体数据流广泛应用于欺诈检测与风险管理、决策智能、数字孪生以及自动化工厂和物流。· 组织依赖决策治理来提高透明度,确保每个数据驱动决策的可问责性,并通过明确的所有权、血缘追踪和质量评分优先考虑高价值、低风险的AI项目⁵。新兴实践:AI工程AI工程是一门设计、开发、交付、运营和管理使用、部署和应用AI以提供商业价值的技术系统的学科。该学科统一了DataOps、MLOps、ModelOps和DevOps流水线,为基于AI的系统创建了一个连贯的开发、部署(混合、多云、边缘)和运营框架。这一新兴实践放大了智能体驱动的数据与分析与D&A平台化主题交汇的趋势。建议:· 通过智能体驱动的数据与分析进行创新,以实现长期愿景:通过智能体数据管理简化数据运营,通过智能体数据流加速实时洞察,通过决策治理降低GenAI风险。· 将AI智能体集成到现有的数据管理工作流程中,赋能数据管理团队变得自适应、自我学习,并提供可操作的建议。· 从业务驱动的延迟评估开始,明确需求。如果准实时数据则使用“微批处理”。将智能体数据流保留给真正需要毫秒级响应能力的场景,如欺诈预防或数字孪生。· 采用决策治理,创建决策的记录系统。确保AI增强的选择透明、可追溯且可问责。通过为AI智能体提供所需的受治理逻辑和护栏,在向智能体驱动的数据与分析迈进的过程中加强决策质量并降低GenAI风险。用智能体数据管理简化运营智能体数据管理指的是自适应、自学习的系统,利用AI驱动的自动化来优化和简化整个数据到影响闭环,这需要安全保障、控制和信任。它使组织能够加速关键数据管理流程,让数据运营团队专注于战略重点并推动更好的业务成果,使其成为当今数据管理的首要趋势。 语义核心化来自:Christopher Long语义核心化是一项战略原则,要求数据的上下文含义成为D&A运营模式的基石,确保跨平台建立标准化的语义定义和业务逻辑。这一基础确保了人类和AI智能体分析消费的成功。语义核心化通过建立标准化、上下文化的根基来连接碎片化的分析孤岛,从而赋能AI FIRST企业。这为AI智能体规模化并驱动最佳业务成果创造了可靠的结构。D&A领导者必须通过战略性地重新构想语义层为多层复合架构,并利用GraphRAG进一步对数据进行上下文化,来优化AI ready的D&A架构。语义核心化必须作为现代D&A运营模式的战略要务加以采纳,将语义从事后考虑转变为构建健壮、可互操作、可靠且可扩展的AI系统的关键基础。语义核心化赋能AI FIRST企业语义核心化通过将数据的上下文含义确立为D&A运营模式的核心要素,保证业务逻辑和标准化定义在所有平台上保持一致,从而赋能AI FIRST企业。这一原则是AI READY分析的战略优先级,因为可靠、可扩展的AI系统——特别是智能体AI和大语言模型(LLM)驱动的应用程序——需要经过治理和认证的上下文才能可靠且一致地工作。通过优先建立这一语义基础,组织为AI智能体提供了必要的根基,很可能大幅提升智能体AI的准确性和价值。此外,“语义核心化”原则旨在对抗目前阻碍AI FIRST企业能力部署的普遍语义碎片化和分析孤岛。通过规定指标一次定义、处处一致使用,语义核心化推动了复合语义层和语义互操作性标准等AI READY架构方案的采用。这使得AI智能体能够以编程方式跨分布式环境访问可移植、可信赖的指标,将碎片化数据转化为统一的、可信赖的数据,从而驱动可编程的AI FIRST企业。证据点:· 许多组织在多个平台上重复分析工作,通常是由于集成不足和缺乏分析交付规划。他们在指标层上也难以实现一致性。在这些碎片化的D&A架构中,企业无法充分利用AI智能体。根据2025年Gartner AI READY数据状态调查⁶,采用语义建模实践的组织更有可能在用于支持AI用例的数据工程实践中实现高效。· 企业AI应用要求高水平的准确性和可靠性。根据2023年data.world团队的生成式AI基准测试⁷,标准的检索增强生成(RAG)方法往往难以达到要求。这表明有必要探索GraphRAG等新兴趋势,因为它克服了标准RAG的这些局限性。真实案例:· 丰田汽车欧洲公司的“盒中自由”框架跨领域联合了语义开发和所有权,展示了实用的复合语义层。“盒中自由”计划允许业务领域独立创建自己的特定数据产品和分析模型(“自由”),而不是强制推行单一的通用标准。通过将这些分布式工件包裹在严格的治理和认证协议(“盒子”)中,丰田有效地协调了这些多样的语义对象,促进了整个架构的一致性和凝聚力⁸。· Microchip Technology的客服团队因无法直接访问订单或生产数据而面临延误,只能依赖工程和运营团队。为解决这一问题,他们构建了一个基于GraphRAG的聊天机器人和私有LLM,通过检索结构化的实时运营洞察来回答特定领域的问题,克服了传统RAG的局限。客服人员获得了对复杂数据的即时访问,而技术团队则从常规查询中解放出来⁹。 新兴实践:上下文工程上下文工程是一门在设计、管理和优化推理时提供给GenAI模型的信息的学科,以提高性能、准确性、相关性并优化成本。它代表了在AI应用程序工作流的每一步精确地用足够的相关信息填充LLM上下文窗口的艺术和科学。这一新兴实践放大了智能体驱动的数据与分析与语义核心化主题交汇的趋势。建议:· 以语义核心化为基础建立AI FIRST企业:采用可互操作的复合语义层,统一所有环境中的业务逻辑。利用GraphRAG处理更复杂的用例,将模型扎根于本体论上下文中,从而最小化AI偏见和幻觉。· 认识到实施复合语义层是一个复杂的集成和工程挑战,而非即插即用的解决方案。这不是一种免干预的集成;需要积极审计逻辑当前所在的位置——无论是在数据管理平台、语义层、SQL、代码还是分析和商业智能平台中。· 从内部数据的最小知识图谱开始,然后扩展并对比标准RAG对GraphRAG进行基准测试,以获得可衡量的增益和改进。使复合语义层可互操作复合语义层协调D&A架构中多样化的语义对象——如数据产品、知识图谱和BI模型。由于“单一通用层”往往难以定义,这种模式至关重要。它通过战略性地对齐工件来提高可重用性并减少重复。这种方法弥合了上下文差距,减少了数据孤岛,并在整个组织中强制执行一致的业务逻辑。D&A平台化来自:Robert ThanarajD&A平台化是一个技术合理化过程,用融合平台取代互不关联的单用途数据和分析工具,以简化架构、标准化运营,并减少跨团队和系统的技术交接。D&A平台化是迈向构建AI FIRST企业的战略步骤。它统一了碎片化的系统和技术,以获得持续优势。D&A领导者可以通过用融合平台取代零散的单用途工具,来精简架构并标准化交付流程。融合的数据、分析和AI平台简化了传统上拖慢D&A团队的复杂运营,使他们更容易更快地实现AI FIRST。D&A平台化赋能AI FIRST企业成为AI FIRST企业对于领先并赢得竞争至关重要。但由于互不关联技术的泛滥、组织碎片化和过于复杂的系统,大规模实现这一愿景充满挑战。为此,许多D&A供应商正在拓宽其产品组合,导致数据、分析、决策、治理和AI能力的大规模融合。融合平台消除了孤岛,简化了AI READY的D&A架构,并为组织提供了在全公司范围内扩展AI能力所需的集成基础。这一趋势意味着大多数企业将采用融合平台作为其智能体驱动的数据与分析战略和运营模式的关键组成部分。其中一些融合平台在以下Gartner研究中详述:· 《数据管理平台市场指南》· 《AI治理平台市场指南》· 《决策智能平台魔力象限》通过用统一平台取代零散的单用途工具,将关键能力和标准化流程整合在一起,D&A领导者可以精简架构,减少跨团队和系统的不必要技术交接。例如,一个团队可能用一种技术构建数据管道,另一个团队用不同的系统管理数据质量,还有一个团队用第三种工具创建分析报告。使用多个重叠的工具效率低下,而融合平台则帮助企业更快地实现AI FIRST。参见《预测2026:智能体数据管理对智能体AI成功不可或缺》。证据点:· 根据2024-2025年间Gartner客户互动中的证据,组织平均部署了十多种数据管理解决方案,却难以大规模实现AI目标。· 一半的首席数据和分析官认为优化技术格局是其首要职责¹。· 使用AI治理平台的组织在AI治理实践中实现高成效的可能性是不使用平台的三倍以上⁶。· 根据2025年Gartner云最终用户购买行为调查¹⁰,60%的受访组织预计会增加对区域解决方案的依赖。真实案例:· BDO¹¹、丰田⁸和WPP¹²等组织使用数据管理平台,通过市场将数据作为产品提供,通过自然语言查询简化数据访问,应用治理以确保质量和投资回报率,并支持RAG服务、GenAI应用和LLM集成。· AI治理平台用于缓解影子AI风险、强制执行运行时护栏,并确保针对全球AI法规(如欧盟AI法案、AI风险框架和NIST AI风险管理框架)的审计准备。· 各国正通过关税和贸易政策、对私营实体的投资、政府资金、针对性的监管/放松管制、行业倡议以及公私交易来加速主权AI。新兴实践:平台工程面向D&A的平台工程是一门设计、构建和扩展自助服务平台,为在整个组织中采用D&A实践提供有主见的、安全且治理良好的方式的学科。它旨在改善D&A开发者体验、加速D&A交付、最大化投资回报率并支持负责任的AI生命周期。这一新兴实践建立在围绕平台化和语义的关键趋势之上。更多信息请参见《实现平台工程成功的五项原则》。建议:· 平衡D&A平台化的压力:通过数据管理平台整合解决方案,通过AI治理平台建立信任,同时将D&A控制权交给最需要的团队。随着主权AI的不断出现,它可能根据具体的AI用例推动组织走向更多平台化或进一步分化。· 通过使用数据管理平台审查和合理化当前数据管理技术格局,消除冗余、未充分利用的技术。停止引入更多的数据管理点解决方案。· 优先采用AI治理平台以提高AI治理的有效性。严格评估供应商平台的能力,以选择满足当前和可预见AI治理需求的平台。· 通过现代化D&A路线规划和D&A平台化来应对主权AI带来的商业机会和未公开的威胁。这也将加速AI FIRST企业的举措,将AI用例从单纯利用推进到创造决定性优势。
近年以来,大模型、智能问答、智能体等AI应用快速发展,很多企业都在积极探索如何将AI能力融入业务场景。那么,在AI时代,数据治理和数据仓库如何顺应时代发展呢?过去二十年,企业围绕数据建设逐步形成了一套成熟的方法体系,形成了数据仓库(中台),通过BI和报表进行业务赋能。然而,在智能化时代,这些是远远不够的,现在的数据治理体系并不足以让AI真正理解企业业务。换句话说,不能被AI通过消耗Token方式消费的数据平台,是没有未来的。从管理数据到管理知识:企业语义探索之路企业在过去很多年里一直在探索如何让数据承载更多业务知识。最早,人们通过数据资产目录、元数据管理等方式,对数据进行分类、标注和管理,希望让数据更容易被发现和理解。近年来,随着大模型和生成式AI的发展,RAG(Retrieval-Augmented Generation)知识库成为热门方向。很多企业尝试将制度文档、业务手册、指标说明等内容导入知识库,希望AI能够通过检索增强的方式回答业务问题。与此同时,本体模型(Ontology)也受到越来越多关注,数语科技也推出了DOM本体系统,它通过定义概念、关系和规则,构建企业知识网络,为知识推理和智能分析提供基础。这些探索虽然路径不同,也各有优缺点,但本质上都在解决同一个问题:如何让企业知识能够被机器理解和使用。本文介绍另一种受到广泛关注的知识管理的方法,就是(逻辑)语义模型。什么是语义模型?语义模型(Semantic Model)并不是一个新概念,但是在AI时代变得更加重要。早在数据仓库和商业智能(BI)发展的过程中,人们就开始尝试在底层数据结构与业务应用之间建立一层统一的业务语义,用来解决不同系统、不同报表之间口径不一致、理解不一致的问题。随着企业数据规模不断扩大,以及云计算、数据中台和AI技术的发展,语义模型的价值被重新认识。近年来,国际上出现了OSI(Open Semantic Interchange)等开放语义理念,希望建立跨平台、跨系统共享的统一语义标准,让语义能够像数据一样被交换、共享和复用。从内容上看,语义模型主要用于统一描述企业的业务知识,包括业务实体、业务术语、指标口径、业务规则以及实体之间的关系等内容,并将这些定义沉淀为统一的语义资产。语义模型(Open Santic Model)开放语义模型(Open Semantic Model),简称OSM,是数语科技制定的企业级语义模型标准,并由其数据建模工具DDM提供设计、管理和落地支持。OSM借鉴了近年来国际上开放语义领域的发展成果,同时结合数语在数据模型和本体模型的数十年的积累,希望建立一种开放的本体化、标准化的语义描述方式,使企业能够将数据模型升级到业务语义模型,实现跨平台共享、跨系统复用以及面向AI的统一消费。本体化语义模型主要包含以下内容:指标与度量(Metrics):定义业务指标及其计算逻辑,以及与业务实体之间的关系。业务实体(Business Entities):定义业务口径中的实体。如客户、产品、订单、合同、设备、组织等核心业务实体。属性(Attributes):描述业务对象的关键属性及业务含义。关系(Relationships):定义对象之间的业务关系,如隶属、拥有、参与、依赖、影响等。映射(Mapping):定义业务实体与物理表(或视图)之间的映射关系,用来做数据查询引擎。业务规则(Business Rules):沉淀企业运营规则、约束条件和业务逻辑。在规范方面,本体化语义模型通常遵循国际知识表示与语义建模标准,包括:OSI(Open Semantic Intercharge, yaml) : 开放语义交互协议的yaml格式。RDF(Resource Description Framework):资源描述框架,用于统一表达实体及其关系。OWL(Web Ontology Language):用于构建企业本体模型和复杂业务规则。 《DDM中的语义模型》数语基于OSM,还提供通用数据查询系统,将企业统一语义层与自然语言交互能力深度融合,实现统一问数与数据探索分析。当前市场上不少方案采用Text2SQL、Text2DSL再转换为SQL等技术路线,虽然能够实现自然语言到查询语句的转换,但往往缺乏统一、完整的企业语义模型支撑,对业务概念、指标口径、规则关系和跨系统数据关联的理解能力有限,容易出现语义歧义、查询结果不一致以及复杂业务场景适配困难等问题。实践证明,无论采用哪个toSQL的路线,最后的瓶颈都是语义上下文的缺失。因此通过OSM实现的问数从准确率到开放性能力都要上一个台阶。《基于语义模型的数据查询系统》如何从数据模型走向语义模型对于很多国内企业来说,数据模型建设并不陌生。过去十多年,企业围绕数据资产建设,逐步形成了从业务系统到数据仓库、从数据标准到指标体系的完整方法论。尤其是在数据治理领域,很多企业已经建立了较为成熟的五级数据架构体系,通过概念模型、逻辑模型、物理模型以及数据标准等方式,实现了数据资产的规范化管理。这些建设成果并不会因为AI时代的到来而失去价值,企业过去积累的数据模型和治理成果,正在成为构建智能化能力最重要的基础。对于DDM而言,我们认为企业级语义模型建设可以分阶段推进。第一步,基于现有数据模型、数据标准和指标体系,建立统一的业务术语和语义定义;第二步,将业务实体、指标口径、业务规则等内容纳入统一管理,形成企业级语义资产库;第三步,通过开放标准实现语义共享与复用,支撑跨系统、跨平台的数据协同;第四步,将语义模型与AI应用结合,为智能问答、智能分析、智能体等场景提供统一知识底座;最终,逐步构建覆盖数据、语义和知识的企业级智能数据架构。从数据模型走向语义模型,并不是一次技术替换,而是一次数据资产价值的延伸。将过去建设的数据底座,升级为企业需要建设的知识底座。写在最后AI不会取代数据治理,也不会取代数据仓库。但AI的出现,正在重新定义它们的价值。从数据到语义,从资产到知识,这不仅是技术架构的演进方向,也是数据治理和数据仓库在AI时代最重要的发展方向。