当 Agent 开始“吃数据”,传统湖仓不够用了:华为云重做 AI 时代数据基础设施
过去数据平台主要服务人、BI 系统和传统应用,如今,模型与 Agent 正在成为新的数据消费者。而数据消费主体的变化,也在反向推动企业数据基础设施从传统湖仓向多模态湖仓、AI 数据湖和数据智能体演进。
华为混合云总裁顾雪军在 2026 中国国际大数据产业博览会上表示,Agentic 智能体时代,数据不仅用于传统分析,还将直接参与模型训练、推理和 Agent 执行。企业原本分散在云、数据中心、生产线和办公系统中的数据,如果无法统一接入和使用,Agent 就很难真正进入核心业务流程。
为此,华为云提出基于“混合云+Data+AI”和华为云 Stack 构建 AI-Ready 数据平台,并将整个数据链路划分为可靠管数、高效供数、智能用数和可信流通四个环节。
AI 能不能持续、稳定地“吃到数据”?
相比传统数据平台,AI 场景对数据供给提出了更高要求。
一方面,模型训练需要持续获取大规模数据;另一方面,Agent 推理过程中又需要低延迟访问企业内部数据、知识和业务状态。因此,传统以结构化数据和离线分析为中心的数据湖仓,在数据类型、供给速度和实时性上都面临新的压力。
华为云 AI DataLake 多模智能数据湖针对模型训练和 Agent 推理两类场景,对数据供给链路进行调整,重点解决传统方案中供数速度慢、数据规模受限、精度不足以及不同 AI 任务适配能力不足等问题。
与此同时,数据的类型也开始从传统 IT 数据扩展到更多企业生产数据。华为云 DataArts 目前可以统一接入 IT 系统数据、OT 生产数据、ET 工程数据和 KT 企业知识,并内置 40 多种数据处理算子,同时支持自演进本体构建和高性能计算。其核心思路是减少数据搬移,让企业不同系统中的数据能够直接参与数据处理和智能决策。
从技术路径上看,企业数据的用途正在从传统“Data”进一步向“Logic”和“Action”延伸:数据不再只用于生成报表和分析结果,而是成为模型理解业务、形成判断并驱动 Agent 执行动作的输入。
当数据只在企业内部使用时,核心问题更多是治理和效率;但当多个组织、模型和 Agent 需要协同使用数据后,数据主权、身份认证和操作留痕成为新的基础设施问题。
华为云通过构建数据可信流通环境,来解决三个问题:数据由谁控制、参与数据使用的主体是否可信,以及整个数据操作过程能否被验证。据悉,相关能力已经用于上海城市数据空间、南通家纺行业数据空间和云南交投等项目。
这类可信数据空间可以在不完全脱离原有控制范围的情况下参与跨组织计算和业务协作。对于拥有大量行业数据、生产数据和企业 Know-how 的机构而言,这也成为其将内部数据提供给 AI 使用的一种基础架构。
在企业完成数据治理之后,并不意味着现有数据可以直接用于模型,高质量数据集正在成为数据治理与 AI 应用之间的中间层。
这种情况下,徐工集团自 2023 年启动“智改数转网联”战略转型,通过“1+4+2”框架和四大工程,将数据逐步接入产品、制造和运营环节。其数据治理目标也从传统的“统一管理数据”,进一步转向为智能化应用建立数据基础。广东电网则围绕模型可用数据构建“壹万万”多维标签体系,通过“预标注+人工精标+多维标签”的方式形成训练和业务使用所需的数据。在客服场景中,智能推荐标准话术日调用超过 2 万宗次,准确率达到 98%。
相对传统数据治理更关注数据完整性、标准化和可查询,AI 数据则进一步要求数据具备明确语义、标签和任务适配能力。
Token 开始成为新的数据价值出口
数据基础设施的另一个变化,是价值出口从传统报表、API 和数据产品进一步延伸到模型调用和 Token。
比如,长三角数链目前构建了以“区块链+隐私计算”为核心的“1+1+1+X”架构,已接入 232 个机构,覆盖 140 个应用场景,区块链使用量达到 43 亿笔,并打通 9 省 40 市物流节点。
贵州数据宝 CEO 周林在会上提出,“数据的终点不是报表,而是 Token”。数据宝目前基于 50 多个部委厅局数据源和 1800 多个数据产品,构建“数据+算力+Token”平台,其 TopenRouter 独立 Token 交易平台日均调用量超过千亿级。
可以看出,数据价值链因此从过去的“采集—治理—分析—报表”,开始向“采集—治理—模型—Agent—业务动作”迁移。
大会期间,贵州省公共数据资源“一个湖”项目联合创新启动,同时发布“数据要素场景联合创新行动”,国泰新点、四方伟业、贵州数据宝、华傲数据、星尘纪元、数鑫科技、永洪科技、数语科技、普元信息等企业参与。
华为云此前还与贵州大数据集团建设省级公共数据“一个湖”,并发布 AI 可信数据空间相关成果。这些项目背后的技术方向较为一致:企业和政府的数据不会因为 AI 出现就全部迁移到单一云平台。大量核心业务数据仍然存在于本地数据中心、生产系统和行业专网中,因此 AI 基础设施需要同时处理本地数据保护与模型能力接入的问题。
华为云 Stack 的混合云架构,其思路是连接分布在云、数据中心和生产现场的数据,在既有安全边界内向模型训练、Agent 运行和智能决策提供数据。
随着 Agent 持续进入业务系统,数据本身还会形成新的循环:企业原有业务数据进入 AI 数据湖,用于模型和 Agent;Agent 在执行过程中又会产生新的交互数据、业务结果和决策经验,这些数据重新沉淀到企业数据体系中,并继续参与后续模型和 Agent 优化。
从传统湖仓到多模态 AI 数据湖,再到连接业务系统的数据智能体,正在成为 AI 进入行业之后,数据平台演进的一条新路径。