4 月下旬,一年一度的 Google Cloud Next 大会在拉斯维加斯落幕,大会上多达 260 个公告密集发布,讲的最多的主题当然还是 AI,比如 Gemini 企业级 Agent 平台、全新的 TPU 8t/8i 计算基础架构等。但如果你仔细去回味这些主题,就会发现谷歌这一年的发力点都在这样一件事上:如何让数据能真正被 AI 用起来。

过去十年数据基础设施的构建主要围绕数据管道展开,经过 ETL 的流转加工,最后才能利用这些数据完成有价值的任务。而这一次,谷歌正倾向于一种不同的数据处理方式,这种方式更加侧重于直接访问、统一平台以及由 AI 驱动执行,这就是本届大会上的一个重磅主题 Agentic Data Cloud(智能体数据云)

先搞懂谷歌在解决什么问题

过去的数据平台是以人为中心来构建的,面向的用户群体是数据科学家、数据库工程师和分析师,他们利用数据平台得出的分析数据进行企业决策。而随着 AI 技术的发展,具备自主推理和行动的 AI Agent 应用将会成为数据平台的主要用户。

数据平台为人类服务的时候,整个节奏是按天、按周来的;但 AI Agent 不一样,它需要秒级访问数据。而且人类对于数据可以有自己的解读,但 Agent 并不理解数据的含义,“利润率”这个在你们公司具体怎么计算,“活跃用户”的统计口径是什么,这些信息都需要有统一的口径告诉 AI。

谷歌的数据平台负责人 Gutmans 说,“我们正在从所谓的智能系统向行动系统转变。”数据不只是用来分析的,而是要让 Agent 能基于它直接产生行动。

三大件,拼成一个 Agentic Data Cloud

第一件:跨云湖仓(Cross-Cloud Lakehouse)

这是本次大会最务实的一个发布。

谷歌推出了基于 Apache Iceberg 标准的跨云湖仓,BigQuery 可以直接查询存储在 AWS 或 Azure 上的数据,同时还支持和 Databricks、Snowflake、AWS Glue 的目录联邦。强大的异构支持能力,让用户不必为了用谷歌的 AI 能力而进行数据迁移。

具体实现上,BigQuery 通过谷歌的跨云专用网络直接查询存放在 Amazon S3 上的 Iceberg 表,性能和 AWS 原生方案相当。

这个策略很好的解决了企业的顾虑,“如果我的数据不在你这里,还能不能用你的 AI?”谷歌的答案是,可以,不用迁移。

第二件:知识目录(Knowledge Catalog)

这是整个数据战略里技术含量最高、也最容易被忽视的一块。Knowledge Catalog 会自动从 BigQuery、AlloyDB、Spanner、Cloud SQL 等系统抓取技术元数据,同时支持接入 Collibra、Atlan、SAP、Salesforce 等第三方系统。

但光收集数据还不够,传统数据目录的问题是,得有专门的数据治理团队手工打标签、写业务描述,这是一个很费时费力的事,覆盖率永远跟不上数据的增长速度。

谷歌 Knowledge Catalog 用智能体来自动完成这件事。通过分析查询日志,自动推断业务逻辑、生成语义标签,不需要人工介入。这意味着它能覆盖整个数据资产,而不只是数据治理团队来得及维护的那一小部分。

简单来说,知识目录给整个企业的数据资产建立“语义索引”,让 Agent 不仅知道数据在哪,还知道数据所代表的意义。

第三件:Data Agent Kit + 数据库 MCP

谷歌这次还推出了数据库的 Managed Remote MCP Server,让 AI 模型可以直接连接到运营数据,省去了自己搭建 MCP 服务器的麻烦。同时发布了 Data Agent Kit,支持在 VS Code、Gemini CLI、Claude Code 等开发环境里直接使用,数据工程师可以用自然语言描述目标,工具包会决定用哪个引擎来执行相应的语句。

相信大家也看出来了,数据工程师的角色正在发生变化:从写 Pipeline 编写流程,变成了审核 Agent 的输出。

数据库产品的更新

数据库产品线这次也集中发布了一批新产品,其中两个值得关注:Spanner Omni 和 Spanner Columnar Engine。前者把 Spanner 做成了可下载的版本,支持部署在用户自己的数据中心;后者通过矢量化执行将实时运营数据的分析查询加速至 200 倍,而不会影响生产事务的工作负载。

AlloyDB 方面,新增了与 BigQuery 的 Lakehouse 联邦,用户可以直接在 AlloyDB 的 SQL 界面里查询 BigQuery 和 Iceberg 表,还支持一键 Reverse ETL,把分析结果推回 AlloyDB,不需要额外创建数据链路。

这些新特性的推出,进一步模糊了在线交易和分析查询之间的边界,数据库朝着 HTAP 的方向继续演进。

写在最后

纵观整个 Google Cloud 大会,Gemini 企业代理平台为 AI 代理提供了完整的操作系统,用于在整个企业中构建、扩展、管理和优化 AI 代理;而第八代 TPU 的推出,则大幅降低了推理成本,只有成本足够低的情况下,AI Agent 的经济性才能发挥作用。

但是很明显,谷歌的目标并不是争夺大模型的高地,那是 OpenAI 和 Anthropic 的战场;也并没有想在基础算力层和英伟达竞争,真正的战略是争夺数据基础设施的位置。谁能让企业数据更容易被 AI 消费,谁就能在 Agent 时代拿到更多的份额。

当然,这次大会上 260 个 Announce 中还有不少在 Preview 状态,能不能真正在复杂的企业环境里跑通,还需要时间验证。但未来的方向已经也明确:数据架构的重心,正在从“给人用”切换到“给 Agent 用”。这是基础设施架构的全面重构,朋友们,你们准备好了吗?

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐