谷歌数据中心团队正在加速将其基础设施打造为专为 AI 和智能体浪潮服务的高效平台。在今年的 Google I/O 大会上,CEO 桑达尔·皮查伊公布了一组惊人数据:谷歌数据中心每月处理约 3.2 千万亿 Token,约为 2025 年 5 月所处理 480 万亿 Token 的七倍之多。

"多个智能体协同工作,全球数百万乃至数十亿用户都可能随时启动智能体来帮助他们处理事务。"谷歌 AI 与计算基础设施副总裁兼总经理马克·洛迈耶如此表示。

谷歌全新的数据中心架构蓝图涵盖了硬件、软件和编排层面的全面升级,旨在保障持续运行的智能体稳定运转。

在大语言模型时代,用户发出提示词并接收响应,谷歌的基础设施主要围绕延迟和吞吐量进行优化。但洛迈耶指出,智能体可能将推理事务量提升至非智能体工作负载的 100 倍。谷歌重新设计的 AI 数据中心技术栈具备足够的弹性,支持智能体广泛分布式部署、长期持续运行并独立作出决策。

"我们每年都会推出新平台,每一代都针对我们所预判的智能体时代需求进行专项优化。"洛迈耶说。

高效的数据流至关重要,它能让智能体更快地行动、推理和决策。

谷歌将 Google Kubernetes Engine 改造为原生智能体环境,支持在沙盒和容器中快速启动智能体。"从基础设施角度来看,你需要快速启动大量 TPU 或 GPU,然后在完成任务后迅速将其释放。"洛迈耶说。

谷歌还在芯片层面进行了大幅改进,以支撑中间件的升级变化。公司近期推出了全新 AI 芯片,其中 TPU-8t 面向训练场景,TPU-8i 面向推理场景。8t 芯片的算力是上一代 Ironwood 芯片的三倍;8i 芯片配备 384MB SRAM 和 288GB HBM3e 内存,比上一代芯片提升了 50%。

该平台针对 KV 缓存(键值缓存)进行了专项优化。KV 缓存用于存储智能体决策所需的重要上下文信息,可有效减少对其他内存和存储系统的访问次数。"能够在芯片上直接存储更多 KV 缓存,就能更快速、更经济地做出响应。"洛迈耶说。

一款名为 Axion N4A 的新型 CPU 在智能体编排和工具调用等工作负载上具备更高的能效表现。

谷歌还在网络和存储方面进行了多项改进,以缩短训练和推理时间。一项名为 TPUDirect 的新技术可绕过编排层开销,将数据从存储直接快速传输至 TPU 内存。

一项名为 Virgo 的网络技术能够在广域分布式网络中协调多达 100 万个 TPU,同时还可连接英伟达最新 CPU-GPU 组合产品 Vera Rubin 等 GPU。"以 Vera Rubin 为例,借助 Virgo,我们最多可连接 96 万个 GPU。"洛迈耶说。

一项名为 Pathways 的新技术是一套分布式训练框架,可在数百万 TPU 和 GPU 上高效扩展机器学习任务。Pathways 解决了 JAX 通常存在的瓶颈问题,两者协同工作,共同协调广域网络中的资源调度。

"用于协调大规模分布式训练任务的软件,与其运行其上的硬件同等重要。"洛迈耶说。

J. Gold Associates 首席分析师杰克·戈尔德指出,谷歌是目前唯一一家同时自主掌控数据中心、软件、硬件和模型的服务商。谷歌可以定期对每一层进行协同优化,而"鉴于新芯片成本高昂,许多数据中心难以轻松做到这一点"。

不过,与英伟达的通用 GPU、CPU 和网络方案相比,谷歌的技术栈并非适合所有数据中心场景。AWS 和微软也在研发各自的定制芯片。

"谷歌大规模取代英伟达的风险几乎不存在,但随着市场不断扩大,各方都有充足的发展空间。"戈尔德说。

Kyndryl 全球 AI 战略与主权转型合伙人洛根·沃尔夫则建议企业采用多云策略,以降低系统故障风险,无论某一基础设施有多出色。"混合式、流动式基础设施的时代,我们正在稳步迈进。"沃尔夫说。

每个 Token 的成本因推理服务提供商而异,无论是微软、谷歌、OpenAI 还是 Anthropic。随着 AI 从实验阶段演进为推动业务变革的核心工具,这一成本差异将日益凸显。

"归根结底,关键在于我们投入多少 AI 成本,才能推动特定业务目标的实现。"沃尔夫说。

Q&A

Q1:谷歌每月处理多少 Token?

A:根据 Google I/O 大会上公布的数据,谷歌数据中心每月处理约 3.2 千万亿 Token,约为 2025 年 5 月所处理 480 万亿 Token 的七倍。这一数字体现了智能体时代推理需求的爆炸式增长。

Q2:谷歌新推出的 TPU-8t 和 TPU-8i 芯片有什么区别?

A:TPU-8t 面向训练场景,算力是上一代 Ironwood 芯片的三倍;TPU-8i 面向推理场景,配备 384MB SRAM 和 288GB HBM3e 内存,内存容量比上一代提升 50%,并针对 KV 缓存进行了专项优化,可大幅提升智能体的响应速度和成本效率。

Q3:Virgo 网络技术能连接多少 GPU?

A:Virgo 是谷歌推出的新型网络技术,能够在广域分布式网络中协调多达 100 万个 TPU。在连接英伟达最新 CPU-GPU 组合产品 Vera Rubin 的情况下,Virgo 最多可支持 96 万个 GPU 的互联协作。

Networkworld