这是一场关于"什么才真正撑起AI算力"的对话。嘉宾Amin Vahdat是Google的AI基础设施首席技术专家,去年底刚被任命统领这个体系。采访由红杉资本的Sonya Huang主持,播出于2026年10月。
对话发生在一个特殊的节点:Google今年的资本支出预计超过2000亿美元,大部分投向数据中心建设,这是人类历史上规模最大的一次基础设施投资。Vahdat站在这场建设的最前线,他给出的答案很具体——当集群规模冲到十万块加速器,衡量一套系统好不好用,早就不能只看芯片的理论算力了。
1. 一个存储机架10千瓦,一个AI机架却要几百千瓦
AI数据中心和普通数据中心的外壳几乎一样:混凝土、电气间、机械间、冷却系统、一排排配电设备、庞大的网络和存储基础设施。Vahdat说,真正的区别在于"专用化"的程度。
传统数据中心是一笔20到30年的长期投资,建筑要撑得住好几代硬件的更替——服务器、存储、网络,可能还有一些加速器,但硬件寿命通常只有六年左右,所以要为很多代硬件留出空间。AI数据中心则相反,建筑本身常常是跟着特定硬件一起设计出来的。
原因是功率密度差太多了:一个存储机架大概是10到40千瓦,放在同一排的TPU或GPU机架轻松就是几百千瓦,未来几年可能更高。网络也是同样的逻辑,一个存储机架需要的带宽——尤其是用硬盘的情况下——跟一个AI机架相比几乎可以忽略。想让整栋楼里什么硬件都能随便换着放、几十年都通用,结果往往是建得太大、太冗余。Vahdat的判断是,AI数据中心会越来越专用,连冷却和配电都要跟着硬件一起协同设计。
2. 一张机柜照片,意外成了全网最受欢迎的帖子
Google给红杉资本投资的公司Ineffable Intelligence交付了一套大型Vera Rubin集群,Sonya Huang提到自己看到交付照片时的感受——像在看人类历史上最伟大的建筑工程之一。Vahdat也认同,说那是"美的化身",哪怕只是几排机柜。
真正让人意外的是,Google把这张照片发到社交媒体后,引爆关注的不只是"Ineffable拿到了一套顶级集群"这件事本身,更多人是单纯被照片里光纤布线那种近乎分形的结构美感打动。Vahdat说,这是Google有史以来反馈最热烈的帖子之一。
3. FLOPS只是理论上限,Google真正在意的是goodput
无论是FLOPS还是其他芯片层面的指标,本质上都是理论值——在某些理想条件下,一块芯片能跑出的算力上限。Vahdat的态度很直接:这些数字很少真正决定一个工作负载的实际表现。真正重要的是算力利用率,也就是对某个具体任务来说,理论峰值里到底有多少被实际用上了。
这就引出了Vahdat口中的"goodput"这个概念:吞吐量衡量的是你理论上能跑出多少工作量,但goodput扣掉了因为故障、重算、等待恢复而浪费掉的那部分,衡量的是你真正把答案送到手里花了多长时间。他举了一个类比——解一道题分四步,如果因为中间出错要退回第一步重来,你确实还在"工作",这算吞吐量,但这不是goodput,goodput看的是你解出答案总共花掉的时间,包括所有因故障浪费的时间。
训练、服务、还有长程agent工作负载大多是同步的,成百上千甚至十万个组件要在微秒或毫秒级别彼此协调。只要有一个节点失败,整个任务就可能被拖住——所有组件都在等着彼此完成自己那部分工作,才能凑出最终答案。一旦出故障,还要定位哪个节点出了问题,找到此前某个时间点的检查点,再重启,最坏情况甚至要从头开始。Vahdat说,Google对自己的要求是看实际交付的goodput,而不是理论上的基准吞吐量或者"理论上应该很好"这种说法。
4. 十万块芯片的规模下,故障是家常便饭
goodput这个词目前是Google内部用语,但Vahdat说行业里已经越来越多人开始采用。十万块加速器规模下故障有多频繁?他给出的判断是:这个规模下,故障大概率每天会发生多次,具体配置下甚至可能每小时就有一次。
每一块芯片都站在制造工艺的最前沿,而且早已不是单颗芯片这么简单——很多情况下是由两颗、四颗、八颗甚至更多chiplet组合而成的封装,外面还挂着HBM、网络连接、甚至封装内光学互连。会出故障的环节非常多,而当你把十万块这样的硬件堆在一起,总会有什么东西出问题。
问题不在于某一类固定的故障原因,而是没有单一的主因。如果真有一个常见的故障原因,Google早就该把它解决了。每次推出新产品,总会冒出新的坑:有时是网络问题,比如这些硬件之间如何以超高速互联;有时是硬件本身的问题;但很大一部分问题出在软件层——编译器的bug、运行时的bug、模型本身的问题,或者操作系统层面的问题。哪怕硬件做到完全可靠,这些软件层面的问题照样会拖累整个系统的实际表现。
这场对话里,Vahdat反复强调的其实是同一件事:在一场动辄两千亿美元的基础设施竞赛里,衡量成败的标准不是账面上堆出来的算力数字,而是十万块芯片在真实故障环境下,到底能把多少工作量变成答案。这正是Google在这场史上最大规模的资本支出竞赛中,给自己设下的那道及格线。
