2025年9月底,科技播客20VC主持人Harry Stebbings与Groq创始人Jonathan Ross进行了一场近90分钟的对话。三个月后的圣诞前夜,英伟达以200亿美元购买Groq资产(官方准确表达为:并非收购 Groq,英伟达只是获得了 Groq 知识产权的非独家授权,并从 Groq 团队中聘请了工程人才加入),Ross本人将加入英伟达。

这个时间点让这期播客有了特殊的意义。Ross在对话中反复强调"我们不会做模型",也坦承"我们可能被客户吞并"。他详细解释了为什么自建芯片几乎注定失败,为什么英伟达的护城河不在CUDA而在HBM供应链,以及为什么Groq的6个月交付周期是真正的差异化。当被问到英伟达5年后是否值10万亿美元时,他说"如果不值,我会很惊讶"。紧接着Harry问Groq是否也能值10万亿,他的回答是"possible"。现在看起来,变成合体冲向10万亿了。

当然,Ross的背景让这些判断有足够分量。他曾在Google领导开发TPU(Tensor Processing Unit,张量处理单元),是现代AI硬件的核心架构师之一。Groq在9月刚以69亿美元估值完成7.5亿美元融资,投资方包括BlackRock、三星、思科等。三个月后被英伟达以近三倍溢价收购,交易来得很快——据报道Groq当时并没有寻求出售。

对了,访谈中,他也谈到了关于全球AI算力格局的问题。他认为中国的推理成本其实比美国更高,现在token便宜是定价策略;他也认为欧洲其实不缺电力基础,而是策略限制导致。而如果欧洲不做任何调整,以后就是一个旅游经济地区了。在AI时代,没有未来。

1. "如果Anthropic算力翻倍,一个月内收入几乎翻倍"

Ross开场就抛出一个判断:当前AI公司最大的瓶颈不是模型,是算力。

"OpenAI和Anthropic最大的抱怨是什么?Rate limits(速率限制)。用户拿不到足够的tokens。如果他们有更多算力,就能产出更多tokens,就能收更多钱。"

这个判断的逻辑链很直接:算力→tokens→收入。他说的不是"可能增加",而是"几乎翻倍"。

Harry追问:能解释一下吗?怎么会翻倍?

Ross的回答是:算力决定了你能服务多少用户、服务到什么质量。OpenAI用什么方式调节聊天服务?跑得慢一点,engagement(用户参与度)就下降。这就是本周OpenAI宣布推出限量高价产品的原因——他们想看看当投入更多算力时,产品会变成什么样、能好多少。

"AI和SaaS完全不同。SaaS产品质量由工程师决定。AI不一样,我可以跑两个实例然后选更好的答案,我可以给高价值客户更多算力让结果更好。我能直接用钱买到更好的产品质量。"

2. 速度的多巴胺经济学

很多人觉得AI响应速度够用就行,等几秒钟无所谓。Ross说这个判断100% wrong(完全错误)。

他用消费品行业做类比。按利润率排序:最高的是烟草,其次是嚼烟,再是软饮料,往下是水和其他产品。决定利润率的核心变量是什么?

"成分作用于人体的速度。多巴胺循环越快,品牌黏性越强。"

他引用了一个数据:"每100毫秒的加速,带来约8%的转化率提升。"这是Google和Facebook早年就验证过的规律。这也是Google一直强调速度的原因。

Ross说Groq刚开始做速度优化时,有人看了演示视频问:为什么需要比你阅读速度还快?他反问:为什么网页加载需要比你阅读速度还快?

"人们很不擅长判断什么真正影响engagement和outcome。但我们从早期互联网公司的建设中学到了这一点。"

3. 为什么超大厂像"醉酒水手"一样花钱

Harry问:现在AI是不是泡沫?

Ross说,如果一个问题你反复问却得不到答案,也许应该换个问题。与其问"有没有泡沫",不如问"聪明钱在做什么"。

Google在做什么?微软在做什么?亚马逊在做什么?一些国家在做什么?他们都在加倍投入AI。每次宣布投资额,下一次都会更高。

他讲了一个例子:微软有一个季度部署了大量GPU,然后宣布不会把它们放到Azure上出租,因为自己用比租出去赚更多钱。

"市场里有真金白银。"

Ross在阿布扎比参加高盛峰会时,问了在场所有人一个问题——这些人都是管理100亿美元以上资产的基金经理。

"你们有谁100%确信10年后AI做不了你们的工作?"

没有人举手。

"这就是hyperscalers(超大规模厂商)的感受。他们当然要像醉酒水手一样花钱(spending like drunken sailors),因为另一个选择是被完全踢出局。这不是纯经济框架,是'我还能不能保住领导地位'的问题。"

他补充说,要留在Mag 7(科技七巨头)里,你必须持续投入。股价维持在高位,部分原因就是因为你在前七名里。这是一个自我强化的循环。

4. 自建芯片:不是硬件难,是软件更难,跟上趋势最难

Harry问:OpenAI会不会自建芯片、垂直整合?英伟达难道不担心吗?

Ross的回答充满工程师的冷静。

"如果我今天创业,不会做芯片。船已经开走了(that ship has already sailed)。"

从芯片设计到投产,执行完美的情况下最快三年。英伟达通常需要3-4年,只是多条产品线并行。

更残酷的数据:首次流片(tape out)成功率只有14%。也就是说,86%的概率你需要重新来过。

"我们做V2芯片时,已经预约好了respin(重新流片)的时间。结果第一次就成功了,我们自己都震惊了。你不应该期待这个。"

Ross说大家都以为造芯片最难的是硬件。做过才知道,软件更难。再做下去才发现,跟上市场演进方向才是最难的。

"如果你是incumbent(在位者),提前两年规划没问题,因为大家都在为你的硬件设计模型。但如果你是newcomer(新进入者),没人会为你还没出来的芯片设计模型。你必须有更快的迭代循环。"

Groq做到了一年一代芯片。V2之后一年是V3,再一年是V4。

他提到了Sarah Hooker的论文《Hardware Lottery》(硬件彩票)。核心观点是:人们为现有硬件设计模型。可能存在比attention更好的架构,但attention在GPU上跑得好,所以它成了标准。

"如果你是incumbent,你有优势,因为大家都在为你的硬件设计。这是一个闭环。"

Ross讲了一个Google的故事。当时AMD还在挣扎(后来做得很好),Google建了10000台AMD服务器。他去参观实验室,看到工程师把服务器从机架上拉出来,把AMD芯片拔下来,扔进垃圾桶。

"有意思的是,大家都知道那一代Intel会赢。那Google为什么要建10000台AMD服务器?因为他们想在Intel那里拿到更好的折扣。当你到了那个规模,设计自己的主板、建造测试这些服务器的成本,比起你能拿到的折扣,完全值得。"

所以,自建芯片的动机不一定是真的要用那个芯片。

5. 英伟达的真正护城河:不是CUDA,是HBM

很多人以为CUDA(英伟达的软件生态)是护城河。Ross说这只对训练成立,对推理不成立。

"我们现在有220万开发者注册了。"Harry问英伟达CUDA有多少,Ross说他们宣称600万。

真正的护城河在供应链,具体来说是HBM(High Bandwidth Memory,高带宽内存)。

Ross解释了一个概念:monopsony(买方垄断)。Monopoly是卖方垄断,monopsony是反过来的——你是唯一的大买家,所以你控制供给。

"英伟达的GPU本身用的工艺和手机芯片一样。如果他们想,一年可以造5000万颗GPU die。但今年大概只造550万颗。为什么?因为HBM产能有限,interposer(中介层)产能有限。"

当一家hyperscaler对英伟达说"给我100万颗GPU",英伟达说"抱歉,还有其他客户"。hyperscaler说"没关系,我自己造"。然后英伟达神奇地就找到了货给这家hyperscaler。

"自建芯片真正给你的不是芯片本身。是掌控自己命运的能力。英伟达没法告诉你配额是多少。"

自建芯片可能更贵,因为不会像英伟达那么好。但Ross解释了为什么这点差距在系统总成本里可能微不足道:

"如果芯片只占系统总成本的20%,芯片性能提升20%,整个系统价值提升20%,但芯片成本只增加20%的20%——也就是4%。小的性能优势带来巨大的价值差异。这就是为什么英伟达即使只比AMD好一点点,也能主导市场。"

HBM供应商也有自己的算计。HBM利润率极高,他们不愿增加产能,因为供给增加利润率就会下降。同时产能建设需要提前2年以上下单付款。即使有英伟达的现金流,也很难押注那么远的需求曲线。

6. Groq的差异化:6个月 vs 2年

这可能是整期访谈最关键的差异化陈述。

"你给英伟达下单,要提前两年付款才能拿到货。给我们下单100万颗LPU,6个月后第一批就开始交货。"

Ross说他跟一家hyperscaler的基础设施负责人开会,讲了速度、成本等各种优势,对方都没太在意。但当他提到6个月供应链时,"对方直接暂停了对话,只想深挖这一点。这是他唯一关心的事。"

为什么会有这个差异?

Groq的LPU架构不依赖HBM,使用的是片上SRAM(静态随机存取存储器)。这是大家最常问的问题:SRAM不是比DRAM贵吗?

Ross解释:SRAM每bit大约比DRAM贵3-4倍(因为需要6-8个晶体管,DRAM只需要1个晶体管加1个电容)。而且SRAM部署在更先进的制程上(比如3纳米),每单位面积成本更高。综合下来可能贵10倍。

"但这是芯片视角。我们用系统视角看。"

当Groq跑一个像Kimi这样的模型时,他们用4000颗芯片。GPU跑同样的模型可能只用8颗。但这意味着GPU那边有500份模型拷贝,用了500倍的内存容量。

"即使SRAM每bit贵10倍,他们用了500倍的内存量。系统总成本算下来,我们反而更便宜。"

Ross说他们现在是从全球视角看问题。Groq有13个数据中心,分布在美国、加拿大、欧洲、中东。他们会根据不同地区的需求,在不同数据中心部署不同模型的不同编译优化版本。

"我们在世界级别做负载均衡,不只是数据中心级别。"

他讲了一个两周前的真实案例:"有客户来找我们,要5倍于我们全部产能的算力。他们从任何一家hyperscaler都拿不到,从任何人那里都拿不到。我们也给不了。没有人能给。"

市场不是"有没有需求"的问题,是"产能根本不够"的问题。

7. 中美AI路径差异:训练成本与推理成本的取舍

Ross在访谈中谈到了中美AI发展路径的差异,有一个判断值得关注。

DeepSeek等国产模型发布时,业界关注的焦点是训练成本的突破。但Ross认为这背后是不同的优化方向选择。

他的判断是:中国模型的运行成本大约是美国模型的10倍。

"中国模型优化的是训练成本,美国模型优化的是推理成本。"

为什么API价格反而更低?Ross认为是定价策略的差异,不能把价格和成本混为一谈。当你是某个特定模型的唯一提供者时,你在captive market(封闭市场)里可以灵活定价。

训练是一次性投入,要摊销到每次推理上。如果推理量巨大、算力充裕,降低单次推理成本的收益更高;如果算力受限,先把训练效率做到极致、让模型跑起来更务实。

所以,他的思路是,由于芯片获取受限,中国团队在有限算力下把训练效率做到了极致。这是约束条件下的理性选择。

Ross还提到中国正在建设大量核电站,从能源侧为AI算力做长期准备。当能源不再是瓶颈,算力约束的逻辑会发生变化。

不同的起点和约束条件,催生了不同的技术路径。至于Ross关于运行成本的判断是否准确,国内厂商或许有不同的数据。

8. 欧洲的困境:两种风险的选择

Ross对欧洲的诊断非常直接:问题不是资源,是恐惧。

他说了一个让Harry惊讶的判断:"美国比欧洲更risk averse(风险厌恶)。"

但他马上解释:风险有两种。一种是commission(犯错的风险),做了某事结果是错的。另一种是omission(错过的风险),没做某事结果错过了机会。

"美国害怕的是omission。在高增长经济体里,错过比犯错代价更大。欧洲害怕的是commission。"

他说欧洲试图通过立法竞争——数据本地化、隐私保护。但这解决的是"别人控制我"的风险,解决不了"我没有足够算力"的问题。

"如果欧洲想竞争AI,挪威可以部署大量风力发电。挪威风力利用率80%,配合水电,仅这一个国家就能提供相当于整个美国的电力。"

他说欧洲还有大量潜在能源没有开发。沙特阿拉伯在建设数据中心,有gigawatts级别的电力。欧洲为什么不和沙特合作,利用他们的"data embassy"(数据大使馆)概念——主权监管下使用对方的能源?

关于核能,Ross说他在欧洲不提这个,"因为大家会pushback"。但日本正在重启核电站。他提到一个数据:"在美国建核电站,许可证费用是电站本身的3倍。"欧洲可能更糟。

法国知道怎么建核电站,韩国也知道(阿联酋的核电站就是韩国建的)。Ross建议来一个能源领域的曼哈顿计划。

Harry问:如果欧洲不行动会怎样?

"那么欧洲经济就会变成旅游经济。人们来看古老建筑,仅此而已。你没法在新经济中竞争,如果你没有新经济所依赖的资源。新经济是AI,建立在算力之上。"

Ross总结:"控制算力的国家将控制AI。没有能源就没有算力。"

9. AI经济学:通缩、劳动力短缺、新工作

Ross对AI经济影响的判断与主流叙事完全相反。

主流担心AI导致大规模失业。Ross说他认为AI会导致大规模劳动力短缺。

"不会有足够的人来填补将要创造的工作岗位。"

他预测三重效应:

**第一,大规模通缩压力。**咖啡会更便宜,住房会更便宜,一切都会更便宜。

Harry问:咖啡怎么会更便宜?

"机器人农业会更高效,供应链管理会优化,甚至可以基因工程改造咖啡豆让每瓦阳光产出更多。全产业链都会降成本。"

**第二,人们会退出劳动力市场。**工作时间减少,每周工作天数减少,退休更早。因为维持生活水平需要的工作量下降了。

**第三,新工作和新产业涌现。**100年前美国98%的劳动力在农业,现在只有2%。那98%的人去做什么了?做100年前根本无法想象的工作——软件工程师、网红。

"100年后软件工程师这个职业也会消失。但会以不同的方式消失——因为人人都会vibe coding(自然语言编程)。"

Ross解释了AI经济学与工业革命的本质区别:

"工业革命时期,能源不够用还需要机器来转化。如果我想让更多汽车上路,光挖更多石油不够,还得造汽车。AI不一样。如果我把算力翻倍,我的用户数翻倍,产品质量提升。直接加算力就行,没有中间环节。"

"经济中最有价值的是劳动力。现在我们可以通过生产更多算力和更好的AI,向经济中增加更多劳动力。这在历史上从未发生过。"

10. Vibe Coding:从专业技能到基础素养

Ross讲了一个内部案例。

有客户来访,提了一个功能需求。Ross做了一个非常high level的spec(规格说明),四小时后这个功能就上线生产了。没有一行人类写的代码,没有人类做debugging,全是prompting(提示工程)。他们甚至通过Slack做代码commit。

"想想这里的价值。但现在想象6个月后,这件事能在客户会议结束前完成。那是质的不同,不只是省钱的问题。当你能做到那么快,你能赢得竞争对手赢不了的单子。"

Harry问:Vibe coding是一个持久的市场吗?还是只是过渡期的现象?

Ross用读写类比回答。

"读写曾经是专业技能。如果你是scribe(抄写员),你是少数会读写的人,人们雇你就为了记录东西。你比普通人过得好,因为这是稀缺技能。"

"现在人人都会读写,不是特殊技能了,是每份工作的基本要求。编程正在经历同样的转变。以后做marketing要会编程,做客服也要会编程。"

Ross说他们有些实习生特别擅长vibe coding。他还提到一个开连锁咖啡店的朋友,从来没写过代码,用vibe coding做了一个供应链库存管理工具。

"他发现了我们软件工程师都会发现的问题——员工反馈说这个功能不work,那个edge case没处理。然后他就用vibe coding一个个修复。"

11. Margin哲学:"我希望margin尽可能低"

Harry问Ross怎么看margin(利润率)。

Ross说了一个反直觉的观点:"我希望我们的margin尽可能低,只要业务保持稳定。"

他解释了margin的两个功能。第一,稳定性——如果你margin很薄,市场一波动你可能撑不住。第二,竞争壁垒——但反过来说,"你的margin是我的机会"(Your margin is my opportunity),高margin会吸引竞争者。

Ross说他面试过一个CFO候选人(后来雇了另一个很棒的CFO),对方建议定价应该让供给匹配需求——也就是提价到需求下降为止。

"从经济学角度这很合理。但逻辑上说,为什么不把你的品牌价值变现呢?为什么不利用客户的信任卖给他们不那么好的东西?"

"品牌价值、客户信任是有价值的。信任会生利息(trust pays interest)。你想让客户知道你在给他们好deal。当你收高margin,你和客户是对立的。你要尽一切可能和客户站在一起。"

他说Groq的策略是:margin尽可能低,通过增加volume(销量)来获得现金流。

"我喜欢算力生意的一点是,对算力的需求是insatiable(永不满足的)。这是Jevons Paradox(杰文斯悖论)——如果我们生产10倍的算力,我们会有10倍的销售。只要我们持续降低成本,人们就会买更多。"

12. 芯片市场5年展望

Harry问:5年后芯片市场是什么样?

Ross预测英伟达仍将占50%以上的收入,但可能只占10%的芯片销量。

"品牌是有巨大价值的。你可以收更多钱。但这会让你less hungry(不那么饥渴),你开始收高margin,有些人愿意为品牌付费——因为买英伟达没人会被fired(开除)。这个生意会继续非常值钱。"

但他说,当你有像现在这样的客户集中度——35-36个客户占了99%的token消费——这些大客户会基于什么对自己业务有利来做决定,而不只是基于品牌。所以会有更多其他芯片被使用。

Harry问:英伟达5年后值10万亿美元吗?

"如果不值,我会很惊讶。"

然后Harry问:Groq 5年后值10万亿吗?

"Possible。我们没有供应链约束。我们能生产比任何人都多的算力。现在最稀缺的资源就是算力,而我们能生产几乎无限量的算力。"

关于Larry Ellison和Oracle的崛起,Ross说是"brilliant business decisions"和愿意快速行动的结合。

"大多数人现在还在问AI是不是过热、要不要加倍投入。他们就是直接冲了,就是aggressive。这就是赢的方式。当别人恐惧时你要贪婪,当别人贪婪时你要恐惧。现在AI领域有很多恐惧。但你看到的是少数几个聪明的贪婪的人在赚大钱——只是看起来有很多贪婪,其实只是少数人在快速行动。"

13. "我们不做模型":一个可能被吞并的选择

访谈快结束时,Ross谈到了Groq的战略定位。

"我们找到了一个不会与客户竞争的领域——我们不会创建自己的模型。这条线划在这里,意味着在我们平台上构建是安全的。"

这是互联网平台的经典问题:平台做大后会不会抢你的生意?Sam Altman在Harry的节目上说过,如果你只是在OpenAI基础上做小改进,你会被碾压。Ross说他很诚实。

"我们可能被客户吞并。但这也意味着你可以信任在我们上面构建。我可能在这个决策上犯了大错。"

Harry问Ross有没有卖过股票。

"从来没有。"

Harry开玩笑说:"你显然不懂这个游戏怎么玩。别担心,我会教你的。"

三个月后,英伟达用200亿美元给出了答案。

14. 回头看:那些意味深长的判断

整理这期访谈,有几个判断现在格外有意味:

关于被收购的可能性:Ross明确说过"我们可能被客户吞并"。他选择不做模型,是为了让客户信任在Groq上构建。这个选择的另一面是:当一个足够大的"客户"(或者说潜在客户)想要这个能力时,收购就是自然的结果。

关于供应链的价值:Ross反复强调6个月交付周期是Groq最核心的差异化。对英伟达来说,收购Groq不只是消灭一个推理市场的竞争对手,是买到一条不受HBM产能限制的算力通道。

关于估值的判断:9月融资估值69亿,12月被收购价200亿,近三倍溢价。Ross当时说Groq"possible"值10万亿——这个判断没有机会验证了,但200亿的价格说明市场认可这个技术的价值。

关于从未卖股票:Ross说他从来没卖过一股Groq股票。三个月后的收购,大概是他第一次"退出"。

英伟达CEO黄仁勋在声明中说,计划将Groq的低延迟处理器整合进英伟达AI工厂架构,扩展平台以服务更广泛的AI推理和实时工作负载。他强调这是"licensing IP and hiring employees"(授权IP和雇佣员工),不是收购公司——但据报道,除了GroqCloud业务外,Groq的所有资产都归了英伟达。

Ross和Groq总裁Sunny Madra将加入英伟达,帮助推进和扩展这项技术。Groq将继续作为独立公司运营,由CFO Simon Edwards担任CEO,GroqCloud业务继续运行。

这是英伟达历史上最大的收购。上一个记录是2019年以69亿美元收购Mellanox。

核心问答

Q1: 为什么算力会成为AI的终极瓶颈?

AI与传统软件完全不同。SaaS产品质量由工程师决定,AI产品质量可以直接用算力购买——跑两个实例选更好的答案,给高价值客户更多算力。Ross判断,如果Anthropic算力翻倍,一个月内收入几乎翻倍。Token消费几乎等于收入,这就是为什么算力需求永远无法满足。速度也极其重要:每100毫秒的加速带来约8%的转化率提升。

Q2: 英伟达的真正护城河是什么?

不是CUDA,是HBM的买方垄断(monopsony)。英伟达的GPU用的工艺和手机芯片一样,产能不是问题,HBM才是。英伟达控制着HBM的分配。自建芯片给你的不是芯片本身,是掌控自己命运的能力——让英伟达没法告诉你配额是多少。但自建芯片极难:首次流片成功率只有14%,从设计到投产最快3年,真正的难度递进是硬件→软件→跟上市场趋势。

Q3: 为什么英伟达要收购Groq?

Groq的核心价值是6个月供应链周期(vs 英伟达的2年)和不依赖HBM的SRAM架构。Ross自己说过"我们可能被客户吞并"和"我们不做模型"。当英伟达需要补齐推理市场短板、解决HBM产能限制问题时,收购Groq是逻辑自洽的答案。用200亿买到的不只是技术,是另一条不受HBM限制的产能通道,以及愿意加入英伟达的核心团队。

至顶AI实验室 作者:高飞的电子替身