2025年12月,NeurIPS大会在圣地亚哥举行。Radical Ventures的播客节目Radical Talks录制了一期特别对话,由该基金联合创始人Jordan Jacobs主持,嘉宾是Geoffrey 辛顿和Jeff Dean。

“当时Google不觉得Transformer特别重要”:辛顿与Jeff Dean复盘现代AI四十年

这两个人经常碰面,但是共同接受采访还是不多的。辛顿获得了2024年诺贝尔物理学奖和2025年伊丽莎白女王工程奖,并于2023年从Google离职以便更自由地谈论AI风险;Jeff Dean是Google首席科学家、Gemini项目联合负责人,过去十五年来他主导了从MapReduce到TPU到Transformer再到Gemini的一系列基础设施革命。

就在这场对话录制的同一周,多伦多大学宣布设立"辛顿人工智能讲席教授"职位,Google捐赠1000万美元,多伦多大学配套1000万美元,共计2000万美元。Jeff Dean在接受采访时说:"这是一双很大的鞋,谁来填补都是挑战,但这将真正帮助推动学术研究。"

而就在三天前,Google发布了Gemini 3 Flash,在多项基准测试中超越了GPT-5.2,成为Gemini应用的默认模型。这是Jeff Dean团队在ChatGPT发布后启动的"合并所有资源"战略的最新成果。

这场对话穿越了四十年。从1986年反向传播论文发表,到2012年AlexNet震惊计算机视觉领域,到2017年Transformer论文改变自然语言处理范式,到2022年ChatGPT引发的"Code Red",再到2025年Gemini登顶排行榜。两位当事人回忆了那些被后人神化的时刻到底发生了什么,讲述了那些差点没发生的故事,以及他们对未来二十年的判断。

1. "做大就是做好,但我们没学到这个教训"

Jeff Dean在1990年做本科毕业论文时,就在研究如何用并行算法训练神经网络。他用的是明尼苏达大学实验室里一台32处理器的超立方体机器(hypercube,一种并行计算架构,处理器之间的连接方式像高维立方体的顶点)。

"我当时想,如果我们能把计算量提高32倍,就能做出惊人的神经网络。"他回忆道。但他犯了一个大错:他没有随着处理器增加而增大模型规模。"把10个神经元分散到32个处理器上,速度提升曲线惨不忍睹。"

辛顿说自己本应在80年代就意识到算力的重要性。当时Berkeley的Herb Bourlard和Nelson Morgan、剑桥的Tony Robinson都用并行计算做语音识别,做出了和当时最好系统一样准确的声学模型。

"我们应该意识到,做大就是做好。但更大意味着更复杂的编程和更复杂的硬件,所以我们没学到这个教训。很蠢,但就是没学到。"

他直到2014年听了Ilya Sutskever的一次演讲才彻底明白。"我之前没意识到它会一直scale下去。"

辛顿给出了一个震撼的计算:假设1986年他在Lisp机器上启动一个神经网络训练任务,让它一直跑到今天,现代的Titan显卡只需要一分钟就能追上这38年的进度。

2. "他把weight decay设成了1"

辛顿挑选学生有一个核心问题:"你最好的想法是什么?"

"有人成绩全A,但回答说他还没有想法,要等到研究生阶段。这种人不选。"他要的是已经证明自己能产生原创想法的人,不管想法好不好。

AlexNet的第一作者Alex Krizhevsky刚加入实验室时,看起来并不像天才。他最初尝试用tiny images(一个缩略图数据集,图片只有32×32像素)做实验,告诉辛顿"不行"。

辛顿去看了一眼他的代码,发现他把weight decay(权重衰减)设成了1。这个参数相当于对模型收的"税"——每学一点东西就要被扣掉一部分,防止模型死记硬背。正常税率是0.001,千分之一,模型能稳步积累知识。Alex设成了1,相当于100%税率,学到多少扣多少,永远攒不下东西。

"为什么是1?"

"不知道,感觉是个好数字。"

"学生不懂某件事的时候看起来像傻瓜,但他们不是,只是不知道而已。Alex进步得非常快。"

后来Alex要做depth oral——博士资格考试的文献综述环节——但他不想做。辛顿做了一个决定:"每周你在ImageNet上的准确率提高1%,就可以推迟一周。"

结果一周接一周过去,准确率一直在涨,Alex再也没做那个depth oral。辛顿说这是他做过的最好的管理决策。

3. 在父母家卧室里训练AlexNet

AlexNet是在Alex父母家的卧室里训练的。

当时Vlad Mnih已经证明了Nvidia GPU在神经网络训练上的潜力。他用GPU识别航拍图像中的道路,效果很好。辛顿用这个成果申请续期一个加拿大政府的战略性研究基金,但被拒绝了。评审意见说"这项工作不可能有任何工业应用价值"。

"我真希望知道是谁写的。我想告诉他,这个领域贡献了去年美国股市增长的80%。"

Ilya Sutskever是推动AlexNet应用于ImageNet的关键人物。他对辛顿说:"我们必须在Yann LeCun之前做出来。"与此同时,Yann正在自己的实验室努力说服博士后和学生把卷积网络用于ImageNet,但每个人都有"更好的事情要做"。

Ilya不光催,还动手。他亲自把ImageNet的所有图片预处理成统一尺寸(224×224像素),让Alex可以直接用。

训练设备就是两块Nvidia GPU显卡,插在Alex父母家卧室的电脑里。显卡是多伦多大学买单,电费是父母买单。

"我这是在给大学省钱。"辛顿开玩笑说。

2012年的ImageNet竞赛结果出来时,AlexNet的错误率比第二名低了10个百分点以上。深度学习的时代正式开始了。

4. 64岁的实习生

AlexNet论文在2012年NIPS发表后,所有大公司都想挖这个团队。

辛顿观察到一个现象:公司里"发工资的预算"和"做收购的预算"是两笔钱,后者是前者的10倍。所以他们决定成立一家空壳公司DNN Research,把自己包装成收购标的,而不是求职者。

收购拍卖发生在Lake Tahoe赌场的NIPS会议上。楼下赌客赢一万美元铃声大作,楼上每次加价一百万美元。

"每次听到研讨会论文有人中奖的铃声,我们就知道有人赢了一万美元。而我们楼上,每加一次价就是一百万。"

辛顿其实早就决定Google必须赢——那年夏天他在Google Brain实习过,体验很好。最后眼看"错误的人可能会赢",他们直接叫停了拍卖。

"我们操纵了拍卖。"辛顿承认。

那年夏天的实习经历本身就是一个故事。辛顿当时64岁,但他只能待一个夏天,而访问学者必须待满六个月。唯一能给他发badge的类别是"实习生"。

"我觉得他们能录用64岁实习生的唯一原因是,年龄字段只分配了6个bit。"(6个bit最大能表示的数字是63)

他不得不和一群来自IIT和清华的学生一起上新员工培训课。培训官说"用你的LDAP和OTP登录"——这是企业内网的账号协议和动态验证码,任何一个科技公司员工都该知道的基础操作。辛顿举手问:"什么是LDAP?什么是OTP?"

四个助教原本在会场里走来走去帮助新员工,大约10分钟后,他们决定专门分配一个给辛顿。所有那些年轻学生都在看这个三倍于他们年龄、显然什么都不懂的老人。

午餐时一个以前上过他课的本科生认出他,喊了一声"辛顿教授",所有人才恍然大悟。

5. "我们有很多电脑"

Google Brain的起源是一次微厨房偶遇。

2012年的某一天,Jeff Dean在Google的微厨房(micro kitchen,Google办公区里分布的小型茶水间)碰到了Andrew Ng。Andrew刚开始每周来Google一天,还不太确定要做什么。

"我问他在忙什么,他说他在斯坦福的学生用神经网络取得了好结果。"

Jeff Dean说了一句改变历史的话:"那为什么我们不在这里训练非常非常大的神经网络?我们有很多电脑。"

当时Google数据中心里没有GPU,只有大量CPU服务器,每台有16到24个核心。Jeff Dean写了一套软件框架,可以把神经网络的计算切分到成千上万台机器上并行跑,既支持数据并行(不同机器处理不同的训练样本),也支持模型并行(把模型的不同部分放在不同机器上)。

他们用16000核CPU训练出比此前任何人都大50倍的模型,在1000万张YouTube随机截图上做无监督学习,目标是让模型学会重建图像的像素。

但他们犯了一个错误:为了让模型更像大脑,没有使用卷积共享权重。卷积的精髓是"同一个滤镜扫描整张图",参数可以复用;他们给图片每个位置都配了独立的滤镜,认为这样更符合生物学原理(大脑不同区域的神经元权重不可能完全相同)。结果参数量膨胀到20亿。

尽管如此,模型在ImageNet 22K(包含22000个类别的更难版本)上仍然取得了70%的相对错误率提升。他们开始意识到一个规律:更大的模型、更多的数据、更多的计算,效果就是更好。

"我们没有正式把它叫做scaling law,但我们有一句口号:bigger model, more data, more compute。"

早期Brain团队只有约20人,全挤在一间比会议室还小的没窗户的办公室里。

"没窗户可能是好事,他们就不会往外看了。"辛顿说。

他记得有一次算力不够用,Jeff Dean打了个电话,他只听到Jeff那头说"200万够了"。

"在大学里,想多拿200万做计算要写好几年基金申请。"

6. Transformer:当时并不觉得特别重要

Transformer的前身是sequence-to-sequence(序列到序列)模型。

Ilya Sutskever、Oriol Vinyals和Quoc Le做了这个工作,用相当深、相当大的LSTM(长短期记忆网络)在机器翻译上取得了非常好的结果。但LSTM有一个问题:它必须按顺序处理输入,每一步都依赖上一步的结果,无法并行化。而且你必须把所有信息压缩到一个向量里,在处理长序列时信息会丢失。

有人意识到,如果你把所有中间状态都保存下来,然后用attention机制去查看它们,就能解决这两个问题。保存的状态可以并行计算,而且你可以精确地"看到"之前的任何位置,不用把所有信息塞进一个向量。

这就是Transformer的核心思想。

当时团队内部并不觉得它比其他突破更重要。Jeff Dean说:"和sequence-to-sequence或mixture of experts比起来,我不确定它重要多少。非常有用,但我们今天用的所有东西看起来都有用,因为那就是我们为什么用它们。"

辛顿坦言自己当时没太关注Transformer,因为他一直研究的是大脑如何工作,而大脑显然不会"保存所有神经活动向量的拷贝"。

"我觉得这不能在大脑里实现,所以我不感兴趣。"

后来他改变了看法。Transformer可以用fast weights(快速权重)和联想记忆来近似,虽然还不清楚如何通过时间进行反向传播来学习早期的东西,但它确实让scaling law成立了。

"像不像大脑不重要,重要的是它真的能scale。"

有人问Jeff Dean:Google后悔发表Transformer论文吗?

"不后悔,因为它对世界产生了很好的影响。"

但他也承认,对于最大规模模型的某些训练细节,现在确实不再公开发表了。Google在NeurIPS仍然有100多篇论文,但核心的商业机密会保留。

7. 被拒的论文,被忽视的技术

Distillation(蒸馏)是2014年的工作,让小模型模仿大模型的行为,从而用更少的参数达到接近的效果。

这篇论文被NIPS拒稿了。评审理由是:"蒸馏出来的学生模型并不比老师模型更好,有什么意义?"

"他完全没理解这项技术的目的。"辛顿说。

蒸馏的意义是:你可以训练一个巨大的模型,然后用蒸馏让一个小得多的模型达到接近大模型的性能。这就是为什么Gemini既能在性能上领先,又能在手机上运行。

还有一个关于Blackberry的故事。辛顿的学生George Dahl和Abdel-rahman Mohamed做出了比当时最好系统略好的语音识别模型。辛顿联系Blackberry说:"我们有更好的语音识别技术,想不想要?可以派个实习生过去演示。"

Blackberry的回复是:我们对语音识别不感兴趣。

当然——那时候Blackberry还有键盘。

辛顿后来评论说,Blackberry的老板曾经抱怨加拿大的研究成果从来不能在加拿大被商业化。"是Research in Motion自己决定不利用它的。"

那个学生Navdeep Jaitly后来去了Google,在蒙特利尔的实验室(因为他在申请绿卡,不能去美国)。他的经理Vincent Vanhoucke觉得"改变Google语音识别的方式"这个目标太疯狂了,让他做个合理一点的项目。

Navdeep坚持。Vincent说好吧,那就试试。结果成功了。

8. 信封背面的计算

2013年,Jeff Dean做了一个"信封背面计算"(back of the envelope calculation,英文里指随手在纸上做的粗略估算):如果1亿人每天用语音和手机对话3分钟,用CPU跑最新的语音识别模型需要多少算力?

结果很吓人:需要把Google的服务器数量翻一倍。

即使成本不是问题,这个部署周期也太长了。而且他们已经看到,更大更强的神经网络会在越来越多的地方派上用场。

Jeff Dean判断,专用芯片是唯一出路。神经网络有几个好特性:运算类型很少(主要就是矩阵乘法),而且对精度要求不高——精度低一点只是引入一些噪声,而神经网络本来就喜欢噪声。甚至不需要纠错内存,因为算错几个bit也不影响结果,相当于额外的正则化。

当时Google已经有一些人在考虑用FPGA(现场可编程门阵列),但经过讨论,Jeff Dean认为应该直接做专用ASIC。FPGA的灵活性要付出性能代价,这个代价往往会吃掉你想获得的收益。

他在走廊里"堵住"了当时的CFO Patrick Pichette,说服他先投5000万美元部署第一代TPU,尽管当时还不完全知道怎么用。

TPU v1专门做推理,性能比同期CPU好15-30倍,能效好30-80倍。这篇论文现在是计算机架构顶会ISCA历史上被引用最多的论文。

Jeff Dean认为这种软硬件一体的能力是Google的核心优势。硬件开发周期是2.5到6年,这意味着硬件设计师必须预测这个飞速发展的领域在遥远未来的方向。如果有机器学习研究者和硬件工程师坐在一起,分享那些"还不是主流但看起来有前景"的想法,预测就会准确得多。

他们后来还用强化学习来做芯片的布局布线(placement and routing),这项技术已经用在三代TPU和其他几种芯片上,效果比人类工程师用传统CAD工具更好。它既提高了芯片质量,也加快了开发速度。

9. ChatGPT发布时,Google内部发生了什么

ChatGPT发布时,Google内部其实已经有一个被广泛使用的聊天机器人,8万员工在用,反馈非常正面。它是在COVID期间开发的,大家都在家办公,需要一个智能助手。

为什么没发布?因为从搜索产品的视角看,它有幻觉和准确性问题,而搜索最核心的原则就是准确。

"我们有点短视。我们没意识到聊天系统还能用来做很多其他事情——帮你给兽医写一封关于生病狗狗的信,帮你总结一篇论文,帮你写论文……"

辛顿补充说,Google当时什么都有了,唯一缺的是人类反馈强化学习(RLHF)。"他们没意识到,你不需要很多例子就能阻止模型做大部分坏事。"

ChatGPT发布后一两周,Jeff Dean写了一页备忘录。核心观点是:Google当时有多个分散的团队在做大模型研究——Brain团队、Research团队、DeepMind。既分散人才,也分散算力,这没有道理。

"如果我们的语音识别模型比别人好,算力不够用,我就想:要是让每个用户每天用语音和手机说三分钟话,1亿用户需要多少算力?算出来发现要把Google的服务器数量翻一倍。"

他建议合并成一个团队,集中资源,目标是造世界上最好的多模态模型。

这就是Gemini的起源。

主持人Jordan Jacobs问:有没有人竞争得过Google?你们有最强的模型、最强的团队、遍布全球、支撑着十亿用户的产品数据、每年1000亿美元以上的自由现金流、还有自己的芯片。

Jeff Dean笑着回答:"加入我们。"

10. Capsules:巨大决心用在错误方向上会怎样

辛顿花了很多年研究一种叫Capsules(胶囊网络)的架构。

"Capsules是一个很好的例子,说明如果你有巨大的决心,选对了方向就能取得很好的成果,选错了方向就会浪费很多年。"

他的两个最信任的人,Jeff Dean和Ilya Sutskever,都劝他别做了。他没听。

"他们俩都说停下来,这让我更加坚定了。"

Capsules的想法是让神经网络更好地处理物体的空间关系,但在实践中一直没能超过传统卷积网络。辛顿最近承认它有局限性:需要为每个物体实例分配更多硬件,而且路由过程计算量太大。

不过他仍然没有完全放弃这个方向。他后来提出了GLOM架构,用"一致性岛屿"(islands of agreement)的思想来替代原来的路由机制。Yoshua Bengio公开表示支持:"Geoff在职业生涯中产生过很多惊人的直觉,其中很多后来被证明是对的。所以我很关注他的想法,尤其是当他像对GLOM这样坚信不疑的时候。"

11. 未来二十年:谁也没有头绪

Jeff Dean的技术路线图有四个方向:

第一,把attention扩展到数十亿甚至万亿token,而不是现在的百万级。如果模型能清晰地看到整个科学文献库或所有视频,而不只是手工挑选放进context的一小段信息,能做的事情会完全不同。这需要硬件和软件的共同创新。

第二,开发更节能、更高性价比的推理硬件。

第三,探索持续学习(continuous learning),让模型在服务用户时也能更新,而不是训练完就固定下来。

第四,突破现有的模型架构限制,探索更自由的连接模式。现在的稀疏模型(mixture of experts)都是固定数量、固定大小的专家,然后分支、合并、再分支。这看起来不太对劲。

辛顿对持续学习持谨慎态度:"有个很好的理由我们现在不做——静态模型更安全,你可以测试它。如果模型自己在学习,你很难知道它会学到什么。"

被问到20年后的世界会是什么样,辛顿的回答很直接:

"如果有人真的建成了它,要么我们都幸福地活着,要么我们都死。"

他认为没人对20年后的未来有任何头绪。大量工作会消失,但问题不在AI,在于政治系统——生产力大幅提升后,财富如何分配?"至少在美国,你们目前的政府不是处理这个问题的理想配置。"

关于大模型的创造力,辛顿有一个有趣的观点。

"很多人说AI不是真的有创造力,只是在重复。这是胡说。"

他的论证是:这些模型把海量知识压缩到"区区"万亿参数里,压缩意味着必须找到不同知识之间的共性。"它们知道的比任何一个人都多,可能正在发现希腊文学和量子力学之间的联系。没有多少人同时是这两个领域的专家。"

他认为医疗和教育是最可能被彻底改变的领域。两者都有弹性需求,效率提升不会减少需求,只会增加供给。如果医生效率提高10倍,不是只需要十分之一的医生,而是每个人都能得到10倍的医疗服务。

"几年内AI会像私人家教一样好,再过一段时间会更好,因为它们见过一百万个其他学生。"

结语:坚持的代价和收益

这场对话最后回到了一个简单的问题:是什么让事情发生?

辛顿的回答是"enormous determination"——巨大的决心。Ilya坚持要做ImageNet,Navdeep坚持要改变Google的语音识别,Jeff Dean坚持要投5000万做TPU。

但他也指出,巨大的决心是双刃剑。选对方向,成就伟业;选错方向,浪费多年。他自己在Capsules上的经历就是例子。

"关键是选对方向。"

怎么选对?

"没有人知道。"

这可能是整场对话中最诚实的一句话。

Q1: 为什么Google明明有8万员工在用的内部聊天机器人,却被ChatGPT打了个措手不及?

因为他们用搜索产品的镜头看聊天机器人。搜索最重要的是准确,而聊天机器人有幻觉问题,所以他们觉得不能发布。他们没意识到用户可以容忍聊天机器人在准确性上的瑕疵,因为用途不同——帮写信、总结文章、头脑风暴这些场景,"差不多对"就够了。此外,Google内部多个团队各自为战,既分散人才也分散算力。ChatGPT发布后,Jeff Dean写备忘录建议合并资源,才催生了Gemini项目。

Q2: 辛顿和Jeff Dean对AI安全最大的分歧是什么?

Jeff Dean认为持续学习(模型边服务边更新)是未来方向之一;辛顿认为这很危险,因为静态模型可以测试,动态学习的模型你不知道它会学到什么。这反映了工程思维和安全思维的张力——前者追求能力边界,后者担忧控制边界。辛顿现在的立场是,AI可能让人类"要么幸福地活着,要么都死",而他离开Google就是为了更自由地谈论这些风险。

Q3: 这场对话揭示了哪些"差点没发生"的历史?

至少三个关键时刻差点走向不同方向:第一,Blackberry拒绝了用神经网络改进语音识别的提议,因为他们"对语音识别不感兴趣"——那时候还有键盘;第二,辛顿申请续期研究基金被拒,评审说"不可能有工业应用"——这个领域后来贡献了美国股市增长的80%;第三,Yann LeCun的实验室没人愿意把卷积网络用于ImageNet,因为大家都有"更好的事情要做"——结果Ilya和Alex抢先做了AlexNet。历史不是必然发生的,它取决于谁在关键时刻坚持了下来。

至顶AI实验室 作者:高飞的电子替身