2017年,八位Google研究员发表了一篇论文,需要一个标题。威尔士人Llion Jones脱口而出:"Attention Is All You Need"——灵感来自披头士的"All You Need Is Love"。他后来回忆说,这个主意"花了五秒钟","我没想到他们真会用这个名字"。
这篇论文引入了Transformer架构,而"Transformer"这个名字也是Jones取的。如今,ChatGPT、Claude、Gemini——几乎所有你能叫出名字的AI系统——都运行在Transformer之上。这篇论文的引用量超过17万次,跻身21世纪被引用最多的十篇论文之列。八位作者曾全部离开Google——不过2024年8月,其中一位Noam Shazeer带着27亿美元的交易回归,现在共同领导Google的Gemini项目。其余七位中,多人创办了总估值超过100亿美元的AI公司。
Jones本人在Google待了近12年。他最初是YouTube的软件工程师,2015年转向机器智能研究。2023年8月,他离开Google,与前Google研究科学家David Ha在东京创办了Sakana AI。离开的原因很直白:大公司病。他告诉媒体:"官僚主义已经严重到让我觉得什么都做不成。"
这不是Jones一个人的感受。Google联合创始人Sergey Brin在今年5月的All-in Summit上吐槽了他重返公司后的遭遇:他发现公司内部有一份清单,规定哪些工具可以用来写代码——而Google自家的Gemini居然在禁止名单上。"理由是一堆非常奇怪的原因,"布林说,"我和他们大吵了一架。"他去找CEO皮查伊,原话是:"我没法跟这些人打交道,你来处理这个。"
就在上个月的TED AI大会上,Jones公开宣布:他今年做了一个决定,大幅减少对Transformer的研究投入,转向探索"下一个大东西"。他说:"听到Transformer的作者之一站在台上说他已经对Transformer厌烦透顶,可能有点争议——但这也挺合理的,对吧?除了另外七位作者,没人比我研究它更久了。"
这不是空谈。他和Sakana AI的研究科学家Luke Darlow——一位来自南非、在爱丁堡大学拿到机器学习博士学位的年轻研究者——刚刚发布了一篇获得NeurIPS 2025 Spotlight的新论文:连续思维机(Continuous Thought Machine, CTM)。最近,两人一起做客Machine Learning Street Talk——深度学习领域最硬核的技术播客之一,以超长对话和对技术细节的穷追猛打著称。这期节目的标题是:"I Invented the Transformer. Now I'm Replacing It."(我发明了Transformer,现在我要取代它。)
公众对Transformer的印象是"已经赢了"——规模定律、涌现能力、通用智能的曙光。但Jones和Darlow抛出了一个刺耳的判断:整个行业可能正被困在一个"局部最优解"里。Transformer太成功了,成功到阻止我们去寻找真正的突破。
有一个细节可以说明这种"成功的诅咒"有多强:Jones说,在研究CTM的八个月里,他们从来没有担心过被"抢发"——因为根本没有人在做类似的事情。
1. Transformer的发明者正在主动逃离Transformer
Jones开场就承认了一种"发明者的倦怠"。他说,除了论文的另外七位作者,没有人比他研究Transformer更久了。但正因如此,他做出了一个反直觉的选择:把精力从Transformer上撤出,转向更具探索性的方向。他的原话是:"这是一个过度饱和的空间。"
这不是因为Transformer没有新东西可做,而是因为回报率在急剧下降——所有人都在同一条赛道上内卷。Jones说,他想利用自己的位置去做一些真正不同的事情,提高探索的比例。
2. Transformer的诞生不是规划的产物,而是自由探索的意外收获
Jones回忆了Transformer诞生时的氛围,那和今天完全不同。没有人从高层下达命令说"我们要研究这个方向"。Transformer是一群人午餐时聊天的产物——他们讨论当前技术的瓶颈、头脑风暴可能的解法,然后有几个月的自由时间去尝试,最终这个新架构就"掉出来了"。
Jones感叹,这种氛围今天已经很难复制。资源多了,人才多了,但自由反而少了。每个人都在赛跑,都在担心被抢发,都在被要求证明短期价值。
3. 行业正在经历"技术捕获",被自己的成功产品绑架
主持人提出了一个类比:YouTube上有一种现象叫"观众捕获"(audience capture),创作者为了迎合算法和粉丝,逐渐失去创作自由,被自己的观众"绑架"了。AI领域正在经历类似的事情——Jones称之为"技术捕获"(technology capture)。
OpenAI开始做搜索、做社交、做LinkedIn式的应用平台。学术界的论文变成了微调竞赛:LayerNorm(一种防止训练崩溃的"稳定器"组件)放在网络的哪一层?位置编码(告诉模型"这个词排第几位"的标记方式)用哪种新变体?这些改动能带来一点点性能提升,但本质上是在同一个框架里做装修,不是盖新房子。初创公司刚拿到融资就开始被追问"什么时候出产品"。整个生态系统都被Transformer这个"成功的囚笼"锁住了。
Jones说,他创办Sakana的一个核心使命就是"保护研究者的自由"。公司内部是Kenneth Stanley那本《Why Greatness Cannot Be Planned》的忠实信徒——这本书的核心论点是:让人追随自己的兴趣梯度,不被目标和委员会束缚,才是发现真正新东西的方式。Stanley下周要去Sakana演讲,办公室里摆着这本书的日文译本。
但Jones也承认,随着公司成长,这种自由会不可避免地被侵蚀。投资人要回报,产品要上线,压力会越来越大。他的工作之一就是尽可能延缓这个过程。
4. 进化算法的遗憾:整个行业All-in Transformer时,没人愿意听别的
Jones透露了一个遗憾。他曾经想做大规模的进化搜索实验——把当年用几万美元算力跑的"人工生命"模拟放大到几亿美元的规模,看看会涌现出什么。
但他提出这个想法的时候,整个行业都在All-in Transformer。没有人感兴趣。零反馈。
这成了他创办自己公司的原因之一:既然在大公司里推不动这些方向,那就自己建一个地方来做。
5. RNN时代的"1.26到1.24"内卷,正在Transformer时代重演
Jones回忆了Transformer出现之前的日子。那时候主流是RNN(循环神经网络),一种能"记住"之前输入内容的神经网络,特别适合处理文本、语音这类有先后顺序的数据。但RNN有个致命问题:处理长序列时,早期信息会逐渐被遗忘。于是研究者们发明了LSTM和GRU——两种靠"门控机制"来管理记忆的改进方案。想象你脑子里有个笔记本,每读到新信息,你要决定:写进去吗?擦掉旧内容吗?把内容说出来吗?LSTM有三道这样的"门",GRU简化成两道。
那个年代的论文就是在这些细节里打转:门放在哪一层?初始化用什么值?层与层之间怎么连接?每篇论文带来的进步用"bits per character"来衡量——这个指标表示模型预测下一个字符需要多少信息量,数字越低越聪明。进步的节奏是:1.26 → 1.25 → 1.24。这种微小的改进足以发表顶会论文。
然后Transformer来了,一步跨到1.1。有同事跑到他们桌前说:"你们是不是搞混单位了?是nats不是bits吧?"——因为如果结果真的是bits,那就好得离谱了。所有那些精细的RNN改进工作,一夜之间变得毫无意义。
Jones的警告是:我们现在可能正在重蹈覆辙。下一个"1.1时刻"会让今天所有关于Transformer的微调论文同样变成历史的注脚。
6. "更好"不够,必须"压倒性地好"才能撼动既有架构
为什么明明有论文证明某些架构比Transformer更好,行业却不换?
Jones给出了一个冷酷的答案:训练Transformer的软件已经高度成熟,所有人都知道怎么微调、怎么做推理、怎么调试,内部机制被研究得很透。整个生态系统——从硬件到框架到人才储备——都是围绕Transformer建立的。
"比Transformer好"是不够的。必须好到像当年Transformer碾压RNN那样——快10倍、准10倍——才可能让整个行业迁移。而这种"碾压级差距"反过来提高了发现下一个突破的难度:因为每次有人做出一个小改进,OpenAI那边就把模型做大10倍,又追平了。引力太强,逃逸速度太高。
7. "螺旋应该被表达为螺旋"——这句话揭示了当前AI最深层的缺陷
Jones提到了一篇被拒稿的论文,但他把它当作"海报案例"来讲。
那篇论文用经典的螺旋数据集测试不同的神经网络——想象一张图上有两条缠绕的螺旋线,红点和蓝点各分布在一条线上,任务是让网络学会区分它们。ReLU网络和tanh网络都能正确分类所有点——测试准确率100%。但如果你画出它们的决策边界(也就是网络用来划分"红区"和"蓝区"的那条线),你会发现:ReLU网络的边界是无数条折线拼凑出来的"伪螺旋",像是用乐高积木硬拼出一条曲线。而论文里提出的矩阵指数层,决策边界本身就是一条光滑的螺旋。
Jones的观点是:前者"解决了问题",但它并不"理解"螺旋是什么。它无法外推——因为真正的螺旋是会继续旋转下去的,而那堆折线在训练数据之外就会完全失效。
"如果数据是螺旋,我们难道不应该把它表示为螺旋吗?"
这句话听起来像是常识,但放在今天的AI语境下却几乎是异端。因为主流范式是:只要准确率够高,内部表示是什么不重要。Jones认为这正是当前AI"看起来聪明但容易犯低级错误"的根源——一种被他称为"锯齿状智能"(jagged intelligence)的现象:能解决博士级难题,下一秒却说出明显荒谬的话。
他还举了视频生成模型的例子。曾经有一段时间,AI生成的人像手指数量不对,这成了识别AI内容的方法。后来通过更多数据、更大模型、更好的训练技巧,手指问题被"修复"了。但Jones质疑:我们真的解决了问题,还是只是用更大的蛮力把问题盖住了?如果模型真的理解"人手有五根手指",它一开始就不会画错。
8. CTM的核心理念:让模型"走迷宫"而不是"看迷宫"
Luke Darlow接过话题,解释了CTM的设计思路。
传统方法处理迷宫问题是这样的:给一个卷积神经网络看一张迷宫图片,让它直接输出一张同样大小的"路径图"——0表示墙,1表示通路。这相当于模型"一眼看穿"整个迷宫,瞬间输出答案。对机器来说这很容易做到。
但如果你要求模型像人类一样输出一串导航指令——"上、上、右、左、上"——难度会急剧上升。因为这是一个本质上需要序列化思考的问题:你必须先走第一步,才能知道第二步该往哪走。
CTM的做法是引入一个"内部思考维度"(internal thought dimension):模型可以在输出答案之前,先进行多步内部运算。它不是一次性"看到"答案,而是一步步"走出"答案——每一步都可以回顾之前的状态,调整方向,甚至回溯错误。这让模型获得了一种类似于"思考时间"的东西。
训练方式也很特别。他们用了一种"自动课程学习"(auto-curriculum):模型先学会预测第一步,等第一步稳定了,再训练它预测第二步、第三步……逐步提升难度。这不是一次性灌输100步的解法,而是让模型自己bootstrap上去。
9. 神经元被重新定义:每个神经元本身就是一个小模型
CTM的第二个创新是对"神经元"概念的重塑。
传统神经网络里的神经元是"无记忆"的:它只看此刻收到的输入,立刻给出输出,然后就"忘了"——下一时刻对之前发生过什么一无所知。最常见的ReLU激活函数本质上就是一个开关:输入大于零就输出原值,小于零就输出零。
但真实的生物神经元远比这复杂。CTM让每个神经元成为一个"神经元级模型"(Neuron-Level Model, NLM):它不只看"现在输入是多少",而是看"过去一小段时间内,我的激活值经历了怎样的起伏"——就像看心电图,你看的是一条曲线,不是一个点。基于这段"小历史",神经元再决定输出什么。这意味着同样的当前输入,如果历史不同,输出也会不同——神经元有了上下文感知的能力。
Darlow说,这是在生物学和深度学习之间找一条中间路线:既借鉴大脑神经元的动态特性,又保留反向传播、并行计算这些让深度学习高效的特性。
10. 同步性成为表示的核心:不是"此刻神经元什么状态",而是"神经元们如何共舞"
第三个创新是CTM对"表示"(representation)的重新定义。
传统做法是:模型在某一时刻的"状态"就是所有神经元激活值的快照——一个向量。如果有1000个神经元,状态就是一个1000维的向量,相当于1000个"词汇"来描述世界。
CTM不这样做。它测量的是神经元对之间的"同步程度"——两个神经元的激活时间序列有多相似。如果两个神经元总是同时活跃、同时沉寂,同步度就高;一个活跃时另一个沉寂,同步度就低。这个灵感来自神经科学:大脑的"思考"不是某一瞬间的快照,而是神经元群体随时间共振、协调的模式。
这带来一个有趣的数学结果:如果你有d个神经元,传统表示的维度是d,但同步性表示的维度是d²/2——每一对神经元都贡献一个维度。换算一下:1000个神经元从1000维暴涨到约50万维,能捕捉的细微差别大幅增加。
但这50万维不需要50万套参数来支撑——它们是从1000个神经元的动态行为中"免费"衍生出来的,就像一个班30个学生,你不用考435次试就能知道每两个学生之间的成绩差距。而且因为同步性计算天然涉及所有时间步的信息,梯度可以更顺畅地传播,训练更稳定。
他们还引入了"指数衰减率"来处理不同的时间尺度:有些神经元对关心的是"刚才这一瞬间是否同步",有些关心的是"过去很长一段时间的同步趋势"。这借鉴了大脑中不同脑波对应不同思维状态的现象。
11. 意外发现:CTM几乎完美校准,简单问题秒答、难题才深思
Darlow分享了两个让团队惊喜的意外发现。
第一个是自适应计算时间。他们在ImageNet分类任务上测试CTM,损失函数的设计方式是:找到模型"最准"的那个时间点和"最确信"的那个时间点,在这两个点上计算损失。结果发现,简单图片在1-2步就被正确分类了,模型几乎立刻就"确信"了;而困难图片会自然地使用更多思考步数。没有任何显式的惩罚项去约束计算量——这种行为是自然涌现的。
第二个是校准特性。传统神经网络有个老毛病叫"过度自信":训练久了之后,模型预测"90%是猫",但实际可能只有70%的时候是对的。业界有很多事后补救的技巧来修正这个问题。但CTM训练完之后,几乎完美校准——说90%就真的是90%。这完全不在设计目标里,是意外收获。
12. 模型自己学会了"时间不够就跳着走"的算法
Darlow分享了另一个让他震惊的发现。
他们训练CTM解决迷宫问题,但故意限制"思考步数"——比如迷宫需要100步才能走完,但只给模型50步的"思考预算"。结果模型没有放弃,也没有只走一半路然后停下,而是自己发明了一种策略:
先跳到迷宫中大致正确的位置,从那里往回追溯路径;然后再跳到更远的位置,再往回填;如此反复,用一种"跳跃式回填"的方法,在有限时间内尽可能多地覆盖正确路径。
没有人教它这样做。没有任何损失函数鼓励这种行为。这是从约束中自发"涌现"出来的算法创新。
还有一个观察:在训练中期,模型会出现"走错路然后回头"的行为——它沿着一条路径走下去,意识到错了,回溯,尝试另一条路。到训练后期,它变得更高效了,这种回溯减少了。但早期那种"试错"行为本身就很有趣——它说明模型在某种意义上有了"纠错"的能力。
13. CTM与神经图灵机的关系:离散vs连续
主持人问到CTM和Alex Graves的神经图灵机(Neural Turing Machine)有什么关系——那也是一种试图给神经网络加入"思考"能力的架构。
Darlow说确实有关系,但有一个关键区别:神经图灵机的核心是"读写记忆",而读写是离散操作——你要么写入一个位置,要么不写。这带来了训练上的挑战。
CTM的路线是让推理在连续的潜在空间(latent space)中展开,回避了离散操作的问题。Darlow没有宣称CTM是图灵完备的,但他认为这种连续展开的方式为解决不同类型的任务打开了新的可能性。
14. 未来方向:长期记忆与多智能体"文化记忆"
主持人问到如何扩展CTM的能力,Darlow透露了团队正在探索的一个方向:长期记忆。
他描述了一个实验设想:把多个智能体放进同一个迷宫里,但每个智能体只能看到自己周围5×5的小区域。给每个智能体一套存储和检索记忆的机制,任务是找到出口。模型需要学会如何构建记忆——比如记住"上次在这个岔路口走错了",下次回到同一位置时选择另一条路。
更有趣的是:如果多个智能体共享同一个记忆系统会发生什么?它们能否形成某种"文化记忆"——一个智能体的探索经验可以被其他智能体利用,从而协作解决更大的问题?
Darlow认为,记忆将是AI未来发展的关键要素之一。
15. AI Scientist:100%AI生成的论文被接收了,但Jones想要的是交互式合作
话题转向Sakana的另一个项目:AI Scientist。这是一个端到端的系统,可以从一个种子想法出发,自动构思研究方向、写代码、跑实验、收集结果、撰写论文——全程不需要人类介入。
他们甚至让一篇100% AI生成的论文被一个workshop接收了。
但Jones说,这更多是一个"概念验证"——证明这件事技术上可行。他真正想要的,是一个交互式的AI研究伙伴。他希望能给AI一个初步想法,AI回来提更多想法,两人讨论,然后AI去写代码,他检查代码,一起看结果、一起分析。就像带一个实习生:你不可能把一个模糊的想法扔给实习生然后消失四个月,你需要持续的对话和引导。
当被问到"未来AI会不会完全取代人类科学家"时,Jones说他来回摇摆。他用国际象棋做类比:曾经有一段时间,人类+AI的组合能打败纯AI;但那个时代已经过去了,现在加入人类反而会拖累AI的表现。如果AI科学家也到了那一天,人类该怎么办,是一个更大的话题。
16. Sudoku Bench:源自"脑中思维轨迹"的灵感
Jones在节目最后推介了他们发布的新基准测试:Sudoku Bench。
灵感来自Andrej Karpathy的一句话:训练AGI真正需要的不是互联网上的文本,而是人类在写下这些文本时脑中的思维轨迹——如果你能从那个数据学习,才会得到真正强大的东西。
Jones想:这种数据肯定存在于某个地方。他最初想到哲学里的"意识流"写作,但后来发现了一个更好的来源——YouTube频道"Cracking the Cryptic"。这个频道的两位英国绅士会用几个小时解一道极难的数独,全程详细解释自己的每一步推理。
这些不是普通的数独。它们是"变体数独"(variant Sudoku)——在标准规则之上,叠加各种手工设计的额外约束,每道题都有独特的"机关"。有的谜题会在自然语言描述中故意写错一个数字,解题的第一步是先找出规则描述里的错误;有的谜题在数独格子上叠加一个迷宫图案,老鼠必须从起点走到奶酪,而走过的路径上的数字必须满足特定的数学约束。
他们获得了频道的许可,爬取了数千小时的视频,把专家的思维轨迹整理成数据集开源——这可能是世界上最高质量的"人类推理过程"数据之一。
17. 为什么当前的RL方法在Sudoku Bench上失败
目前最好的模型只能解决约15%的题目,而且全是最简单的那些。Jones说,GPT-5有进步,但仍然无法解决人类专家能解的谜题。
他们内部也尝试用强化学习(RL)来攻克这个基准,但失败了。Jones认为问题在于采样:这些谜题的解法需要找到一个独特的"突破口"(breakin)——某个反直觉的切入点,让整个谜题瞬间变得可解。人类专家看一眼就能识别出"这是一个集合论问题"或者"这里需要用路径追踪"。
但要让RL学会这种推理模式,你首先需要碰巧采样到它。而这些模式太稀疏、太特殊了,随机探索几乎不可能撞上。所以模型会退化为暴力枚举:"这格填1?不行。填2?不行。填3……"——这和人类专家那种充满创造性的推理完全是两回事。
Jones的判断是:如果有人能真正攻克这个基准,他们必然已经创造出了极其强大的推理系统。这不是一个靠"再加点算力"就能解决的问题。
