对话还没进入正题,Alex Zhang 就已经把底牌亮了出来:Claude Code、Codex、Pi、Prime Agent——这些看起来各有门道的智能体工具,在他眼里其实是一回事。更关键的那句话紧跟其后:模型的真实能力比我们现在看到的高得多,问题不在模型,而在"没有试得够狠"。这是一句不留情面的判断,也是整场对话的底色。
Alex Zhang 是 MIT 在读博士,因 Recursive Language Models(RLM)的研究被更多人认识,同时也是 GPU Mode 社区的核心成员之一。他与 Latent Space 主持人 swyx 的这次对谈,从他最早一头扎进 GPU 编程的经历讲起,顺着 KernelBench、AI 生成内核代码这条线,牵出一个这段时间被反复验证的现象:当算力和模型都已经触手可及时,真正稀缺的东西变了样。
1. 一场无聊的实习,催生了一个社区
Alex 第一次接触 GPU Mode(当时还叫 CUDA Mode)纯属意外。他在 Snapchat 实习时负责 Rexus 项目,"我当时对 Rexus 感到非常无聊",于是转头去研究能不能给 Google 那篇 Infinite Attention 论文写专用内核。项目本身没做出什么结果,但他因此认识了 Mark Saroufim 和社区里一批后来深度绑定的人。
这个由 Mark Saroufim 和 Jeremy Howard 在 2023 年创立的 Discord,起初只是一个教人写 GPU 内核的学习社区,办讲座、答疑。真正让它脱胎换骨的是 Mark 提出的 Popcorn 项目——也就是今天大家看到的排行榜雏形。驱动这个想法的直觉很简单:GPU 编程和竞技编程(competitive programming)高度相似,优化手法的空间出奇地小,值得被优化的内核种类也并不多。如果能像 Codeforces 那样积累百万级的问题库,GPU 内核的开发也可以被规模化、自动化——KernelBench 正是从这个想法里长出来的。
这件事对研究者的意义被 Alex 点得很直接:像 Mamba 这样的论文,必须随论文一起放出配套内核,否则这篇工作在实践中根本用不起来,而不是所有团队都配得起一个专职写内核的人。
2. GPT-5.6 把内核效率提高到足以让 Luna 便宜 80%,但排行榜第一名靠的不是它
GPU 编程这个领域的饱和速度超出了 Alex 的预期。他还记得 2023 年在普林斯顿听 Tri Dao 讲 Flash Attention 时的震撼——那时候写内核还是一件极度小众的事。而现在,"几乎所有人都在写内核",用他的话说,这个领域在某种意义上已经接近饱和。
最近的大新闻之一,是 GPT-5.6 写出的内核效率提升明显,让 Terra 和 Luna 相关负载的成本降低了 80%。与此同时,GPU Mode 排行榜上也出现了不具备任何内核写作背景的人,靠自动化研究循环刷新纪录。看上去,人类专家的壁垒正在被迅速填平。
但排行榜本身揭示了另一面。社区里一位长期活跃、被公认为"超强内核写手"的成员 Gaurst,这次也用上了 AI 辅助——但他只是去引导、推动 AI 往特定方向走。结果是:在排行榜前十名里,只有他的方案在实际端到端系统里保持稳定,而且代码行数明显更短。GPU 内核一直存在验证难题,奖励黑客(reward hacking)从 KernelBench 发布起就是老问题,很多看似更快的方案根本经不起真实系统的检验。
3. 一个人的直觉,能抹平一万亿 token 的暴力搜索
这不止是 GPU 内核领域的特例。Alex 把这个观察扩展到更广的 AI 系统:即便是最近的数学证明类工作,也不意味着数学家被淘汰——那些公司仍然雇佣数学家,不管是做数据标注,还是去引导模型解决问题。懂行仍然有巨大的 alpha。
这种 alpha 具体是什么?Alex 的回答是几种能力的混合:对问题的直觉、拆解问题的方式,以及知道怎么把这套直觉转译给 AI 去执行。他举了自己的习惯做例子——写代码之前先画图,图里有看不懂的地方就停下来搞懂,否则不允许往下走。懂问题的人同时也更懂怎么用 AI,因为他们本质上在扮演一个"强验证者"的角色。
真正让他觉得重要的是这句判断:"有时候你可以在一个问题上烧掉一千亿甚至一万亿 token,但如果找来一个真正懂这个问题的人,他们能帮模型发现一些东西,直接抹平那一万亿 token 的消耗。"这个趋势具体怎么量化,他承认并不清楚,但现实世界里还有大量问题等着被解决,没有人能负担得起对每个问题都无限制地堆算力——效率仍然是这件事里极其重要的一环。
4. 物理极限算得出来,但没人能保证够得到
对话的最后一段,落回到一个更基础的问题:GPU 内核的性能有没有一个可以用物理定律直接算出来的"正确答案"?Alex 的回答是——有,但计算过程不总是简单的。对矩阵乘法这类任务,可以相对容易地估算出一个"光速"级别的理论上限:假设数据传输、内存布局等条件都是理想状态下,最快的内核能跑多快。
但这个估算本身依赖一堆假设——数据是从 CPU 出发,还是已经在 GPU 的 DRAM 里,都会让这个理论数字发生偏移。更关键的是,Alex 补充了一句不留余地的判断:在很多情况下,根本不清楚这个理论上限是否可能被实际达到,因为它预设了完美的重叠调度和数据传输,而现实系统很少能做到这一点。
对话到这里被截断,但线索已经足够清晰:AI 写代码的速度和规模正在指数级增长,可它离那条"光速"曲线还有多远,答案往往不在模型里,而在真正懂问题的人手里。
