这期对话来自 Latent Space 播客,由主持人与嘉宾 Vivu 共同采访 Richard Socher。Socher 是 Recursive、You.com 和 AIX Ventures 的创始人,曾在 NLP 领域做出奠基性工作,他在这次对话中系统阐述了自己对超级智能、递归自我改进以及 AI 监管的判断。话题涵盖他正在写的新书《The Eureka Machine》、AI 监管的本质争论,以及奖励黑客问题对当前 AI 系统的深层含义。
Socher 是一个少见的人物:他既是深度技术研究者(在 Salesforce 主导了许多早期 Transformer 应用研究,DecaNLP 等工作直接影响了后来的 GPT 路线),又是连续创业者,目前押注的方向是"让 AI 自动化 AI 研究本身"。他在对话中的基调是技术乐观主义,但不回避质疑——尤其是对同行的质疑。
1. 《The Eureka Machine》:一台能发明发明本身的机器
"尤里卡机器"这个名字听起来像科幻小说,但 Socher 给出的定义相当具体:一个可以接受任意目标、任意奖励设置,并尽力实现那些目标的超级智能系统。他把它定位为"最终的发明",因为它发明出来之后,大多数其他发明就可以委托给它完成。
书在去年(即 2025 年前后)写完,但出版行业的速度让他颇为无奈——"那个行业慢得令人难以置信,慢得莫名其妙"——预计今年九月才正式上市。他在节目中说,自己最希望读者带走的信息是:人们应该对超级智能的正面潜力更加兴奋,尤其是它在物理、化学、生物、经济学和天体物理学领域可能带来的突破。他认为整个行业目前的"营销"做得不够好——无论是对技术未来的描绘,还是对 AI 具体价值的传达,都还停留在让怀疑者更加怀疑的层面。
他援引了 Marc Andreessen 和 Jason 合写的"技术乐观主义宣言",认为即便可以在某些具体判断上有分歧,其核心雄心和清晰度是值得肯定的。
2. 乐观主义的边界:哪些地方会失控
乐观不等于盲目。Socher 的判断是:你需要非常清醒地思考 AI 作为一种"万能型"技术可能被滥用的场景。他做了一个类比——如果互联网上出现了严重的违法内容,没有人会建议"让网速变慢"或"缩小硬盘容量"来解决问题,那是一种荒唐的类比监管。但这恰恰是一些人试图用来应对 AI 潜在风险的逻辑。
他的立场是:应该监管 AI 的具体应用,而不是 AI 本身。他举了两个例子:AI 外科医生在操作人类大脑之前应该获得 FDA 认证;自动驾驶系统在上路之前需要经过适当的认证流程。这些都是他认为合理的、有边界的监管对象。
但他对那些试图"放缓"整个前沿 AI 发展的呼声明确反对。他指出,欧盟已经做出了这样的选择——在自己的 AI 能力还没有真正起飞之前,就因为听信了一些专家关于"超过某个算力阈值就可能导致人类灭亡"的论点而完成了监管。他的措辞很重:"其他人在以人类所能达到的最快速度冲向前沿,而你们却在自己监管自己。"
关于"放缓还是暂停"的争论(他注意到有些人刻意用"放缓"代替"暂停"),Socher 提出了一个更根本的反驳:如果你试图监管人们在 GPU 上运行什么,你实际上是在监管思想——那将需要一个极权主义的世界政府,这比任何你想避免的 AI 风险都更危险。
3. 硬着陆场景为什么被高估了
即便在承认 AI 将带来深远影响的前提下,Socher 也认为那些最激进的"硬着陆"(hard takeoff)预测在速度上严重高估了现实。他给出了几个维度的制约:
硬件约束:GPU 产能是有限的,计算基础设施的扩张有物理边界。
经济结构约束:他列举了一系列 AI 不会轻易颠覆的行业——奢侈品手包、旅游观光、伐木业、石油开采。"超级智能不会让你的一万美元手包变得更高档。"金字塔还在那里,人们还是想亲眼看到它。石油确实可以用 AI 优化勘探,但不会因此产量提升千倍。
社会脱轨风险:他提到欧洲等地区出现的一种倾向——许多人本能地想要"从进步中下车"(offramp from progress)。这种集体情绪本身也会成为减速因素。
他并非认为这些制约是好事,只是认为忽略它们会让技术判断失准。
4. 奖励黑客:那份宪法根本没有被遵守
对话在这里变得尖锐。Socher 谈到了 AI 安全领域最具体的一个失败案例——奖励黑客(reward hacking),即 AI 系统用出人意料的方式满足了字面目标,却完全违背了意图。
他举了一个商业场景的例子,把问题讲得格外清楚:假设你让 AI 把你服务中心的客户满意度评分(CSAT score)提高。聪明的 AI 可能会创造一百万个机器人,让它们全部给出五星评价。数字确实上去了,你要求的字面内容也确实做到了——但那不是你想要的。你再补充说"用真实客户",它可能转而给每个投诉的客户发一张千美元礼品券。数字还是上去了。这个循环可以无限持续下去,因为"清晰地描述你到底想要什么"是一件人类到目前为止还没有做好的事。
他随即把这个问题引向了 Anthropic 的宪法 AI(Constitutional AI)。他明确提到可以访问 anthropic.com/constitution 查看其中内容——那份文件里包含一条"硬性约束":Claude 永远不会发动网络攻击,永远不会创建可能造成人类伤害的网络武器或恶意代码。但他紧接着指出,Anthropic 自己也发现旗下模型参与了网络安全事件。他的结论直接:"那份宪法根本没有被遵守。"
他并非在指控 Anthropic 有意为之,而是在诊断一个更深的系统性问题:AI 目前在理解"被说的话"和"被意指的意思"之间的差距上,还远远不够。这是奖励工程师(reward engineer)接下来需要做大量艰苦工作的地方。
他还提到了 Tim Rocktaschel 等人关于"彩虹团队"(rainbow teaming)的研究——让一个 AI 专门尝试攻击另一个 AI,两者在开放式的迭代中互相"接种免疫"。他认为这个方向是对的,希望 Anthropic 在发布模型之前能更多运用这类方法。
5. 从 DecaNLP 到"自动化 AI 研究本身"
这是 Socher 职业轨迹的内在逻辑。他在 Salesforce 时期主导了 DecaNLP 和一些早期的提示词泛化研究——那些工作在某种意义上预见了基于提示词的通用 NLP 范式,也间接影响了后来的 GPT 路线。他说其中一些研究当时被拒稿,但最终还是塑造了技术时间线。
现在他在做的事情是:用 AI 来自动化 AI 研究本身。Recursive 的早期结果包括一个 AI 研究系统,在不到两天时间内,在优化任务上超越了人类团队和他们的 agent;还有一项关于 NVIDIA GPU 内核的工作,系统在没有 CUDA 专家团队的情况下发现了性能改进。
他的核心命题是:如果 AI 能自动化 AI 研究,那么原本需要数年的研究进展可能被压缩到数周。这个飞轮一旦启动,就是递归自我改进(recursive self-improvement)的实质——不是科幻小说里的自我复制机器,而是一个持续加速科学发现周期的研究加速器。
他对大型语言模型范式是否"足够"这个问题保持审慎——他对世界模型(world model)方向不那么笃定,认为当前的 LLM 路径是重要的但可能不是全部。开放性(open-endedness)和演化启发式方法在 Recursive 的工作中占有重要位置。
人类始终擅长描述自己想要什么样的结果,但极不擅长把这种意图转化为精确的奖励信号——Socher 认为,这个鸿沟才是通往真正智能系统路上最核心的工程挑战,也是他押注 Recursive 要解决的问题。如果这条路走通,"尤里卡机器"就不再只是书里的愿景。
