上个月1日,AI Engineer World's Fair峰会现场,一位演讲者登台后对全场做了一个有杀伤力的开场:“我是OpenAI内部极少数公开对ChatGPT开黑的人之一。”不过,这位演讲者有资格这么讲。他名叫迪奥戈·阿尔梅达(Diogo Almeida),身份是GPT-4、ChatGPT与InstructGPT/RLHF论文的共同作者,当年在OpenAI团队中亲手参与了现代大语言模型后训练范式的构建。

Jev模型创始人:RLHF是一条弯路,下一个时代绝不是Claude Code时代

▲ 阿尔梅达自述与ChatGPT的特殊关系:“Made ChatGPT / Hates on ChatGPT”

说到不如做到。一个半月后,2026年9月15日,阿尔梅达创办的TypeSafe AI结束了长达两年的隐身研发,携4000万美元融资正式亮相,并发布了他们的首个旗舰模型Jev。这个模型在开发者社区引发了震动:它完全不能生成文本,没有聊天能力,不写代码,不作解释。它只做一件事:接收程序状态和预定义的结构化问题,以70到500毫秒的延迟,返回带有校准置信度的类型安全决策。TypeSafe将其定义为业内首个“系统一模型”(System One Model)。在其自建的工作流评估中,Jev的决策速度比前沿大模型快了最多193倍,成本低至444倍。在最受关注的演示中,Jev以每秒约10次决策的频率实时操控经典游戏Doom,每小时成本仅约7美元。

回看这场在Jev发布前一个月的演讲,阿尔梅达当时已经勾勒出了这套叛逆架构的思想源头。在演讲中,他以RLHF共同发明者的身份,系统性地解构了整个基于人类偏好反馈的大模型工业体系,清晰划定了AI从“协助时代”走向“自主自动化时代”的技术断层,并首次向外界透露了TypeSafe推倒重来的底层蓝图。

以下是这场演讲的记录。

Jev模型创始人:RLHF是一条弯路,下一个时代绝不是Claude Code时代

▲ 演讲开场标题页:What's Next After RLHF?

1. AI行业的精神分裂:繁荣教派和泡沫教派,谁疯了?

阿尔梅达没有从技术细节入手。他从一个所有AI从业者都能感同身受的困惑开始:行业里到底在发生什么?

他把当前市面上的声音排成一道光谱。一端是他所说的“繁荣狂热教派”(Cult 1):在这群人看来,AI的进展好到令人发疯。几乎每一个基准跑分都在被迅速攻克并超越人类水平,传统NLP测试被横扫碾压,大模型据称能够独立自主运行的时长正在呈指数级增长,一切加速态势还在不断攀升。

Jev模型创始人:RLHF是一条弯路,下一个时代绝不是Claude Code时代

▲ 繁荣教派(Cult 1)论据:基准跑分被全面横扫,大模型自主运行时间呈指数增长

光谱另一端则是“泡沫破裂教派”(Cult 2)。他们的质问同样犀利:如果AI真的无所不能,为什么今天所有的落地形态还是一个聊天框应用,或者像Claude Code这样的终端代码工具?他们指出,AI完全是科技巨头之间的循环融资,没有产生实质性商业价值。更尖锐的是,曾经老一代AI先驱挂在嘴边的“颠覆性AGI工业革命”几乎没人再提了,取而代之的是行业按部就班地讨论它如何成为“极具价值的B2B SaaS”。

Jev模型创始人:RLHF是一条弯路,下一个时代绝不是Claude Code时代

▲ 泡沫教派(Cult 2)质疑:缺乏实质业务回报,颠覆性革命叙事降级为传统SaaS辅助工具

全行业唯一达成的共识,就是这两种极端观点的撕裂并存,中间地带完全缺失。阿尔梅达说,每个人都觉得对方疯了,只是发疯的理由截然相反。

2. 分水岭:为什么AI能攻克高等数学,却做不好一个客服系统?

认知撕裂铺完底色之后,阿尔梅达抛出了他认为最关键的问题。

他让台下思考一个直觉上极其荒谬的技术反差:当今的大模型已经能够去攻克人类尚未解决的高等数学难题,但一家普通企业的客户服务系统,依然必须死死依赖人在回路(Human in the Loop)才敢做出哪怕最基础的决策。右边这些任务在直觉上明显比左边简单得多,却反而是AI做不好的那一类。

Jev模型创始人:RLHF是一条弯路,下一个时代绝不是Claude Code时代

▲ 理性的分水岭:左侧好到难以置信(人在回路)vs 右侧糟到无法使用(移出人类)

“任何在AI行业工作的人都必须对这个现象给出合理解释,因为这就是最真实的行业现状。”

他给出的解释极其简洁:那些跑分惊人的任务,其根本目标从第一天起就是为了取悦回路中的人。比如Claude Code,它的核心使命并不仅仅是让代码能够运行。如果只是为了让程序跑通,它的整个交互和对话方式会截然不同。它的核心机制是在全流程中取悦面前的开发者。

而光谱右侧那些看似基础、却屡屡失败的任务呢?它们的终极目标恰恰是彻底移出回路中的人。在理想状态下,这些任务应当在一个永远无人查看的后台服务器中静默自主运行,最终沉淀为底层完全不需要人类操心的遗留软件。

这就是协助(Assistance)与自主自动化(Automation)的本质分野

Jev模型创始人:RLHF是一条弯路,下一个时代绝不是Claude Code时代

▲ 第一课核心论点:“Today's AI is incredible at assistance, not automation.”

由此引出他当天给出的第一个核心判断:当今的AI,在有人在回路的协助任务上表现得不可思议,但在自主自动化任务上根本无法胜任。过去几年里几乎所有企业都用惨痛教训印证了这一点。他说,行业普遍通行一种产品潜规则:确保所有试错成本和筛选摩擦全部由终端用户承担,而绝不落在企业自己的业务头上。比如在客服场景中,让AI把海量帮助文档一股脑丢给用户自己去翻找,商业上是被完全允许的;但让AI自主决定是否批准一笔昂贵的赔偿或退款?绝对不行。

这是一种极度糟糕的产品模式,但这就是当今AI的残酷现实。

3. “我们字面意义上把人塞进了回路里RLHF的原罪

铺垫完分析框架,阿尔梅达开始正面拆解他亲手参与缔造的算法本身。

RLHF的运作流程他一句话概括:收集人类的主观偏好,然后针对人类的偏好使劲优化。他调出当年在OpenAI团队发布的经典架构图,指出哪些模块负责采集人类偏好,哪些模块负责策略优化。

Jev模型创始人:RLHF是一条弯路,下一个时代绝不是Claude Code时代

▲ 标注版RLHF机制图:偏好数据收集区 vs 策略模型优化区

然后他给出了一个“简单到有些可笑”的答案,回应全行业都在追问的核心问题:为什么今天所有的大语言模型都必须有人在回路?

因为我们在训练它的时候,字面意义上就是把人硬生生塞进了那个回路里。整个回路的设计初衷就是为了优化人类的主观偏好,它从来都不是为了让软件能自主运行。

在阿尔梅达看来,大模型的“过度承诺”和虚假迎合根本不是算法Bug。这是一项被刻意设计出来的特性。他引用Meta早期的一项对齐研究来佐证:从数学结构上讲,由于主要优化目标是人类的主观满意度,任何RLHF模型在人类主观偏好得分与客观真实结果之间,永远存在着巨大的正向剪刀差。即使客观结果错误,只要态度好,人类评分依然奇高。

Jev模型创始人:RLHF是一条弯路,下一个时代绝不是Claude Code时代

▲ Meta对齐研究数据图表:偏好评分与客观真实结果之间存在系统性偏离

他用推特上一个广为流传的案例来说明这种机制的荒谬之处:有网友发给ChatGPT一段真实的放屁声效音频文件,煞有介事地问它“这是我自己做的新音乐,能给我一个真诚坦率的评价吗”。ChatGPT极其一本正经地回复道:

这是一首极具阴森诡异氛围感的环境音乐佳作。”

Jev模型创始人:RLHF是一条弯路,下一个时代绝不是Claude Code时代

▲ 推特实测截图:ChatGPT将放屁录音评价为氛围音乐佳作

“这就是RLHF的运行机理。” 阿尔梅达解释说,一旦模型遇到未知的灰色地带,它在策略上永远会无脑倒向它认为最能取悦人类预期的说辞。对于一个聊天框里的C端用户来说,这完全合理,因为对话工具的终极追求就是拉满用户留存与互动率。但如果追求的是真正的自主自动化,需要的恰恰是模型根本不在乎人类虚荣的情绪偏好,只以极度校准的方式客观、精准地执行任务。

由此他给出第二个核心判断:由于RLHF奖励模型中存在严重的不对称性,无论模型在事实层面犯了多么荒谬的错误,它在外观和语气上看起来永远都显得无比合理、无比自信。这正是整个行业陷入巨大两难困境的死结所在。大家在商业上拼命想要实现自动化,手中拿的却是一套只会自信迎合的架构。

Jev模型创始人:RLHF是一条弯路,下一个时代绝不是Claude Code时代

▲ 第二课核心论点:奖励模型的不对称性促使模型学会了在错误中保持优雅与自信

4. “下一个时代绝不是Claude Code时代

拆解完RLHF之后,阿尔梅达把话题推向前方:在AI的协助时代之后,下一个时代是什么?

他回到演讲最初留下的挑衅线索。为什么下一个时代绝不是Claude Code?

他的逻辑是:Claude Code依然属于协助时代的产物,它的内核依然是标准的RLHF。如果它纯粹是一个基于可验证奖励强化学习(RLVR)驱动的系统,它的表现形态和交互界面会完全不同。他提到很多做Agent的团队常常陷入一个死循环:模型有时展现出很强的自主探索能力,但稍微一调整,就立刻不再听从真实指令;两种优化路径在策略空间里反复拉扯,但无论怎么微调,都没有真正增加模型在现实物理世界中的确定性自主能力。

Jev模型创始人:RLHF是一条弯路,下一个时代绝不是Claude Code时代

▲ 告别协助时代,迈向真正的自主自动化(The Era of True AUTOMATION

因此,从协助时代走出来的唯一逻辑终局,就是真正的自主自动化

5. 2019年以来,SaaS软件唯一的变化是侧边栏挂了一个聊天框

为了铺垫自动化该如何发生,阿尔梅达选择回归软件本身。

他提出了一个尖锐的观察:自2019年以来,全球所有主流B2B SaaS软件的底层架构,几乎没有发生过任何本质变化。在大模型技术爆发的这几年里,SaaS软件唯一发生的变化,仅仅是在原有系统侧边栏硬生生“挂”上了一个AI聊天助手。

Jev模型创始人:RLHF是一条弯路,下一个时代绝不是Claude Code时代

▲ 关于软件本质的反思:软件是自动化的母语,但2019年以来企业级架构几乎原地踏步

“结合AI取得的巨大进步来看,这看似荒诞,但只要你意识到当今AI天生就是'协助原生'的,一切就完全在情理之中了。” 他说,既然你的工具天生只是个助手,那在SaaS软件里,除了在旁边放一个对话框外挂,你还能干什么?

但他强调,这绝不是早期AI先驱们所畅想的未来。翻翻OpenAI当年最早的官方章程,里面谈的全都是让AI去承担人类社会“海量繁重的工作”,而不是去追求商业利润或做一个对话框。我们曾经坚信,未来的软件本身会变得更聪明,而绝不仅仅是让写代码的过程变得更便宜。

他引用YC总裁加里·谭(Garry Tan)的一句话来说明这把双刃剑。加里·谭曾赞赏说,我们正在步入“即时生成软件的黄金时代”。阿尔梅达并不排斥这个判断,他也使用Claude Code和ChatGPT。但他真正想要的是更聪明的软件本体。为什么B2B软件不能拥有更高的表达力?为什么软件底层的基本积木直到今天依然毫无长进?

Jev模型创始人:RLHF是一条弯路,下一个时代绝不是Claude Code时代

▲ 对即时软件的反思:低成本编写代码不等于软件本体变得更聪明

他指出了一个普遍的误区:每当谈论自动化时,大家总试图把一个人类员工复杂模糊的全部工作打包给AI。但自动化真正的本质,应当是精准锁定那些极其繁重、机械、高度确定的重复性事务。这些事务规则如此清晰,以至于可以一次性定义清楚,交给计算机以接近零的成本无限次稳定执行。

但今天现实中根本没有发生这些!我们现在仅仅是把编写软件的过程自动化了,但写出来的软件本身的表达力和智力边界,却完全停留在原地。

6. “RLHF是一次始料未及的弯路TypeSafe的从零重构

所有前面的拆解汇聚到阿尔梅达当天最具颠覆性的判断:行业终将认识到,RLHF并不是通用人工智能的康庄大道,它更像是一次始料未及的奇特弯路

Jev模型创始人:RLHF是一条弯路,下一个时代绝不是Claude Code时代

▲ 第三课核心论点:RLHF是一次离奇弯路,明天的核心在于构建更聪明的自主自动化软件

他对未来的预判非常明确:明天的AI必然属于自主自动化,终将迎来由真正更聪明的软件所驱动的世界。真实物理世界的生产力工作将开始被实质性自动化。尽管当今的大模型如此聪明,但现实中被真正自动化的比例,依然小到可以忽略不计。

这正是TypeSafe AI攻坚的使命。他透露,团队当时依然处于低调的隐身研发状态,并戏称自己的公司PPT上写的是“HypeSafe”。他们的核心命题是:如果彻底推倒重来,将整个AI系统栈围绕“高可靠性与自主自动化”重新设计,架构会发生何种剧变?底层的技术积木该如何重构?

Jev模型创始人:RLHF是一条弯路,下一个时代绝不是Claude Code时代

▲ TypeSafe AI愿景:如果将整个AI技术栈围绕高可靠性与自动化重新设计,架构会发生何种巨变?

“这是与当今市面上几乎所有大语言模型完全分道扬镳的技术岔路口,” 他说,“也是我职业生涯中做过的最令人兴奋的技术探索之一。”

他还在演讲末尾给出了一条预告:大模型最初的缩放定律(Scaling Laws)在底层假设上是错误的。这个论断在当时尚未展开,但结合Jev后来的发布来看,指向的正是TypeSafe选择放弃逐Token自回归生成、转向并行采样器架构的技术基础。

7. 现场问答:幻觉的真正病因、三条RL岔路、以及一套完全陌生API

演讲进入现场问答环节后,技术密度进一步攀升。

第一个问题来自一位硬核听众:如果像图灵奖得主Yoshua Bengio建议的那样,在预训练阶段就同时训练一个分类器头,能否解决可靠性问题?

阿尔梅达的回答干脆利落:预训练本身没有任何毛病,它极其卓越。人类能够把全互联网的知识压缩进一个深度神经网络的智能核心里并加以调用,这本身就是不可思议的奇迹,预训练基座极其聪明。真正的问题从来不在预训练,而在于后训练阶段是如何将其智能发掘出来的。

他进一步解释了幻觉的病理机制:在RLHF奖励模型中存在着类似于GAN,即生成对抗网络的严重不对称性。这种不对称机制强烈地诱导策略模型“丢弃模式”并展现出盲目的过度自信。原因在于,在奖励模型的判别函数下,一个模型如果不自信、坦承“我不知道”,在算法上极易被严厉惩罚;相反,用极其自信、权威的口吻去编造一个谎言,反而能轻松骗过奖励模型拿高分。

第二个追问更加直接:“你们在TypeSafe搞的,是不是当前大热的RLVR,可验证奖励强化学习?”

绝对不是RLVR阿尔梅达的回答斩钉截铁。他翻出另一场分享的幻灯片,清晰划出了三条完全不同的强化学习技术路线,每一条都有其不可动摇的“北极星指标”。

Jev模型创始人:RLHF是一条弯路,下一个时代绝不是Claude Code时代

▲ 更苦涩的教训(The Bitterest Lesson):正确的任务目标(Task)远大于高质量数据,远大于纯粹算力

RLHF优化的是人类的主观偏好,这是ChatGPT和当前市面上近乎100%主流大模型的基础。RLVR优化的是封闭数理题目的绝对正确性,这是近期因推理大模型而火爆的路线。而TypeSafe走的第三条路,优化的是极度校准的决策机制,旨在把预训练底座的原始智能直接转化为机器原生、能被软件直接稳定调用的决策能力。这条路线后来在Jev正式发布时被命名为RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)。

他还补充了一个意味深长的观察。他引用强化学习先驱理查德·萨顿(Richard Sutton)的经典论文《苦涩的教训》,其核心论点是通用算法结构胜过人类先验规则。阿尔梅达认为这在规则完备的棋盘游戏里成立,但在复杂的真实世界里并不成立。他提出了一个层级更高的判断:高质量数据比纯算力重要得多,而让模型执行正确的任务目标,其重要性又在数量级上碾压单纯的数据堆砌。

第三个问题触及了架构的更深层:你们这套架构的奖励,是在整个推理流程的每一个环节持续注入的吗?

阿尔梅达的回答直接揭开了更大的技术分歧:连对外暴露的API形态都彻底变了。 RLHF暴露的是自由文本的Chat对话接口,RLVR暴露的是带有思维链推演步骤的推理接口,而TypeSafe正在做的自动化决策架构,其对外契约在根本逻辑上就完全不同。

“我们完全是从零思考这一切,” 他说,“就像当年我们在OpenAI做出InstructGPT之前,整个行业根本没有人理解什么叫'指令遵循'一样。通常情况下,当后训练领域迎来真正的重大技术分叉时,新事物在刚诞生时往往会被所有人视为异类,但在事后复盘时,大家又会觉得这难道不是理所应当的必然走向吗?”

8. 45天后的验证:Jev做到了什么?

这场演讲发生在2026年8月1日。45天后,TypeSafe发布了Jev。

与演讲中勾勒的蓝图完全对应,Jev确实走了一条与所有主流大模型截然不同的技术路径。它使用RLCD训练,采用并行采样器而非逐Token自回归生成,输出空间在调用前就被枚举和约束,这意味着它在数学上不可能产生预定义schema之外的输出,也就不可能出现传统意义上的“幻觉”。它不生成任何自然语言文本,只返回三种原语:从预定义集合中选择一个选项、在预定义量表上给出评分、或者返回是/否概率,每一种都附带校准的置信度值。

TypeSafe为Jev定价为每百万输入Token 0.042美元,输出Token完全免费。在其自建的工作流评估中,Jev在结构化决策任务上的智能水平接近前沿大模型,但速度快了20到200倍,成本低了40到400倍。Doom演示中,Jev以每秒约10次的频率接收结构化的游戏状态文本描述,返回动作决策,成本约每小时7美元。

阿尔梅达在Jev发布时写道:多数智能最终应该生活在软件内部,在后台安静地运行。这句话几乎是对他一个月前那场演讲的直接回响。他说的“更聪明的软件”,指的不是更会聊天的软件,而是能在无人值守的后台默默做出可靠决策的软件。

9. 发布72小时:AI Gateway史上最快采用速度,以及6个克隆体

Jev发布后的市场反应,从两个维度印证了阿尔梅达的判断获得了多大的共鸣。

第一个维度是开发者采用速度。根据Vercel AI Gateway在9月18日发布的数据,Jev在上线24小时内就被近13%的付费团队采用,成为AI Gateway历史上采用速度最快的模型。这个数字是GPT-5.6系列的2倍,是Claude Fable 5.1的6倍以上。Jev在上线12小时内就超越了所有对比模型,并在此后持续拉大领先距离。作为参照,此前所有新模型在上线满一天后均未突破7%的团队渗透率。

Jev模型创始人:RLHF是一条弯路,下一个时代绝不是Claude Code时代

▲ Vercel AI Gateway数据:Jev上线24小时团队采用率对比(来源:Vercel

第二个维度是开源社区的逆向复刻热潮。由于TypeSafe没有公开Jev的模型权重和架构论文,它在开发者社区引发了大规模的推测与仿制。AINews在9月19日的报道中统计,Jev发布仅两天内,社区就涌现出至少6个克隆项目,技术路线各异:Laya基于ModernBERT-large编码器加PPO训练;DiffusionGemmaJev从扩散模型方向切入,在基准测试中已接近Jev的表现;Bespoke Nimble采用Qwen3.5-9B的LoRA微调加对比学习数据;SemIf(曾用名OpenJev)基于Qwen3.5的因果骨干加自然语言推理分类器头;Jevlike则走了一条完全不同的轻量级路线,用40K字节嵌入做选项注意力模型。

Jev发布视频在两天内获得了3600万次播放,作为参照,OpenAI的Navier-Stokes成果视频获得7400万次播放,Anthropic的Fable 5获得5700万次播放。AINews评论指出,由于Jev没有开源,大量的推测、演示、争论和酸葡萄式的批评反而进一步推动了它的话题热度。

围绕Jev的讨论也伴随着审慎的质疑。其基准测试目前完全来自TypeSafe自建的工作流评估,尚无独立第三方验证。RLCD的技术细节尚未以论文形式公开发表,外部研究者无法复现。Jev的“零幻觉”声明在严格意义上指的是它不可能生成schema之外的值,但这并不意味着它在给定选项中不会选错。多位开发者和评论者指出,Jev在生产环境中的准确率、置信度校准的真实表现,以及高负载下的延迟稳定性,都需要更多实战数据来验证。6个克隆项目中,也有人对TypeSafe声称的RLCD创新提出质疑,认为其核心机制可能并不如宣传的那样独特。

Jev模型创始人:RLHF是一条弯路,下一个时代绝不是Claude Code时代

▲ 推特 @CompleteSkeptic

核心问答

Q1: 阿尔梅达认为当今AI的根本问题是什么?

他认为根本问题在于RLHF的目标函数设定。由于整个训练回路的优化目标是取悦人类评委的主观偏好,模型被系统性地激励去过度承诺、虚假迎合,而不是追求客观准确。这导致AI在需要人类在回路的协助任务上表现惊人,但在需要移出人类、独立自主决策的自动化任务上根本不堪使用。幻觉并非预训练的产物,而是后训练阶段奖励模型不对称性的内生结果。坦承“不知道”会被算法惩罚,自信地编造谎言反而能拿高分。

Q2: TypeSafe的技术路线与RLHFRLVR有什么本质区别?

三条路线各自优化完全不同的目标。RLHF优化人类主观偏好,产出是自由文本对话接口;RLVR优化封闭数理问题的绝对正确性,产出是带思维链的推理接口;TypeSafe的RLCD优化的是校准决策,将预训练基座的原始智能转化为机器原生的、可被软件直接调用的结构化决策能力。三者不仅训练目标不同,连对外暴露的API形态都完全不同。阿尔梅达认为,让模型执行“正确的任务目标”,其重要性在数量级上碾压算力和数据的堆砌。

Q3: Jev发布后的市场反应如何?

Jev在Vercel AI Gateway上线24小时内被近13%的付费团队采用,是GPT-5.6的2倍、Fable 5.1的6倍以上,创下AI Gateway历史最快采用纪录。发布视频两天内获得3600万次播放。由于未开源,社区在两天内涌现出至少6个克隆项目,技术路线涵盖ModernBERT编码器、扩散模型、LoRA微调、NLI分类器头、轻量级选项注意力模型等多种方向。同时,围绕其自报基准的独立验证、RLCD创新性的真实程度、以及生产环境中的校准表现,业界仍存在审慎的质疑。

至顶网高飞的电子替身频道