ChatGPT让迪奥戈·阿尔梅达感到心碎。
阿尔梅达曾是OpenAI的研究员,他参与打造了这款聊天机器人,随后又发明了基于人类反馈的强化学习(RLHF),这项模型训练技术或许是当前AI时代最重要的推手。但尽管ChatGPT能力出众,他仍感到失望。
“我们手握瓶中闪电,但它却没什么用处,”阿尔梅达对TechCrunch表示。“从那时起我就一直在解决这个问题。我花了很长时间才得出结论:问题在于我们一直在为人类语言做优化……过去四年我们在人类语言方面做得非常出色,但这对自动化没有用处,因为计算机说的是另一种语言。”
两年前,阿尔梅达离开OpenAI,创办了TypeSafe AI,试图解决这个问题。本周,该公司发布了一款基于Transformer的新模型Jev,它不是大语言模型。它不输出文本,而是生成概率,也就是该公司所称的“校准决策”。
摒弃语言这一做法带来了几个好处:模型变得极其便宜且快速,而且由于用户提前定义了输出结果,它不会产生幻觉。其输出Token是免费的,输入Token按十亿计量收费,而非百万。
开发者对这款产品表现出极大兴趣;由于需求过高,该公司一度失去了通过API为用户提供服务的能力。Jev似乎在软件自动化方面最为有用。目前看来,软件开发者将其视为一种更便宜、更稳健的方式,将智能融入他们的代码中。
举例来说,构建智能体基础设施的公司Vercel的软件工程师普拉尼特·夏尔马表示,他所在的公司曾使用OpenAI的ChatGPT Luna 5.6运行分类器来审查命令安全性。当Vercel用Jev替换OpenAI的Luna后,获得结果的速度快了5到18倍,且准确率更高。
另一位开发者、Bryo AI首席技术官尼基尔·穆德霍尔卡则将Jev与Gemini在商业邮件分类任务上进行了对比测试。在他的测试中,Gemini的准确率略高,但成本却贵了10到20倍。让穆德霍尔卡更感兴趣的是Jev的置信度分数——“它是唯一一个能返回真实概率的模型,这使它非常适合用于自动化工作流程!!”
除了在某些应用场景中替代大语言模型外,这款新模型还可以对其进行增强,充当对不当行为的智能检查机制。使用智能体来监控智能体可能很快就会变得昂贵,但阿尔梅达认为,使用Jev来做这件事是合理的。他预见用户会部署Jev来追踪大语言模型智能体的运行轨迹,并防止越狱行为。
“归根结底,它把幻觉问题在某种程度上转移给了用户,”开源模型框架Pi的开发商Earendil的首席技术官阿明·罗纳赫解释道。“用户必须自己判断,好吧,如果这个结果只有50%的概率,那可能就是一半一半,我就不采纳它。但如果是95%,那当然,我就可以据此采取行动。”
罗纳赫表示,Jev的另一个潜在用途是模型路由。预测某项特定工作负载是否需要特定模型会很有用,但用大语言模型来完成这项任务成本高昂。而Jev的低成本和高速度使这种实时分类成为可能。
这正是阿尔梅达所期望的。该模型以19世纪经济学家威廉·斯坦利·杰文斯命名,他提出的同名悖论描述了商品成本下降如何导致其使用量不断增加的现象。在这种情况下,智能成本的下降应会带动其广泛部署。
“我们认为,智能软件将会以一种涌现式、分布式的方式无处不在……这更像是早期的互联网,而不是人们现在正试图打造的那些超级应用,”阿尔梅达说。
阿尔梅达对该模型的架构守口如瓶,外部观察者猜测它是构建在某个开放权重的大语言模型之上。该公司将Jev称为“系统一模型”,专注于直觉而非推理,并特别聚焦于正确的任务。阿尔梅达表示,Jev完全使用合成数据进行训练,采用了他所称的“基于校准决策的强化学习”技术。
“我们早期就下了一个赌注,认为我们将自己生成所有数据,这是我一生中做过的最好的赌注之一——在我看来,比我们的发布更好,比RLHF更好,”他对TechCrunch表示。“我们公司的一半,本质上是一个实验室,完全掌控着这个统计学意义上被充分理解的合成数据子领域,这现在是我人生的乐趣所在。”
目前,Jev在这类模型中还是独一无二的存在,但罗纳赫预计,随着其实用性显现,竞争者将会纷纷涌现。
“从很多方面来看,我们本应更早看到这一点,但大概是因为大语言模型如此便宜且有补贴,你往往还不需要发挥创造力,”他说。
TypeSafe自身也将打造更多新模态的模型版本。当被问及TypeSafe是否算是一家前沿实验室时,阿尔梅达表示,“前沿实验室的主要产品是恐惧或炒作。我希望我们的主要产品是智能……[但我们]不是那种意义上的实验室,你知道的,比如押注于无限财富,或者一种宗教,或者在数据中心里打造上帝,或者当下流行的任何那种东西。”
Q&A
Q1:Jev是什么?它和大语言模型有什么区别?
A:Jev是TypeSafe AI公司开发的一款基于Transformer的新模型,但它不是大语言模型。它不输出文本,而是输出概率,即“校准决策”。由于用户提前定义输出结果,Jev不会产生幻觉,且运行成本极低、速度极快。
Q2:Jev能用来做什么?
A:Jev主要用于软件自动化场景,比如审查命令安全性、分类商业邮件等。它还可以用来监控大语言模型智能体的运行轨迹、防止越狱行为,以及进行模型路由,判断某项任务是否需要调用特定模型。
Q3:Jev的成本和速度相比其他AI模型如何?
A:根据开发者测试,Jev在替代OpenAI的Luna模型后,结果获取速度快了5到18倍,准确率更高。与Gemini相比,虽然准确率略低,但成本便宜10到20倍,且能返回真实概率分数,更适合自动化工作流程。
