如今的大语言模型即便只是被要求给出一个简单决策建议,也往往会输出冗长的内容,由此消耗大量Token,推高使用成本。对于希望将AI融入自动化工作流的企业而言,它们需要的是更简洁的输出——一方面是因为机器在多数情况下只需要一个分类结果,另一方面是因为自动化工作流所产生的决策数量、以及由此带来的Token消耗,往往会远超以人工为主导的工作流程。

TypeSafe AI是由前OpenAI研究员、RLHF联合发明人迭戈·阿尔梅达(Diogo Almeida)创立的初创公司。该公司认为,其新推出的大语言模型Jev可以解决这一问题。Jev生成的响应结果可以被软件应用或其他AI模型直接调用,作为自动化工作流的一部分:比如调用哪个工具、下一步执行什么操作、某项请求是否应被批准,或者何时应将任务转交给另一个模型处理。

阿尔梅达在一篇博客文章中写道,Jev以任务或工作流的当前状态作为输入,返回一个明确的决策及该决策对应的概率,以简洁的响应形式呈现,而不是通过生成一长串Token、用自然语言的方式来表达答案。

他表示,除了成本更低之外,Jev的响应速度也更快,因为它不需要按顺序逐个生成文本Token,延迟范围在70毫秒到500毫秒之间,而TypeSafe测试过的大语言模型则需要数秒时间。

独立技术顾问戴维·林蒂库姆(David Linthicum)表示,这可以为IT负责人的AI预算腾出更多空间,从而支持扩展智能体相关的工作负载。

“大多数企业将通用型大语言模型当作一个万能的智能层来使用,即便某个应用场景只需要一个快速、有限范围的决策也是如此。这就好比用一整套企业级服务总线,去回答一个简单的是非路由问题,”林蒂库姆说道。

“再考虑到智能体工作流的特性——一个单一任务可能触发多次模型调用——如果每一次决策都使用通用型大语言模型,成本和延迟会迅速累积。像Jev这样能够通过概率化的函数调用来处理工作流中部分有限范围决策的模型,可以让企业把通用型大语言模型留给那些真正需要它们的环节,”他说道。

他表示,这种模型间的分工也可能减少企业团队为使通用型大语言模型适用于自动化工作流所需投入的工程工作量。

林蒂库姆表示,如今,工程师可能需要围绕通用型大语言模型搭建层层提示词、模式定义、验证、重试机制、防护栏以及异常处理逻辑,才能让其自由格式的输出结果达到足够可靠的程度,供软件系统使用。“像Jev这样能够直接输出可被软件或其他模型消费的结果的模型,可以减少工作流中许多常规决策环节所需的这类额外开销,”他补充道。

这种优势也可能延伸到开发者层面,尤其是在智能体工作流的架构设计方面。他表示,开发者不必将每一步都当作提示词与响应式的交互来处理,而是可以将一个智能体应用拆分为一系列具有明确输出结果的小型决策环节,让应用代码根据模型的响应结果来决定下一步该做什么。

博通(Broadcom)高级站点可靠性工程师阿德维特·帕特尔(Advait Patel)表示,这种方式可以让控制流程更加清晰、更易于测试,因为开发者会将更多的工作流逻辑重新放回代码之中,而不是嵌入到提示词里。

不过,HyperFrame Research的AI技术栈研究负责人斯蒂芬妮·沃尔特(Stephanie Walter)表示,这种做法也存在需要权衡的地方。

“由于Jev被设计为返回明确的决策结果,而非开放式的响应,开发者必须提前为工作流的这部分内容明确问题、可能的输出结果、判断阈值以及升级处理路径,这本身可能就是一项相当繁重的任务,”她说道。

Jev返回每个决策结果的方式,也带来了另一个需要关注的问题。

沃尔特表示,Jev会为每个决策附带一个概率值,但开发者仍然需要判断这个概率值在特定工作流中究竟意味着什么,以及它是否可以在生产环境中被信赖使用。

对于CIO而言,这可能会在评估Jev是否适用于生产环境工作负载时引发可靠性方面的担忧。

沃尔特指出,企业需要在自己的数据上验证该模型的准确性和校准程度,包括在数据随时间变化的情况下,模型的表现如何。

智能体AI初创公司Doozer AI联合创始人保罗·查达(Paul Chada)表示,具体到受监管行业的企业而言,使用Jev可能会引发关于可审计性的质疑。

“概率值可以显示模型对某个决策的信心程度,但它无法解释模型做出该决策的原因。当企业需要向监管机构或审计人员解释或证明其自动化决策的合理性时,这种区别可能会变得很重要,”查达说道。

此外,帕特尔表示,CIO还需要权衡采用一家早期供应商的专业化模型所带来的各类风险,包括安全性、数据驻留、服务级别承诺以及潜在的供应商依赖问题。

帕特尔补充道,这些担忧也延伸到了部署层面,目前Jev仅作为托管服务在单一地区提供。

分析人士指出,这些顾虑也可能会影响企业采用Jev的速度。

帕特尔表示:“企业很可能会先从内部自动化及其他工作负载入手,在这些场景中可以在不影响关键业务负载的前提下,衡量其带来的成本和性能收益。”

不过,这并不意味着企业会用类似Jev的模型完全取代通用型大语言模型。

林蒂库姆表示:“理想情况下,Jev可以与通用型模型在工作流中协同运作,由后者负责开放式的推理、总结和交互任务,前者则负责处理高频出现的结构化决策,比如路由、评分、验证、策略检查以及工作流编排等。”

目前,Jev正在为有意试用的企业开放等候名单申请。据阿尔梅达介绍,该模型的定价为每百万输入Token 0.042美元,而TypeSafe表示输出Token的成本“低到几乎无法计费”。

Q&A

Q1:Jev是什么?它和普通大语言模型有什么不同?

A:Jev是TypeSafe AI开发的一款大语言模型,专门为机器和自动化工作流设计。它会返回明确的决策结果及对应概率,而不是像普通大语言模型那样生成冗长的自然语言回答,因此响应更快、成本更低。

Q2:Jev能给企业带来哪些好处?

A:Jev响应延迟仅为70到500毫秒,远快于普通大语言模型的数秒延迟,同时输出Token成本极低。它可以处理路由、评分、验证等结构化决策,帮助企业节省AI预算,并减少围绕通用大语言模型搭建验证、防护栏等额外工程工作量。

Q3:企业使用Jev需要注意哪些风险?

A:企业需要验证Jev在自身数据上的准确性和校准程度,同时其概率值无法解释决策原因,在受监管行业可能引发可审计性问题。此外,作为早期供应商产品,还需考虑安全性、数据驻留及供应商依赖等风险。

InfoWorld