在总部位于明尼阿波利斯的支付与数据公司Deluxe,一行代码从不会直接发送给某个AI模型。它会先经过一个网关,由网关决定将其发送给哪个AI。根据该平台50多个AI智能体中正在执行任务的具体是哪一个,网关可能会将请求路由到GPT-5.6、Claude Opus、Claude Sonnet,或是一个仍在评估阶段的模型。开发者本人并不做这个选择,严格来说,IT部门也不做。
"在扩展规模之前,就要在应用程序和模型之间架设好网关,而不是等到扩展之后才做,"Deluxe首席技术与数字官Yogaraj Jayaprakasam表示。这是一条直白的建议,可以帮助企业避免事后针对每个模型分别搭建治理和安全控制体系。
大多数首席信息官已经决定支持不止一种AI模型。目前尚待厘清的是,由谁来决定哪个模型处理哪项任务,以及随着模型、工作流程和经济成本的变化,这些决策该如何演变。
谁制定规则,谁选择模型
会计与咨询公司致同(Grant Thornton)AI与数据业务合伙人Sumeet Mahajan表示,他认为模型分配其实是两个决策披着一个决策的外衣。"第一个是常设政策:批准使用哪些模型、请求如何在模型间路由、由谁承担费用,"他说,"第二个是局部的设计决策:某项具体任务由哪个模型处理。"
Mahajan说,在这方面做得好的组织中,中央平台团队负责路由层的管理。运行工作流程的业务部门则根据平台团队设定的标准,做出任务层面的决策。
Deluxe采用了类似的方法。一个AI治理委员会决定某个应用场景是否被允许,它会权衡安全、法律、合规、数据以及负责任AI等方面的规则。一旦该应用场景通过了这道门槛,对业务成果负责的负责人就会选择模型,并对结果负责。
"治理确定的是什么是被允许的,以及需要什么样的证据,"Jayaprakasam表示,"它并不充当模型选择委员会的角色。"
律师事务所Akerman的AI治理与数据保护主管Michael Adler表示,不同的团队可以为模型分配决策提供意见,但只应由一个人对此负责。他说,在最完善的架构中,技术团队负责测试性能和集成,而法律、隐私和风险团队负责设定限制。对于每一次部署,都应有一个人负责路由决策,并有权在出现问题时暂停部署。
在总部位于新罕布什尔州的车队管理与租赁公司Merchants Fleet,一个名为"人工智能就绪委员会"的机构为全公司的AI使用设定护栏。之后,业务负责人在这些护栏范围内做出任务层面的决策。首席技术与数字官Jeanine Charlton表示,其初衷是"赋能而非把关,注册登记而非反复重新审查,并根据应用场景的风险程度来施加相应力度的审查"。
公开基准测试遗漏了什么
当企业决定由哪个模型来处理任务时,成本始终是讨论内容之一,但它很少是决定性因素。
在Deluxe,有五个要素决定模型的选择:质量、风险、延迟、经济性和可运维性。权重会因工作负载而异,但经济性是最令人意外的一项。"一个更便宜的模型如果导致更多的重试、异常或人工干预,往往反而是成本更高的那个,"Jayaprakasam说。
Adler解释道:"更成熟的组织会把模型选择当作'适合用途'而非'最佳选手'来对待。"在被考虑用于某项任务之前,模型应先满足一组基础要求,涉及保密性、数据留存和合同条款等方面。他表示,只要有一项不达标,无论价格如何,该模型都应被排除在外。只有到那时,才会根据质量、故障模式、延迟以及供应商锁定风险,对实际任务进行评估。甚至围绕模型的整套配置也很重要,而不仅仅是模型本身。
致同的Mahajan建议在考虑模型之前先审视数据。
他表示,敏感或受监管的数据应只发送给企业能够自行托管或通过严格合同约束的模型。然后才是确定任务适配性的时候。
Mahajan表示,公开基准测试在不断演变,且对大多数领先模型的评分相近,它们也很容易被"刷分"。他说,一种有用的做法是,根据模型此前在生产环境中曾经失败的案例,构建一个内部基准测试,然后用它对每个候选模型进行评分。一个在公开排行榜上名列前茅、但未能通过内部私有基准测试的模型,不应被采用。
模型之间的缝隙
当一个多模型工作流程出现故障时,问题通常并非出在某一个模型本身,而是出在各个衔接处。
Adler表示,每家AI供应商都以自己的格式记录调用日志。一家可能捕获完整的提示词和响应内容,另一家可能只保留元数据,第三个系统则完全按自己的节奏处理工具调用。"结果就是日志堆积如山,却没有一份完整记录能说清究竟发生了什么,"Adler解释道。
Mahajan表示,他在事件响应中见过这种情况。然而根据致同最新一期针对950名高级IT负责人的《AI影响调查》,只有五分之一的组织拥有经过测试的模型故障应急预案。Mahajan表示,一个更大的问题在于,这些预案的设计初衷是应对单一模型的故障,而非应对多个模型在交接环节同时出现故障的情况。
解决方案是建立一份独立的记录,凌驾于供应商日志之上,跟踪一个请求所经过的每一步流转。Deluxe默认将这一机制内置于其AI网关中。换言之,治理必须跟随工作流程走,不能止步于某个模型的边界。
没有一劳永逸的决定
在Deluxe,质量、漂移和经济性受到持续监控,每次新模型发布都会触发评估。Adler建议进行两类审查:一类是定期审查,风险越高的部署审查频率越高;另一类是事件驱动型审查,在模型版本变更、发生事故,或有可信的新竞争者达到预设门槛时触发。
"更新只是测试的理由,"他说,"而不是切换的理由。"Jayaprakasam也认同,只要一个模型能持续证明自己的价值,它就能继续保有其角色。
这种持续性评估本身就是一项新工作。当一家公司只运行一个模型时,集成工作由供应商负责。而当多个模型同时在生产环境中运行时,这项工作就成了企业自己的责任。在Deluxe,这意味着需要新的技能:模型评估、智能体设计、工作流程编排和成本管理。
这也意味着两项截然不同的工作:平台团队负责构建工具和护栏;产品团队负责推动采用并对成果负责。
"模型可以更换,"Jayaprakasam说,"但对工作流程及其结果的问责不能更换。"
Q&A
Q1:什么是AI网关?它有什么作用?
A:AI网关是架设在应用程序和AI模型之间的中间层,负责决定将请求路由给哪个具体的AI模型。企业应在业务扩展前就搭建好网关,以避免后续针对每个模型分别建立治理和安全控制体系。
Q2:企业该由谁来决定使用哪个AI模型?
A:通常分为两个层面:中央平台团队负责制定标准政策,包括批准哪些模型、如何路由请求、谁承担费用;业务部门则根据平台团队设定的标准,做出具体任务该用哪个模型的决策,但责任应明确到一人。
Q3:选择AI模型时,成本是最重要的考虑因素吗?
A:并不是。质量、风险、延迟、经济性和可运维性都是重要因素。一个便宜的模型如果导致更多重试、异常或人工干预,实际成本反而可能更高,因此企业更看重模型是否"适合用途"。
