企业AI买家从未拥有过如此多能力强大的选择。各大实验室早期的前沿模型依然表现出色,成本却仅为最初的零头。此外还有可在自有环境中运行的开放权重模型,以及针对特定任务微调、能超越通用工具表现的小型模型。
我的第一次生成式AI部署是基于GPT-3运行的。即便技术进步止步于此,大多数机构也还有数年有价值的工作可做。
人们的本能反应仍然是确保拥有"最好"的模型,将其部署在API网关之后,把它定为官方选项,然后告诉业务部门放手去做。这种做法直觉上很合理,毕竟没有人会因为采购了最先进的技术而被追责。
在谈到跨行业的企业AI战略时,同样的问题总会出现:我们应该选择哪个模型?很多人可能会对答案感到失望。模型选择确实会影响延迟、安全性、成本支出以及使用权限。
但模型选择只是简单的部分。真正的工作在于围绕模型的一切,比如干净的数据、能发现故障的测试以及训练有素的人员。选定一个模型,然后把精力放在真正重要的事情上。
大多数企业工作并不需要前沿模型
企业AI工作负载的分布并不均衡,大致可以按90-10来划分。约90%的工作是有边界、可重复的。比如客服助手根据政策库回答问题,合同工具按照既定条款集检查协议。这些工作量大,可接受答案的范围较窄,也正是大多数公司真正想要解决的问题。
剩下的10%才是真正棘手的部分:需要对模糊输入进行多步骤推理,一些细微的错误可能数月内都不被发现的分析工作,以及在没有人工介入的情况下采取具有重大后果行动的智能体。正是这一部分工作,才配得上前沿模型的高昂价格。
常见的错误是不论什么场景都动用前沿模型,仅仅因为它是公司的标准配置,结果为那些根本不需要如此高规格的工作支付了溢价。在试点阶段,你可能感觉不到这个问题——账单金额不大,也没人关注单位经济效益。但随着采用规模扩大,我已经看到一些公司的Token成本压力剧增,而这些公司去年还认为这笔支出微不足道。
基础设施准备不足与规模化的谬误
成本还只是较小的问题。更大的问题在于,几乎没有人真正建立起能让任何模型在规模化场景下良好运行的体系,因此他们花钱购买的能力大部分处于闲置状态,即便是在那关键的10%场景中也是如此。要从先进模型中获得真正的价值,需要有明确流程和真实关键绩效指标、干净的数据、一套值得信赖的评估框架,以及懂得如何把输出从平庸提升到精准的人才。大多数企业都不具备这些条件。
单一步骤可能有95%的概率正常运行。但如果把多个步骤串联起来,出错概率会迅速累积。五个步骤各有95%的成功率,整体端到端顺利运行的概率也只有约75%,二十个步骤下来这个概率会降到36%。你可以通过重试机制、验证环节和关键节点的人工核查来挽回这种可靠性,但每一项核查都需要你自己去搭建,没有哪个更强的模型能免费附赠这些能力。
真正的制约因素在于架构
看看实际出问题的地方就知道了。客服助手自信满满地给出错误答案,是因为背后的政策文档已经过时,而且没人负责维护它。合同工具漏掉了关键条款,是因为检索环节抓取到了错误的页面。分类器的准确率卡在80%上不去,是因为从来没人明确定义过什么是正确的路由方式。这分别是所有权问题、检索问题和定义问题。用购买更大模型的方式来解决数据问题,只不过是花大价钱依然没解决数据问题罢了。
因此,要从看似枯燥、但有边界、有用且可衡量的工作开始。搞清楚你手上有哪些数据,谁拥有这些数据,数据是否是最新的,以及数据可以流向何处。根据人们实际会提出的问题来构建测试,而不是那些只在演示中显得亮眼的问题。把每一次修复都记录下来,对照一个明确的"正确"标准。没有这样的标准,判断结果是否足够好就成了一场谁都赢不了的争论。
架构与数据同样重要。将你与文档存储系统、CRM系统的连接,按照像模型上下文协议这样的开放标准来搭建,而不是绑定在单一供应商上。当更换成本很低时,模型选择就不再是一个战略性决策了。
投资员工能力与真正的战略
最后,要为人才投入资金。几乎所有这些工作都要经由员工完成——他们编写提示词、阅读输出结果,并判断哪些答案需要进一步复核。这种判断力会在成千上万次日常决策中不断积累,而这是竞争对手无法直接买到的东西。他们可以签下和你一样的模型合同,但无法绕过底层的运营经验积累过程。
模型会持续变得更便宜、更强大。但你的竞争对手也能享受到同样的折扣,这对你而言并没有带来任何优势。真正持久的竞争优势,在于你所整理并能够信赖的数据、你实际运行的测试,以及能够识别出"看似自信、实则错误"答案的人才。
Q&A
Q1:企业选择AI模型时最应该关注什么?
A:模型选择确实会影响延迟、安全性、成本和使用权限,但真正的重点在于模型之外的工作,比如干净的数据、有效的测试机制和训练有素的人员,这些才是决定AI应用成败的关键。
Q2:为什么说大多数企业工作不需要前沿模型?
A:企业AI工作负载中约90%是有边界、可重复的任务,比如客服问答或合同条款检查,这类工作用普通模型就能胜任。只有约10%涉及复杂推理或高风险决策的场景才真正需要前沿模型的能力。
Q3:多步骤AI流程为什么容易出问题?
A:因为错误概率会累积。假设单步成功率为95%,五个步骤串联后端到端成功率约为75%,二十个步骤则降至36%。可以通过重试、验证和人工核查来提升可靠性,但这些都需要额外搭建,不会随更强模型自动获得。
