大语言模型的Token成本正在下降,但整体AI工作负载的费用却在上涨。

Gartner研究预测,尽管Token成本到2030年将下降95%,但智能体工作流的推理成本在未来两年内将增长逾五倍。原因在于,随着大语言模型日趋复杂,AI应用开发者正在使用更多、且往往更昂贵的Token。Gartner将这一现象称为"推理悖论"。

Gartner分析师Will Sommer与Sabine Zimmerhansl在报告中指出,"创新速度正在超越成本下降曲线","市场正被Token价格下降的幻觉所迷惑"。买家危险地假设,随着AI服务商改善Token经济性,这些节省将体现在其产品路线图中,但事实并非如此。

分析师指出,AI无疑能创造巨大价值,在许多常规任务上往往比人类更出色、更高效。智能体也能更快速地识别跨孤立系统的规律。例如,Gartner观察到客户成功智能体将响应时间缩短了99%。

然而,随着AI的演进,Token用量不断增加,且Token的价值并不固定。具备推理能力的高级AI智能体,在单项任务上的成本已比基础AI聊天机器人高出多达150倍。

简单的聊天机器人只需读取并理解请求,快速给出"概率上合理"的答案;而智能体随着能力的提升,必须思考、质疑,并在出现问题时灵活应对,且越来越多地在后台持续、无感知地运行。

分析师写道:"它们需要在没有人工介入的情况下验证结果的准确性,还需要与其他智能体进行通信。"

这一切都需要消耗更多资源。随着日益自主的智能体"集群"相互触发和调用,Token消耗量呈指数级增长。分析师指出,在用户获得最终结果之前,这已产生了"巨额推理税"。

报告显示,训练具备高级推理能力的中等规模智能体模型,其硬件成本是训练同等规模简单聊天机器人的2.5倍;智能体的推理成本是后者的5倍;处理同等任务时,智能体所需的Token量是聊天机器人的5至30倍。

分析师表示:"试想一下,当数百个智能体每小时各自执行数十乃至数百项任务时,成本将如何急剧膨胀。"随着智能体将复杂问题拆解为多个子任务、调用高阶模型并处理多模态数据,成本持续飙升。

分析师指出:"这些能力所需的计算量令人叹为观止。"

为分析智能体系统的影响,Gartner基于多种训练与推理场景构建了一个Token经济学模型,涵盖不同架构设计(层数、大语言模型作为评判者或混合专家模式)、技术改进、硬件规格及数据、基础设施、能源、人力等多项成本因素。

该机构对12种不同能力的AI模型进行了测算,发现基础工作流的成本约为每推理Token 0.05美元;摘要与知识检索约为0.10美元;较复杂的工作流约为0.30美元;规划与学习约为0.40美元。这意味着,规划与学习任务的服务商Token成本是基础工作流的8至10倍。

Sommer与Zimmerhansl认为:"成本的上升不可避免,而随着成本上升,价值能否同步增长并无保证。每一代新技术的投资回报率都将来之不易。"

Gartner建议,企业可以通过开发和维护复杂的多模态系统来严格管控Token成本,同时需要建立衡量已完成工作流的投资回报率与改进效果的方法。

编排能力将成为差异化竞争的关键,"推理分层"将提升成本效益与性能。Gartner建议企业构建能将查询路由至最具成本效益模型的系统,并默认阻止智能体在简单任务中调用前沿模型。采用基于用量的定价模式也是重要一步,即从固定计算费用转向按需扩展的分层计划。

Sommer与Zimmerhansl补充道,企业可以考虑强制推行持续更新周期。他们建议"将每次模型发布视为一辆'新车',从第一天起就开始贬值",并内置数据微调与自学习反馈循环。

开发者还应为AI执行设定最低标准:预先定义成功阈值、风险缓解措施及合规开销。分析师强调:"在针对Token价格波动和合规费用进行压力测试之前,拒绝批准任何部署方案。"

此外,Gartner还建议将"每结果价值"嵌入产品规划。这意味着要求每项AI功能都能预测并追踪其支出与"明确结果指标"(如自动化任务数量或成功解决的案例数)的对应关系,从而识别需要改进或下线的低效工作流。

分析师指出,投资回报率"完全可以实现",但需要在复杂工作流中付出大量努力,企业不能简单依赖传统系统和工作流。他们强调:"默认使用通用自主智能将导致成本无限制地攀升,其量级远超优化后的产品生态系统。"

Q&A

Q1:什么是"推理悖论"?为什么Token便宜了,AI成本反而更高?

A:Gartner提出的"推理悖论"是指:虽然单个Token的价格在持续下降,但由于AI智能体工作流需要消耗大量Token,整体推理成本反而大幅上升。智能体需要思考、验证、与其他智能体通信,并处理多模态数据,这些操作都会消耗远超普通聊天机器人的Token量,导致总成本不降反升。

Q2:AI智能体的成本比普通聊天机器人高多少?

A:差距相当显著。具备推理能力的高级AI智能体,单项任务成本可比基础聊天机器人高出多达150倍。在硬件训练成本上,智能体模型是聊天机器人的2.5倍;推理成本是5倍;完成同等任务所需的Token量是聊天机器人的5至30倍。当数百个智能体同时运行时,成本将进一步呈指数级膨胀。

Q3:企业应该如何控制AI智能体带来的高额成本?

A:Gartner给出了几项建议:一是建立"推理分层"机制,将简单任务路由至低成本模型,避免默认调用高端前沿模型;二是从固定计算费用转向按用量计费的定价模式;三是为每项AI功能设定明确的结果指标,追踪投资回报率;四是在部署前对Token价格波动和合规成本进行压力测试;五是建立持续的模型更新与自学习反馈机制。

Computerworld