今年8月,AWS 宣布将再新增 200 万个 NVIDIA GPU。巨额算力交易接连登上头条,但在中国企业这一侧,风向正在变化:过去大家问的是有没有算力,现在更多人在问,花出去的钱到底值不值。投资回报率(ROI)和总拥有成本(TCO),正在取代算力规模,成为企业和投资者最关心的两个词。

进入推理时代,算力竞争的重点已经从买多少 GPU,转向怎么用得划算——这是 Akamai 云计算首席技术官 Jay Jenkins 给出的判断。

GPU 买回来之后,AI 推理的账怎么算

Akamai 云计算首席技术官 Jay Jenkins

账为什么算不明白

Jenkins 认为,AI 算力投入整体上仍处在效率低、试错成本高的阶段。他援引的数据显示,75% 至 95% 的 AI 投入没能转化为可衡量的财务回报,真正实现规模化正回报的企业只占 16% 到 25% 左右。

症结之一在于成本口径。不少企业把推理简单理解为购买 GPU,但在他看来,芯片只是账单的一部分,还有四笔账常被忽略。

第一笔是运营成本。数据在用户与中心机房之间往返,产生带宽费用;缺乏智能调度,GPU 就会闲置。再好的芯片,也要靠编排和服务软件才能变成稳定的吞吐。

第二笔是延迟造成的业务损失。Akamai 的调研显示,约一半的 AI 部署在高峰负载下达不到 250 毫秒以内的响应要求,直接影响客户满意度和单个访客的收入,冷启动还会进一步拉长延迟。

第三笔是合规与安全。跨境数据传输带来监管成本,API 安全、模型保护、身份访问管理需要持续投入,员工私自使用未经授权的“影子 AI”,还可能造成数据泄露。

第四笔是数据流出费用。AI 管道天然依赖持续的数据传输,从云端到用户,再到边缘设备,费用会迅速累积。Jenkins 把它列为 AI 领域最大的隐性成本之一。

算力怎么配

想把账算清楚,先要分清训练和推理。

Jenkins 建议分阶段配置。预训练需求集中、突发性强,适合集中式 GPU 集群;训练后和推理阶段要求全天候运行、分布式部署和低延迟,应优先考虑边缘或分布式,而不是把训练时的集中式架构原样复制过来。

其次,不是所有推理都需要 GPU。在 Akamai 披露的 GoVeda 案例中,业务初期 CPU 就能满足推理需求,规模扩大后迁移到 GPU,性能提升 30%,成本降低 20%。

他也反对一刀切。同样是推理,汇总长合同这类输入密集型任务(预填充型),与交互式代码或文本生成这类输出密集型任务(解码型),对内存和算力的需求截然不同,配置要分别评估。

Akamai 的解法

围绕这套思路,Akamai 在推理端的布局比较清晰:推理云把负载从核心数据中心卸载到互联网边缘,与 NVIDIA 联合推出 AI Grid,并在全球部署了面向推理和训练后场景的 RTX PRO 6000 Blackwell 服务器版 GPU。训练端,Akamai 支持训练后和强化学习等新方法,定位是与超大规模云厂商互补。

具体的降本手段有四类。一是分布式架构,节点覆盖 130 个国家、700 多个城市,接入 1200 多个运营商网络,另有 26 个核心云节点,数据不必长途回传。二是多层算力,CPU、GPU 和专用 VPU 按场景匹配。三是推理优化,除量化外,语义缓存、推测解码和基于意图的模型路由,能让昂贵的 Blackwell GPU 只处理未命中缓存的复杂任务。四是借助 AI Grid 由算法调度负载,配合边缘编排消除冷启动损耗,维持较高的 GPU 利用率。

自建还是租用

到了决策环节,Jenkins 的思路同样是分阶段。

早期、流量不稳定的企业,优先选第三方分布式推理云,小步快走完全可以,但要随着技术能力和团队 AI 素养提升,提前设计退出策略。项目达到一定规模、长期负载可预测后,可以考虑自建与云结合的混合方案,用开源模型做定制,压低长期的 token 成本,同时把硬件折旧和过时风险算进去。

评估 TCO 和 ROI,他建议盯住几类指标:冷启动、端到端延迟、吞吐量、出口流量等性能指标,成本与折旧,能源需求,可扩展性,合规性,以及生命周期管理。

下一道关:智能体与合规

智能体会让这笔账更复杂。

单个 AI 请求延迟 40 到 100 毫秒尚可接受,但多智能体系统可能产生数百个请求,累积延迟会从 40 毫秒升到 4 秒甚至 40 秒。智能体之间、智能体与 API 之间的实时协作产生大量东西向流量,通信需要部署在协调器附近;智能体全天候运行,也对基础设施提出持续的高强度要求。更棘手的是风险放大:智能体自主调用工具和数据库,一条被篡改的提示词或一次有缺陷的输出,就可能成为“万能钥匙”,传统边界防火墙看不到这类内部通信,需要工作负载级别的微隔离和边缘侧的实时 API 检测。

跨区域部署还绕不开合规。Jenkins 提到三条思路:敏感或受监管的数据在本地推理,或在边缘加密处理,避免跨境传输;用 AI Grid 调度时,把“该位置是否允许启动实例”作为核心参数,而不是只看延迟;金融等强监管行业可用 Guardicore Segmentation 结合 NVIDIA BlueField,持续满足合规要求。

从计算焦虑到计算理性,变的是评价标准:从算力有多大,转向每一分钱换来多少有效产出。Jenkins 的答案是按阶段、按场景匹配算力,并把延迟、合规和数据流出一起算进成本。这套方案能兑现到什么程度,最终还要看企业的真实负载和落地数据。

至顶网人工智能频道 作者:刘文轩