AI基础设施领域的讨论几乎总是围绕GPU和TPU展开。The New Stack近日与Arm公司的Bhumik Patel以及谷歌的Mo Farhat进行了深度交流,探讨一个鲜少登上头条的芯片——CPU,以及随着AI从聊天机器人转向智能体,CPU的重要性为何正在不断提升。

Farhat是谷歌计算引擎Axion及基于Arm架构虚拟机的产品管理负责人,他告诉The New Stack:"CPU扮演的角色,大体上相当于一名空中交通管制员。"

本期内容聚焦于:从对话式聊天机器人到自主智能体的转变,正在悄然演变为一个CPU的故事。

"当今六到八十亿参数的模型表现比过去好得多,"Farhat说。他表示,在某些专项任务中,CPU每秒可处理约25个Token,这对于智能体工作负载而言已经足够。

CPU的角色:从辅助到核心

早期的聊天机器人只是返回一个回答,而智能体则能够基于回答采取行动——调用工具完成任务,必要时还能创建运行环境来执行自己生成的代码。

"智能体工作负载的编排框架,本质上是一种始终在线的分支控制流逻辑,这正是CPU的强项,"Farhat说。

他指出,大语言模型通常在加速芯片上运行,但CPU同样承担着编排调度、数据预处理、语义检索以及向量数据库等工作。

Patel负责Arm在云计算与AI领域的软件生态建设,他表示公司正专注于大规模运行这些工作负载所需的软件与基础设施层。他指出,不同类型的智能体在执行"不同类型的代码、API调用以及典型CPU任务"。

在实际模型运行方面,CPU也有用武之地,但规模较小,主要包括摘要生成、内容推荐和效果评估等模型。"今天的六到八十亿参数模型表现比以往好得多,"Farhat说,"对于某些专项工作负载,CPU可以提供每秒约25个Token的处理速度,足以满足智能体场景的需求。"

安全沙箱:让智能体安全执行代码

智能体要运行代码,就需要一个既安全又不危及生产系统的执行环境。

"智能体在执行代码,你需要确保大语言模型生成的代码是可信的,"Patel说,"如果不可信,就需要对运行环境进行沙箱隔离。"

谷歌为此提供的方案是gVisor——一个开源项目,充当应用程序与宿主操作系统之间的隔离层。Farhat表示:"我们在零信任环境中运行,这正是智能体所需要的隔离技术存在的原因。"

谷歌还表示,GKE Agent Sandbox同样能够应对智能体时代所需的规模化需求。"GKE Agent Sandbox可以支持客户每秒每集群启动300个沙箱,"Farhat说。Patel表示,该平台通过Pod快照和预热的挂起环境池,帮助客户更快地完成扩展,而无需始终保持所有环境完全就绪。

Axion的效能优势:性能与能效兼顾

谷歌表示,Axion处理器在成本和能效方面均具备优势。

"Axion目前相比同代可比虚拟机,可提供高达2倍的性价比,"Farhat说,"同时还能实现超过60%的能效提升。"

谷歌为不同场景提供了差异化的Axion机型:C4A机型面向持续高性能需求,N4A机型则在性能与成本之间取得平衡。对于计算密集型、完成时间至关重要的长时间工程任务,Farhat推荐选用C4A;对于密度和成本更为关键的小型代码执行任务,则推荐N4A。

"N4A非常适合大规模部署大量智能体的场景,不同类型的智能体执行着不同类型的代码、API调用和常规CPU任务,"Patel说。

Farhat还强调,随着智能体规模的扩大,CPU、GPU与TPU资源将持续协同运作。"我们处于一个计算资源灵活调配的时代,"他说,"我们建议客户综合考量CPU、TPU和GPU各类方案,确保应用具备面向未来的扩展能力。"

Q&A

Q1:CPU在智能体工作负载中具体承担哪些任务?

A:在智能体场景中,CPU主要负责编排调度、数据预处理、语义检索和向量数据库等工作,同时承担分支控制流逻辑,相当于整个系统的"空中交通管制员"。此外,对于六到八十亿参数的小型模型(如摘要、推荐、评估类模型),CPU也可直接运行推理,提供约每秒25个Token的处理速度,满足部分智能体任务需求。

Q2:谷歌GKE Agent Sandbox是怎么保障代码执行安全的?

A:GKE Agent Sandbox基于gVisor开源项目,在应用程序与宿主操作系统之间建立隔离层,实现零信任环境下的沙箱隔离。它支持每秒每集群启动300个沙箱,并通过Pod快照和预热的挂起环境池实现快速扩展,确保大语言模型生成的代码在受控环境中安全运行,不影响生产系统。

Q3:谷歌Axion处理器C4A和N4A机型有什么区别?该如何选择?

A:C4A机型面向持续高性能需求,适合计算密集型、完成时间要求严格的长时间工程任务;N4A机型则在性能与成本之间取得平衡,更适合需要大规模部署智能体、对密度和成本敏感的场景。总体上,Axion相比同代可比虚拟机可提供高达2倍的性价比,并实现超过60%的能效提升。

The New Stack