每当谈到AI基础设施,话题几乎总是落在GPU和TPU上。The New Stack近日与Arm公司的Bhumik Patel以及谷歌的Mo Farhat展开对话,聚焦那块鲜少登上头条的芯片——CPU,以及随着AI从聊天机器人向智能体演进,CPU为何正变得越来越重要。
Farhat在谷歌计算引擎负责Axion和基于Arm的虚拟机产品管理,他告诉The New Stack:"CPU扮演的角色,或多或少就像一个空中交通管制员。"
在本期对话中,双方探讨了从对话式聊天机器人向自主智能体转变的过程中,CPU如何悄然成为这场变革的核心叙事。
Farhat表示:"如今60亿到80亿参数的模型,表现比过去好得多。"他指出,对于部分专项工作负载,CPU可以达到约每秒25个Token的处理速度,这对于智能体工作负载而言已经足够。
早期的聊天机器人只是返回一个回复,而智能体则能够付诸行动——它们通过调用工具来执行任务,必要时还会创建环境来运行自己生成的代码。
Farhat说:"智能体工作负载的编排框架本身,是一种始终在线的分支控制流逻辑,而这正是CPU所擅长的。"
他还指出,大语言模型通常运行在加速器上,但CPU同样承担着编排、数据预处理、语义搜索和向量数据库等任务。
Patel在Arm主导云与AI方向的软件生态工作,他表示公司正专注于在规模化场景下运行这些工作负载所需的软件与基础设施层。他指出,不同类型的智能体在执行"不同类型的代码执行、API调用以及典型CPU任务"。
当然,CPU也有直接运行模型的场景,但这里指的是体量非常小的模型,包括摘要生成器、推荐器和评估器。
"如今60亿到80亿参数的模型表现比过去好得多,"Farhat说,"对于某些专项工作负载,CPU可以达到约每秒25个Token的速度,这对于智能体工作负载已经足够。"
代码执行环境的安全隔离
要让智能体执行代码,就必须提供一个安全隔离的环境,确保不会危及生产系统。
"智能体在执行代码,你需要确保大语言模型生成的代码是可信的,"Patel说,"如果不可信,就需要对运行环境进行沙箱隔离。"
谷歌为此推出的方案是gVisor——一个开源项目,在应用程序与宿主操作系统之间充当隔离层。Farhat表示:"我们运行在零信任环境中,这正是智能体运行所需要的隔离技术存在的原因。"
谷歌还表示,GKE Agent Sandbox能够支撑智能体时代所需的规模。"GKE Agent Sandbox将允许客户以每秒每集群300个沙箱的速度启动环境,"Farhat说。Patel则表示,该平台利用Pod快照和预热的挂起环境池,帮助客户快速扩展,而无需将所有环境始终保持完全就绪状态。
Axion的性价比优势
谷歌表示,Axion处理器在成本和能效方面均具备优势。
"Axion目前可以为你提供与同类现行代际虚拟机相比高达两倍的性价比,"Farhat说,"同时能效还能提升60%以上。"
谷歌提供两种Axion机型:面向持续高性能需求的C4A,以及在性能与成本之间寻求平衡的N4A。对于计算密集、运行时间长且完成时间至关重要的工程任务,Farhat推荐C4A;而对于注重密度和成本的小型代码执行任务,则推荐N4A。
"谷歌云的好处在于,正如Mo之前提到的,你有C4A用于高性能工作负载,也有N4A,"Patel说,"当你需要扩展大量智能体,而不同类型的智能体在执行不同类型的代码执行、API调用和典型CPU工作时,N4A非常契合。"
Farhat还从更宏观的视角指出,随着智能体规模持续扩大,CPU、GPU和TPU资源将继续协同运作。
"我们处于一个流动计算的世界,"他说,"我们确实建议客户综合考量所有选项——基于CPU、TPU还是GPU——确保应用程序具备面向未来的扩展能力。"
Q&A
Q1:在智能体工作负载中,CPU具体承担哪些任务?
A:在智能体场景中,CPU主要负责编排控制流逻辑、数据预处理、语义搜索和向量数据库等任务。由于智能体需要持续运行、处理分支判断和工具调用,这类控制流逻辑正是CPU的强项。此外,CPU还可以运行60亿到80亿参数的小型模型,如摘要生成器、推荐器和评估器,在某些专项工作负载下可达每秒约25个Token的处理速度,满足智能体任务需求。
Q2:谷歌的GKE Agent Sandbox是什么,有什么作用?
A:GKE Agent Sandbox是谷歌提供的智能体代码执行隔离环境,基于开源项目gVisor构建,在应用程序与宿主操作系统之间设置隔离层,确保大语言模型生成的代码在零信任环境中安全运行,不会危及生产系统。它支持每秒每集群启动300个沙箱,并通过Pod快照和预热挂起环境池实现快速扩展,无需所有环境始终完全就绪。
Q3:谷歌Axion处理器的C4A和N4A机型有什么区别?
A:C4A和N4A是谷歌基于Axion处理器推出的两种虚拟机机型。C4A面向需要持续高性能的计算密集型任务,例如运行时间长且对完成速度要求高的工程作业;N4A则在性能与成本之间取得平衡,更适合需要大规模部署智能体、注重密度和成本效益的代码执行任务。整体而言,Axion可提供同类现行代际虚拟机最高两倍的性价比,并具备60%以上的能效提升。
