今年3月旧金山Arm Everywhere上最重要的发布就要属Arm AGI CPU。时隔6个月,Arm Everywhere来到中国,但这次Arm AGI CPU只占了其一。
因为Arm看到,受成本、隐私、时延等因素影响,越来越多计算开始向外扩散,在端侧完成。
按Arm 执行副总裁兼首席商务官 Will Abbey的话说,云端仍将是智能体运行的重要基础,但智能体的部署位置正在不断向外延伸。随着对时延、隐私和个性化能力的要求提升,一部分智能体开始走向边缘,更靠近数据和用户本身。
更进一步,智能还会进入物理世界。机器人等设备需要感知环境、理解变化,并实时做出决策和行动。因此未来的智能体不会被限定在单一环境中,围绕同一个目标,在云、边缘和物理设备之间协同运行,完成一整套跨环境任务。
这也构成了Arm Everywhere China的三条主线:边缘AI、物理AI和云AI。

边缘与物理AI:智能开始靠近人,也开始进入现实世界
边缘涵盖的设备形态非常广,从资源和功耗高度受限的小型设备,到智能手机、PC等高性能终端。随着算力持续提升,一些终端设备已经具备过去只有大型计算系统才能提供的计算能力。
这也使Arm能够横跨不同设备形态,为从低功耗终端到高性能设备提供统一的计算基础。
Arm看到,AI正变得越来越持续、分布式和个人化。推出了第二代移动终端计算子系统(CSS for Mobile 2),在单一计算平台中实现对智能体AI和AI原生图形技术的全面支持。
Arm CSS for Mobile 2集成全新Arm Mali G2-Ultra NX GPU、搭载第二代Arm可伸缩矩阵扩展(SME2)的 Arm C2 CPU集群、增强型系统 IP、物理实现方案以及开发者就绪的软件生态系统。
“过去几年,CPU承担AI工作负载的能力不断增强,SME2是其中一项重要技术。”Arm边缘AI智能终端计算副总裁James McNiven谈到,如今,大量Android设备上的AI任务已经可以直接在CPU上运行。进入智能体时代后,端侧AI的工作方式开始变得更复杂。智能体不再只是被动响应用户指令,需要同时调用多种能力、处理多个任务线程,并结合用户上下文判断下一步该做什么。
Arm C2 CPU集群结合了Arm 性能最强大的移动 CPU——C2-Ultra、面向能效优化的 C2-Pro CPU,以及双 SME2 单元。这里重点介绍一下Arm C2-Ultra CPU,与上一代 C1-Ultra 相比,其实现了高达1.7倍的AI性能提升、高达15%的单线程性能提升、在相同性能下,高达38%的功耗降低。

从一个智能体订餐案例看,当用户向设备提出“帮我计划并预订结婚纪念日晚餐”的请求时,一整套智能体工作流就已经开始执行:设备需要先理解用户意图,结合已有信息获取上下文,再判断餐厅偏好、地点和时间,并调用相应服务完成预订。CPU性能提升后,这些环节都能更快执行。在单线程性能提升的基础上,配合SME2等能力,能让整体工作流速度较上一代提升约24%。
另外就是图形技术正在被AI改变。过去GPU的升级主要围绕更快的渲染速度、更好的光照效果和更高的分辨率。现在AI能力进入GPU,神经网络可以直接参与画面生成、重建和增强,让移动终端在有限的功耗条件下实现过去难以达到的视觉效果和沉浸式体验。
纵观整个计算平台,未来并不会依赖某一个CPU或单一加速器完成所有任务,会根据不同工作负载,让CPU、GPU以及其他计算单元各自发挥作用,并在系统层面协同完成AI计算。
Arm Mali G2-Ultra NX就是面向AI原生图形推出的新一代移动GPU。它首次在Mali GPU中集成专用神经网络加速器,让神经网络计算与传统图形处理能够在GPU内部更紧密地协同运行,同时重新设计执行引擎,并引入第三代光线追踪单元RTUv3,以应对下一代移动图形工作负载。

与上一代相比,Arm Mali G2-Ultra NX基准测试性能提升24%,非AI游戏性能提升14%,DRAM流量最多降低13%。目前Mali GPU全球累计出货量已超过140亿颗。

物理AI与单纯的运行一个应用不同,物理世界对于实时性、可靠性、安全以及计算性能都有非常严格的要求。
Arm将Arm Total Design的模式进一步扩展到物理AI领域,发布了面向物理AI的Arm全面设计生态项目(Arm Total Design for Physical AI)。“从底层芯片、软件、感知、交互和最终系统,物理 AI 涉及多个环节的协同。”Arm 物理AI业务拓展副总裁Dermot O'Driscoll说道,对于希望把技术真正做成产品的企业来说,只有打通整个技术栈,才能降低集成复杂度,加快产品开发和落地。

今天不同公司对于“机器人能力”有不同定义,这让整个行业的交流、比较和系统集成都非常困难。所以机器人能力分级框架(Robotics Capability Framework)的发布则是构建机器人领域的通用语言,为定义和推动机器人系统的发展奠定基础。
云和AI基础设施:Neoverse CS与AGI CPU两条路径并进
我们再来重点说说Arm在云上的最新进展,虽然边缘AI和物理AI正在打开新的应用空间,但从当前产业发展来看,云和AI基础设施依然是人工智能运行的核心阵地。
Arm本质上是一家生态公司,自2019年推出Neoverse以来,全球数据中心已经累计部署了大约15亿颗Neoverse CPU核心。到达10亿颗大约用了六年,从10亿增长到15亿颗,只用了不到一年。
从各大云服务商选择Arm开发定制芯片就能看出,AI 基础设施正在加速向Arm架构迁移。这样既可以提高数据中心性能和计算容量,也能够降低总体拥有成本。
对大型云厂商而言,采用Arm的价值还在于能够掌握自己的芯片路线图。微软已经将Teams 等服务运行在自研的Microsoft Cobalt 100 CPU上,并针对自身工作负载加入通用CPU中并不常见的专用加速能力。按照Eddie Ramirez的说法,微软能够在18个月内迭代两代产品,AWS在七年时间里迭代了五代Graviton。相比固定跟随通用处理器厂商的产品周期,云厂商可以根据自身工作负载更快调整芯片设计。
当然,智能体时代也在改变数据中心CPU的使用方式。智能体需要7×24小时持续运行,并且一次会启动几百项操作,包括调用数百个工具、执行任务、调用 API,甚至与其他智能体交互。
在这种工作负载下,每瓦性能会变得更加重要。
“从网络设备、存储服务器、GPU系统,到通用服务器、控制系统和安全系统,不同场景都会使用CPU,但对性能、能效、吞吐和扩展能力的要求并不相同。”Arm云AI业务拓展副总裁Eddie Ramirez强调,Arm并不试图用一颗CPU覆盖所有场景,我们要做的是针对不同工作负载提供不同类型的平台。
一类产品更强调能效和设计灵活性,适合需要定制化和大规模部署的场景。另一类则面向对响应性能和扩展能力要求更高的工作负载。通过这样的产品组合,Arm希望覆盖数据中心中更加多样化的计算需求,同时让客户能够根据不同业务场景选择更合适的基础设施方案。
Neoverse CSS解决的就是帮助合作伙伴更快地设计和部署,合作伙伴不必每一次都从头进行系统集成。同时,Arm开发芯片产品的经验也会反馈到下一代CSS和IP的设计里。
Neoverse CSS让合作伙伴把创新放在真正需要差异化的地方。中国市场就有一些典型案例。部分中国DPU厂商基于Arm技术开发数据处理产品,并进入大型云服务商的基础设施体系。
DPU需要CPU与高速网络能力紧密协同,例如面向AI基础设施的800G网络,对计算、数据处理和网络传输之间的配合提出了更高要求。这就是将Arm的底层技术和合作伙伴自身在网络、系统和产品设计上的创新叠加,实现的差异化产品开发和落地。
为了让CSS 更容易适应不同设计,Arm发布了目前为止可配置性最高的Neoverse计算子系统(CSS)N4,这是一款真正面向差异化基础设施设计的 CSS,同时能够很好地支持AI时代的横向扩展工作负载。

Neoverse CSS N4单颗裸片(die)最高可搭载128个内核,支持LPDDR6内存与PCIe Gen 7互连。与Neoverse CSS N3相比,其性能最高可提升至两倍,每瓦性能最高可达1.25倍,内存带宽最高可达1.75倍。
当然定制芯片并不适合所有客户。Eddie Ramirez 提到,打造一款领先SoC通常需要投入5 亿至8亿美元。对于没有意愿或能力承担这类研发成本的企业,就不得不提3月美国Arm Everywhere的主角:Arm AGI CPU。这也是Arm两条腿走路的另一条路径,可直接部署的高性能计算平台。
Arm AGI CPU 提供了一条更低门槛的路径:无需自己完成芯片设计,也可以直接部署 Arm 架构的服务器计算能力。
随着Arm AGI CPU推出,合作伙伴也在继续增加,覆盖AI系统、边缘计算和前沿模型等不同方向。
这些合作背后,看中的既有Arm的软件生态,也有其在高性能、高能效计算上的能力。与此同时,Arm也在中国引入新的合作伙伴,进一步推进AGI CPU及相关计算服务在本地市场的部署,火山引擎就是重要的合作伙伴之一。

Arm还宣布正与新紫光集团深化战略合作,新紫光集团希望结合自身产业能力与Arm的高性能、高能效计算技术,共同面向中国快速增长的AI基础设施需求,打造具有差异化能力的产品。此前,新紫光集团旗下多家产业公司已经与Arm围绕IP授权等展开合作,此次合作则进一步延伸至Arm IP、计算子系统(CSS)以及AGI CPU等产品和技术。

双方的合作还会跳出单一产品层面。新紫光集团计划结合Arm的计算技术,以及自身在芯片设计、系统开发和AI应用等方面的能力,面向未来构建覆盖多代演进路线的AI基础设施产品体系。
与此同时,双方还计划成立联合通用人工智能创新中心,围绕AI智能体编排、CXL内存池化、机架级系统架构以及边缘AI等方向开展联合创新。新紫光集团希望与Arm共同完善面向中国市场的下一代AI基础设施底座。
从IP、CSS到AGI CPU,Arm让不同类型的客户都能找到适合自己的路径。随着智能体带来的算力需求继续增长,性能、能效和成本会越来越直接地影响基础设施选择。
对Arm来说,这也意味着新的机会正在打开。
