人工智能基础设施的下一阶段将不再由单一的图形处理单元、芯片架构或模型所定义。算力、内存、网络、封装、电力和软件正在融合成一种新的系统架构,而主权问题正是这一转变的必然结果。
半导体行业正进入人工智能建设的新阶段,我认为市场仍然低估了这种架构变革的深刻程度。
在生成式AI发展的最初几年里,讨论的焦点集中在加速器上。GPU是稀缺资源,英伟达公司成为AI基础设施周期中最具代表性的企业,人们最关心的是能获得多少GPU以及能多快部署它们。
那是第一阶段。
而我现在看到的是,重心正从芯片本身向外扩散。
AI基础设施的讨论正迅速转向系统层面:中央处理器、GPU和定制XPU;内存与高带宽内存;横向扩展与纵向扩展网络;芯粒;先进封装;光学器件;散热;软件;电力;以及最终作为庞大计算机运行的整个园区。
AI工厂正在变成计算机。
而当这一切发生时,半导体的经济性、竞争格局乃至地缘政治影响也随之改变。
最近我有机会聆听了几位业界领袖的见解,这些年来我曾与他们进行过深入访谈,包括超威半导体公司首席技术官马克·佩珀马斯特、博通公司半导体业务负责人查理·卡瓦斯、三星电子的保罗·赵,以及OpenAI集团的硬件负责人理查德·何。这次讨论聚焦于未来几年半导体生态系统可能呈现的面貌。
我的收获并非来自某一份具体的路线图,而是在于:AI正在迫使整个行业重新设计计算机,与此同时,AI本身也开始重塑计算机的构建方式。
从GPU时代到异构AI工厂
单一处理器架构能够统治一切的观念,正越来越难以与AI工作负载的发展方向相符。训练、推理、检索、智能体以及日益专业化的企业级工作负载,各自具有截然不同的计算特性。
佩珀马斯特认为,通用型CPU和GPU并不会消失。相反,模块化架构和芯粒技术使半导体供应商能够在保留通用基础的同时,创造出针对特定工作负载的变体。AMD多款Venice系列设计就是这种方法的体现,其中包括越来越多针对新兴智能体工作负载定制的配置。
而在另一端,则是定制加速器。
卡瓦斯将XPU定位为一个主要面向少数在超大规模上运营的前沿AI公司的市场。这一区分十分重要。
定制芯片不仅仅是设计一款更好的芯片,它还需要足够的工作负载量、软件栈自主权和可预测的需求,才能摊销开发成本。这正是超大规模云服务商和前沿模型公司深入布局芯片领域的原因。
谷歌公司凭借张量处理单元做到了这一点。亚马逊云科技拥有Trainium和Inferentia。微软拥有Maia。Meta平台公司持续投入其内部加速器战略。而OpenAI如今正通过与博通合作的Jalapeno推进自己的架构。
OpenAI对此给出了近乎完美的解释。理查德·何表示,Jalapeno是围绕对前沿模型至关重要的"内核、内存移动、网络和服务模式"进行优化的。
这就是全栈优化。
AI基础设施的前沿正从购买芯片转向围绕工作负载设计系统。
内存跃居首位
我们分析中最强烈的趋势之一是,内存需要在计算机架构设计流程中前移至最初阶段。历史上,架构师通常可以先设计好计算系统,再配置合适的内存层级。
而AI颠覆了这一假设。庞大的参数量和数据移动量意味着,内存带宽、容量、功耗以及与计算单元的物理接近程度,正日益决定系统性能。
讨论的焦点集中在逻辑、内存与封装的协同设计上,包括HBM认证和3D集成内存,而不是将这些要素当作独立的采购决策来对待。
赵近期对这一转变的描述简洁而精准:"内存不再是AI基础设施中的配角,它正在成为设计的核心。"我认为这一判断完全正确。AI基础设施的竞赛已不再仅仅是算力的竞赛。
它正在演变为一场数据移动的竞赛。
每一次信息在电路板、机架或数据中心之间传输,都会消耗时间和能量。这正是我们看到计算、HBM、先进封装与高速互连日益激进地走向集成的原因。
这也解释了为何内存供应商突然在AI价值链中占据如此重要的位置。如果说AI基础设施的第一个瓶颈是加速器,那么HBM和先进封装则证明了瓶颈是会转移的。
而它还将继续转移。
瓶颈的时钟不断转动
这是我思考已久的一个主题:不存在永久的AI瓶颈,只存在一个不断转动的瓶颈时钟。
GPU变得稀缺,产能随之响应。接着HBM变得稀缺,封装受到制约,网络承受压力,Transformer与电力容量成为限制因素。然后散热、土地和审批环节又相继进入这一方程式。当一个约束被解决,压力便会转移到AI工厂的其他环节。
半导体行业正在攻克先进封装和大尺寸基板这两个日益关键的制约因素,与此同时,内存认证、3D集成和热管理都正在成为架构层面必须考虑的问题。这对科技行业和投资者而言都是一个重要的转变。
仅仅关注GPU出货量,对于判断AI基础设施究竟能多快投入运行,所能提供的信息越来越有限。真正相关的问题变成了:整条供应链究竟能以多快的速度交付一个可运转的智能生产单元?这是一个截然不同的衡量标准。
电力成为架构的一部分
接下来是电力问题。佩珀马斯特强调,电力是未来AI系统的核心制约因素之一,这也是芯粒、2.5D和3D封装、光子技术、热管理以及软硬件协同优化变得如此重要的原因。
其规模是巨大的。行业正从单机架思维转向以吉瓦为单位规划集群和园区。讨论中提到,训练环境可能消耗数吉瓦电力,未来的园区甚至可能迈向5到10吉瓦的规模。
在这样的规模下,将这些设施仍称为"数据中心"已开始掩盖其真实本质。它们是工业系统。传统数据中心消耗电力以运行应用程序,而AI工厂则消耗电力、数据和芯片来"制造"Token与智能。
这改变了经济模型。电力实际上成为智能生产的一种投入要素:电力→算力→Token→智能→经济价值。因此,每瓦性能成为AI时代的核心衡量指标之一,这本质上是一个经济学问题。当你的计算单元开始以吉瓦为单位消耗电力时,哪怕几个百分点的效率提升,也会转化为巨额资本。
AI开始设计下一代AI工厂
但也许最引人入胜的发展正发生在更深的一个层面。
AI不再仅仅是运行在半导体基础设施之上的工作负载,它正开始帮助设计半导体基础设施本身。
OpenAI的Jalapeno项目开发就是一个早期例证。团队以惊人的速度从初始设计推进到量产流片,其中AI模型被用于加速部分设计和优化流程。OpenAI表示,该项目将从设计到量产的周期压缩至大约九个月。何对这一影响的描述十分精彩:"这些模型正在为我们的工程师赋予超能力。"
但他同时补充了一个同样重要的限定条件:工程师仍然主导这项工作,并对最终决策负责。这正是我预期将在各技术领域出现的模式。
AI并不会取代半导体工程师,而是扩展了工程师可以探索的设计空间。以前因耗时过长而无法评估的架构方案变得可行,验证周期得以压缩,软件开发得以加速,物理设计优化得以改善。
这由此形成了一个引人瞩目的反馈循环:AI设计出更好的芯片→更好的芯片打造出更好的AI工厂→更好的AI工厂产出更好的AI→更好的AI又设计出更好的芯片。这种复合循环所带来的影响,可能比任何单一的半导体制程节点改进都更为深远。
几十年来,我们主要将摩尔定律视为一种制造现象。而下一个时代或许会将传统的摩尔定律与某种类似"工程速度定律"的东西结合起来。那些能够运行更多设计实验、更快完成验证、并将软硬件更紧密整合的组织,甚至在下一代晶体管问世之前就已占据优势。
系统成为新的价值单元
这正是我所看到的更宏观的转变:下一波性能提升正被吸纳进系统级创新之中。
性能的提升越来越多地来自于以下要素的组合:制程技术、芯粒、定制芯片、HBM、先进封装、网络、光学器件、散热、软件以及电力工程。
换句话说,下一个十倍的性能提升未必来自某一项单一的半导体突破。
它更可能来自于对系统各部分更出色的编排整合。
这正是英伟达机架级战略如此重要的原因,也是AMD正从芯片业务向完整AI系统扩展的原因,是博通的定制芯片和网络产品组合具有战略重要性的原因,也是三星、SK海力士和美光等内存供应商日益走向架构讨论核心地位的原因。
这也解释了为何戴尔、超微、慧与以及整个系统生态系统所拥有的机遇,远不止于简单地将GPU装入服务器。总要有人来实现AI工厂的工业化生产。
随后,主权议题浮出水面
这引出了我认为将日益重要的一个次生影响。
一旦AI工厂成为具有战略意义的工业基础设施,谁来掌控它的问题便不可回避。这正是主权AI议题登场之处。第一代关于主权的讨论主要聚焦于数据驻留问题。
我的数据存放在哪里?而这越来越只是第一个问题。如果一个AI工厂依赖于外国芯片、外国内存、单一网络生态系统、单一云控制平面、单一模型供应商,或受外部控制的运营方式,那么这些依赖关系就变得至关重要。
这并不意味着每个国家都需要拥有自己的半导体工厂,也绝不意味着每家企业都应该尝试对一切进行垂直整合。主权并不等于自给自足,而是要理解、掌控并管理好关键的依赖关系。
半导体架构已经朝这个方向发展。赵强调,应在架构设计早期就纳入内存、第二供应源和合格地理区域的考量,而不是等到部署之后才发现这些依赖关系。这既是一条半导体供应链原则,同样也是一条主权AI原则。
同样的逻辑也适用于以太网的可选性,适用于定制芯片与通用芯片之间的选择,适用于能源,也适用于模型。
一个国家可以拥有数千颗GPU,却仍然无法对其智能基础设施实现有意义的掌控。这正是我要区分"GPU主权"与"AI主权"的原因。
二者并不是一回事。
竞赛正从芯片转向智能生产
我们正走向这样一个世界:AI领域的竞争单元正日益演变为整个智能生产系统。不是GPU,不是大语言模型,也不是数据中心,而是系统本身。
这正是AI工厂与主权AI的交汇之处。一方是制造智能的物理与计算系统,另一方则追问谁掌控着这一系统、其关键依赖关系以及围绕其展开的经济利益。这正是为何半导体路线图开始看起来远不止是一份半导体路线图。
AI的第一阶段是模型与GPU的竞赛。而下一阶段正在演变为一场竞赛:谁能建成全球最高效、最具可扩展性、最具韧性的智能生产系统。AI工厂正在变成计算机,而围绕谁能建造它、运营它、改进它并掌控其关键依赖关系的这场较量,才刚刚拉开序幕。
Q&A
Q1:AI工厂具体是指什么?
A:AI工厂指的是由算力、内存、网络、封装、电力和软件融合而成的新型系统架构,涵盖CPU、GPU、定制XPU、高带宽内存、先进封装、光学器件、散热系统等要素,整个园区如同一台巨大的计算机般运行,消耗电力和数据来制造Token与智能。
Q2:为什么说内存正在成为AI架构设计的核心?
A:因为AI模型庞大的参数量和数据移动需求,使得内存带宽、容量、功耗以及与计算单元的物理距离,越来越决定整个系统的性能表现。行业正推动逻辑、内存与封装的协同设计,包括HBM认证和3D集成内存,内存已从配角转变为设计核心。
Q3:GPU主权和AI主权有什么区别?
A:GPU主权仅指拥有GPU硬件本身,而AI主权则涉及对整个智能基础设施关键依赖关系的理解、掌控与管理,包括芯片、内存、网络生态系统、云控制平面和模型供应商等。一个国家即便拥有大量GPU,也可能缺乏真正的AI主权。
