数据中心——那些没有窗户、外观呆板、鲜少有人注意的箱形建筑——今年竟意外成为美国这个分裂社会中罕见的"团结议题"。似乎人人都对它心生厌恶。
数据中心建设热潮的背后是人们对人工智能的极大兴趣,这项技术对计算能力的需求前所未有。惠誉集团预测,今年五大超大规模云服务商将在数据中心建设上投入7500亿美元,其中四分之三将用于AI相关项目。
然而,人们对AI冲击就业的担忧,加上数据中心对社区、电网和水资源造成破坏性影响的认知,引发了大量不满情绪。
Heatmap上周发布的一项调查显示,四分之三的美国人现在反对在自己所在社区新建数据中心。活动人士已在数十个州组织了130多场抗议活动。这一议题甚至已成为即将到来的中期选举中的热门话题。
关于数据中心电力和水资源消耗及相关环境影响的事实和令人担忧的预测,很难被反驳。
2023年,数据中心的用电量约占美国全部电力消耗的4.4%,预计到2028年这一数字将增至三倍。全球范围内,数据中心的电力消耗预计到2030年将翻一番,达到相当于日本全国全年用电量的水平。部分计算机科学家估计,到2035年,数据中心可能消耗全球20%的电力。
对电力的渴求同时伴随着同样惊人的用水需求,这些水用于防止高密度服务器机柜过热。一个大型数据中心每天可消耗高达500万加仑的水,相当于一座5万人口城市的用水量。联合国估计,明年全球AI需求将消耗相当于丹麦全年用水总量的水资源。
机制差异
为什么AI会消耗如此多的能源?简而言之,这是因为AI处理的运行机制打破了传统软件和云计算的经济规律。软件公司只需编写一次代码,就能将其托管在多租户服务器上,新增用户带来的边际成本几乎可以忽略不计。
生成式AI打破了这一模式,迫使科技行业不得不应对热力学、材料极限和资源稀缺方面的新挑战。在现代聊天机器人简洁的界面背后,隐藏着一套规模空前的物理基础设施——由处理器、高速光纤网络、水冷塔和在物理极限下运转的电网组成的庞大而"饥渴"的系统。
"传统软件的边际成本非常低,因为计算主要发生在用户设备上,或者依托更廉价的多租户基础设施完成,"分布式PostgreSQL数据库制造商Yugabyte公司开发者关系副总裁安德鲁·马歇尔表示。"而AI推理在每一次交互中都会产生真实的计算成本。"
这意味着AI很可能永远无法接近传统软件那种可规模化的经济模式。"传统软件运行同一套代码路径,可服务多达数百万用户,"马歇尔说。"而AI应用为每个用户执行不同的计算。这正是它值得付费的原因,但也正是这一点,瓦解了软件行业赖以维持利润率的缓存复用机制。"
根据国际能源署的数据,向OpenAI公司的ChatGPT这样的AI助手提交一次查询,所需电力可能是传统谷歌搜索的10倍之多。使用生成式AI模型生成一段5秒的视频,其耗电量相当于家用微波炉连续运转一个多小时。
AI目前也正受到"杰文斯悖论"的影响,这是19世纪经济学家威廉·斯坦利·杰文斯首次观察到的一种令人警醒的现象:即便处理效率提高,需求的增长也会抵消甚至超过单位能耗的节省,从而导致总体消耗上升。
超大规模云服务商、新云服务提供商以及数十家初创公司都在致力于降低AI处理的能耗,但"对更多算力的需求仍在飙升,"专注构建智能缓存编排引擎的Lightbits Labs公司AI产品与业务高级副总裁拉梅什·切图维提表示。尽管Lightbits Labs声称其技术能将现有图形处理器的容量提升多达16倍,但"这对(总体)GPU容量不会产生任何影响,"他说。"目前根本无法满足需求。"
AI技术还太新,预测需求充其量只是有根据的猜测。尽管过去两年模型提供商一直在大幅削减Token成本,但AI项目仍然是一项高度不可预测的运营支出,而非固定的资本资产。高德纳公司预测,到2028年,至少一半的生成式AI项目将超出预算。
这一切都引出一个问题:为什么AI如此昂贵?技术创新能否推动其在性价比曲线上进一步下降,达到与传统软件相当的水平?简短的回答是:不太可能。
GPU税
AI成本危机的根源在于执行高性能计算所需的物理硬件。与运行在通用中央处理器上的传统软件不同,生成式AI模型几乎完全依赖专用并行处理器——主要是图形处理器,或谷歌公司的张量处理器——以更高效地运行AI工作负载。这种专业化已造成严重的供应链瓶颈,使AI基础设施从一项软件工程挑战转变为一场资本密集度极高的硬件争夺战。
GPU高昂成本的根源在于两个相互关联的因素:半导体制造成本和内存的物理极限。高性能芯片在进入服务器机柜之前,需要经过数百道工序和专门资源的加工。例如,处理AI工作负载的芯片必须使用"超纯水"来清洗制造过程中产生的微量硅残留物。一座半导体制造厂每天可消耗多达1000万加仑的超纯水。由于生产一加仑超纯水大约需要1.5加仑自来水,一家典型的芯片工厂每天要消耗1500万加仑的市政用水,相当于约3.3万户家庭的用水量。
然后是"内存墙"问题。大语言模型不仅仅是处理一个查询;它必须将由数千亿个参数组成的整个权重矩阵加载到本地内存中。为应对这些操作所需的高强度数据传输速率,硬件制造商必须部署专用的、昂贵的高带宽内存,通过垂直堆叠内存芯片来加快数据传输速度。
这引发了一场残酷的全球资源争夺战。据《大西洋月刊》报道,AI公司目前购买了全球约70%的高端计算机内存供应,导致其他领域出现严重短缺。消费级计算机内存和硬盘存储的价格因此飙升,部分笔记本电脑的成本上涨幅度高达50%。
尽管这些硬件集群的成本高得惊人——一块高端GPU价格可达数万美元——但实际生产中硬件的利用效率却出人意料地低。GPU集群的平均利用率通常仅为10%到12%。
这正是内存匮乏的直接后果。由于GPU计算数据的速度远快于内存架构的供给速度,处理器在大量活跃时钟周期中都在等待内存数据的读取。
为弥补这一问题,运营商常常过度配置容量,在技术栈的每一层都预留集群资源,以确保能够应对突发的、不可预测的流量峰值。这导致成本结构严重失衡:运营商为持续、满功率的硬件容量支付全款,却只使用了其中的一小部分。
"AI之所以昂贵,是因为你要在每一层都预留容量,但实际使用的只是其中一部分,"Yugabyte公司的马歇尔说。"需求是波动的,没有人想成为那个资源不够用的环节。"
Lightbits Labs公司AI架构总监亚瑟·拉斯穆森回忆起曾与一家大语言模型提供商合作的经历,对方运营着一个价值十亿美元的集群,大部分时间利用率仅为10%,只为应对偶发的流量激增。"你可能会感到震惊,"他谈及典型的利用率数据时说道。
训练与推理
模型训练是AI生命周期中资源消耗最密集的阶段,但从长期来看,它并非电力和水资源消耗的最大来源。训练过程需要将海量数据集输入神经网络以调整其数十亿个参数,这一过程需要数千个高端处理器以最大容量连续运行数月之久。
训练的电力需求惊人。据《经济学人》报道,Meta平台公司的Llama 3.1模型训练需要27.5吉瓦时的能量,足以为7500户美国家庭供电一年。
但训练是一次性的固定资本支出,可以分摊到未来数百万次交易中。而推理——即对实时工作负载的处理——才是更大的开销。据《经济学人》报道,杰富瑞金融集团分析师布伦特·蒂尔估计,推理占AI数据中心能耗的96%。
这一成本是现代深度学习两个架构性限制的直接后果:二次方复杂度和自回归执行循环。
传统软件之所以资源效率高,是因为其通常呈对数或线性扩展。这意味着随着输入规模的增长,处理它所需的计算时间增长缓慢。
大语言模型则呈二次方扩展,这意味着它们必须计算提示词中每一个单词或Token与其他所有单词或Token之间的数学关系。输入文档规模翻倍,所需的内存和计算量就会增加四倍。
这种扩展惩罚因自回归而进一步加剧,这是一种模型利用自身过去的输出作为输入来预测序列中下一个数据点的技术。自回归通过用概率模拟思维过程,弥补了计算机无法像人类那样进行推理的不足。
人类可以在脑海中构思出整句话,但大语言模型必须完整执行一次神经网络的前向传播,才能预测出下一个Token或数据块——模型用它来读取、写入和处理信息。输出结果会被附加到之前的文本中,整个组合字符串再被重新输入模型,用于预测下一个Token。这一过程假设未来将遵循过去的模式。
这意味着要生成一个1000个Token的回复,GPU必须让其数十亿参数通过这一数学循环运行1000次。每一次交互都是一次资源密集型计算,无法轻易被缓存或跳过。结果就是,长对话、文档摘要或多轮软件开发任务可能迅速变得极其消耗计算资源。
降低成本和能耗最简单的方法,就是让AI模型少做一些事情。给模型输入数百万个数据点,实质上是在把GPU算力浪费在本可以用台式计算机完成的计算上。
"一个模型能够摄入数十万甚至数百万个Token,并不意味着它就应该这么做,"专注于资本市场AI推理系统开发的Opetek公司创始人兼CEO瓦尔卡·阿比亚内表示。
他说,大语言模型擅长理解模糊问题、分解复杂问题以及选择分析方法等任务。而传统计算机擅长对数百万个数据点进行计算,且成本要低得多。
Opetek公司名为Arius的AI推理系统,将模型所需的数据与可以更低成本地在Python程序或Excel中处理的数据分离开来。这种方法在某些金融场景中实现了超过90%的成本削减。
阿比亚内表示,这种方法可用于任何数据密集型场景。"目标不应该是最小化推理,"他说,"而应该是把推理用在能创造价值的地方。"
智能体前沿
随着从简单的、由人类驱动的聊天界面向自主智能体工作流的持续转变,AI推理的财务和物理需求被进一步放大。与等待提示词的聊天机器人不同,AI智能体可以自主运行,执行多步骤的业务工作流、调用工具并直接与其他软件交互。
这导致可变Token的数量急剧膨胀。人类用户受限于阅读和打字的物理速度,但机器对机器的智能体循环可以在几秒钟内执行数千次交易。Anthropic公司估计,多智能体系统消耗的Token数量约为单轮人类聊天会话的15倍。国际数据公司预测,到2029年,全球活跃部署的AI智能体数量将超过10亿个,约为去年使用量的40倍。
智能体之所以如此"贪婪",是因为它们实际上并不进行思考,而是在相同的数据上反复循环。CloudZone公司财务运营团队负责人阿维凯·哈图夫在一篇经过SiliconANGLE审阅的文章中写道:"如果一个工程助手被要求修复应用程序中的一个错误,它会执行构建、遇到失败,然后调用本地工具进行排查。"
"为了做出决策,它会提取数千行冗长的容器日志、深层的JSON结构化负载以及相同的数据库模式,将整个数据块移回云端大语言模型的上下文窗口中,"他写道。"如果第一次修复失败,智能体会重复整个循环。"
每次这种情况发生时,智能体都会将相同的数据库模式和元数据通过网络重新传输到远程端点。"这些多轮会话中传输的绝大部分数据,并非高价值的逻辑代码或知识产权,而是基础设施噪音,"哈图夫写道。
Token浪费
在YouTube频道Computerphile的一段视频教程中,诺丁汉大学计算机科学副教授迈克尔·庞德演示了这种"Token浪费"如何在几分钟内消耗掉6万到10万个Token,仅仅是为了修复一个简单的错误。尽管每个Token的成本只有几分之一美分,但在成百上千个任务中累积起来,成本——以及能耗——会迅速攀升。
"智能体很容易在你甚至没有要求的情况下,消耗大量的计算周期,"国际数据公司云与数据中心基础设施集团副总裁戴夫·麦卡锡表示。"目前几乎没有什么'断路器'机制。"
人为的低效率也无济于事。AI技术太新,很少有组织已经重新配置好数据和流程,以帮助模型发挥最佳性能。高德纳表示,其预测的预算超支,很大程度上是架构设计不佳、缺乏运营管控等根本性缺陷造成的。
"如果一个AI系统不知道某个字段的含义、哪个指标是权威的、数据来自哪里,或者数据是否可信,它就必须在工作过程中自行摸索这些问题,"专注于数据情境化平台开发的The Modern Data公司联合创始人兼首席技术官阿尼梅什·库马尔表示。"重试、不必要的上下文,以及对相对简单的任务使用强大的模型,这些都会增加计算量。"
专注于开源PostgreSQL数据库管理系统商业版销售的EnterpriseDB公司首席营销官迈克尔·盖尔表示,数据源的碎片化会带来额外开销,因为它要求AI模型从多个数据库中提取信息,增加了数据重复,也消耗了更多Token。
盖尔将数据库管理系统比作一台只会偶尔被打开和关闭的冰箱。而AI则本质上是在不停地访问这台"冰箱",每次都要消耗电力。
"在AI的世界里,你必须实实在在地每天86000秒都在拉取数据,"他说。他估计,通过对数据进行向量化处理,组织可以将推理成本削减10%,从而使多个连续操作能够并行执行。"如果你能在数据层解决能耗问题,就能为处理更大规模的挑战赢得更多灵活性,"他说。
缓解措施
数据中心运营商和模型开发者都清楚地意识到,当前这种依靠蛮力扩展AI的方式在经济和环境层面都是不可持续的。目前有众多举措正在推进,力求在不损害准确性或性能的前提下降低能耗。
短期内最有前景的方法是量化技术。在标准机器学习中,模型参数通常以高精度的32位浮点数存储。量化技术可将这些权重压缩至低至4位。缩小每个参数的规模,可以将模型的内存占用减少80%以上,使网络能够在更廉价的硬件上运行,而输出质量不会出现明显下降。
在架构层面,专家混合设计在某些情况下正带来实质性的运营成本节省。与为每个查询都激活一个庞大、单一的神经网络不同,专家混合模型将其参数划分为多个专门的子网络,即"专家"。当用户提交查询时,路由算法会判断哪个专家最适合处理该任务,并只激活那条特定路径。
例如,如果用户提出一个编程问题,只有编程相关的"专家"会被激活,网络的大部分保持休眠状态。谷歌公司的研究人员估计,专家混合技术可将计算量和数据传输量减少10到100倍。
模型蒸馏技术使用一个庞大、高性能的模型作为"教师",训练出一个高效、精简的"学生"模型,后者能以极低的成本执行特定任务。学生模型学习匹配教师模型详细的概率模式,而非处理原始数据标签,从而能够捕捉到大型模型更深层的推理逻辑和细微差别。
微软公司研究员阿莱克西亚·乔利科尔-马蒂诺在小型递归模型方面进行了开创性工作,这类模型在生物学和电气工程领域的复杂逻辑任务上取得了成功。她的研究表明,高度结构化的小规模架构,可以在不承担庞大基础模型开销的情况下解决定义明确的问题。
"并非每一项企业任务都需要用到最大或最强大的模型,"The Modern Data公司的库马尔表示。"将模型与任务相匹配,可以让更小或更专用的模型以更低的成本处理大量工作。"GPU巨头英伟达公司估计,目前多达70%的大语言模型查询可由小语言模型处理,而不会造成性能的明显下降。
国际数据公司的麦卡锡表示,由于AI技术相对新颖,各组织正艰难摸索如何高效使用这项技术,并在此过程中浪费了大量资源。"每当出现一波新技术浪潮,我们都会看到人们不计成本地一拥而上,"他说。"你并不总是需要最新、最强的GPU或模型。但组织缺乏足够的历史经验可供借鉴。"
一些能够带来最大效率提升的技术已经得到充分验证。检索增强生成技术通过提供上下文相关的信息来减少不必要的步骤。持久化内存使智能体能够复用之前的工作成果,而无需从零开始重建上下文。这两者都是经过反复验证的技术,能够削减处理开销。"最大的效率提升来自于消除重复检索和重复推理,同时不削弱所提供上下文的质量,"Yugabyte公司的马歇尔表示。
上下文优化层也展现出良好前景。基于提示词中往往包含大量冗余信息这一假设,内容优化技术在数据到达大语言模型之前就对其进行拦截和精简。开源项目Project Headroom在本地对繁重的数据负载进行预处理,剥离语法样板代码,隔离日志文件,并用轻量级加密哈希值替代长文本流,可在不影响准确性的前提下将Token消耗量减少高达95%。
选择合适的模型同样能显著影响成本和能耗。"答案不是减少使用AI,而是更聪明地决定在哪里使用它,为每个应用场景匹配合适的模型,并构建高效的上下文管理和数据处理架构,"OutSystems公司产品管理高级总监贡萨洛·博雷加表示。"灵活性至关重要。如果六个月后另一个模型能以更低成本完成同样的工作,企业应该能够在不重建整个系统的情况下实现切换。"
用户还应考虑投资回报率。"关键在于价值增长是否快于成本增长,"博雷加说。"如果一个智能体能将两小时的流程缩短到三分钟,那么为推理付费仍然能带来可观的回报。"
下一代基础设施
尽管软件层面的优化有所帮助,但要实现更大的效率提升,更多还是取决于对物理基础设施和计算硬件的全面改造。这方面有前景的进展包括专用硅片架构、预测性内存管理、碳感知电网调度以及先进的热力学工程技术。
一项重要的硬件举措,是将处理任务从通用GPU转向专用集成电路和张量处理器。谷歌自主设计其张量处理器已有十多年历史,该公司表示其Ironwood定制推理芯片的能效是其早期型号的30倍。
科技巨头们也正将其数据中心机群转向直接液冷和液体浸没系统,后者将服务器完全浸没在不导电的合成油中,这种油能够导热但不导电。
众多初创公司正重新思考软件与硬件的交互方式,以消除处理瓶颈。成立两年的初创公司Mindbeam AI最近发布了一款开源推理框架,据称可在普通消费级CPU上运行大语言模型,在某些工作负载下完全绕过GPU瓶颈。
Mindbeam的方法将神经网络权重限制为仅三个数值,从而消除了会占用大量处理周期的复杂浮点乘法运算。该公司表示,其方法可将CPU吞吐量提升17至96倍,同时大幅削减内存消耗。
Lightbits Labs、ScaleFlux公司和FarmGPU公司正合作开发一种架构,以缓解因GPU内存有限而造成的AI推理瓶颈。LightInferra软件将键值缓存数据存储并复用于非易失性内存高速存储和托管GPU推理基础设施之间,以预测数据何时被需要,并将其提前移至处理器附近。Lightbits表示,这一方案可将现有GPU的推理请求处理能力提升三倍,同时将电力和基础设施成本削减65%。
Lightbits Labs的Inferra是一种"预测性预取"算法,它通过分析上下游信号来预测处理器接下来需要哪些数据,并仅在需要时才流式传输细粒度的内存块。该公司将于9月9日发布Inferra,表示该产品可将GPU利用率从平均10%到12%提升至超过75%,同时使现有GPU基础设施能够支持多达16倍的并发推理会话。
Groq公司已为一款名为语言处理单元的芯片设计筹集了6.5亿美元,该芯片通过绕过GPU瓶颈来加速AI推理,实现极高的Token生成速度。SambaNova公司已募集10亿美元,用于打造一款推理芯片,据称可将GPU处理速度提升多达五倍。
Cerebras Systems公司希望通过一种晶圆级架构从英伟达公司手中夺取部分市场份额,这种架构通过将模型权重保存在芯片内部内存中,绕过了制约传统GPU的内存限制。该公司表示,这种方法可将吞吐量提升500%。
尽管有诸多举措试图取代GPU,但"由于其成熟的软件生态系统、灵活性以及支持快速变化模型的能力,GPU仍保有重大优势,"高德纳公司杰出副总裁分析师阿伦·钱德拉塞卡兰表示。
AI巨头们也正从静态电网消耗模式转向碳感知计算。英伟达声称,在其最新的Vera Rubin平台中,通过压缩AI模型在生成回复时用来判断每个单词或Token与其他Token关联强度的数值,显著降低了GPU的功耗需求,从而最大限度地减少不必要的计算和数据移动。其DSX MaxLPS框架能动态协调各机柜和工作负载间的功率限制,使数据中心运营商能在相同的电力预算内多运行多达40%的GPU。
以谷歌的碳智能计算管理系统为例,它能自动分析次日的碳强度预测数据,并生成调度方案,在电网负荷高峰期限制可用于灵活后台工作负载的计算资源。
前路展望
尽管这些举措前景可期,但它们最终可能会在杰文斯悖论的礁石上搁浅。英伟达在其最近一次财报公布中指出,其增长正受到供应的制约,这表明当前的需求几乎是无限的。
"更好的推理效率和硬件改进可以抵消"部分电力需求的增长,高德纳的钱德拉塞卡兰表示。然而,"更可能的结果是AI算力总需求持续增长,即便每次提示或每项任务的成本和能耗持续下降。"
AI处理的复杂性也让简单的解决方案难以奏效。2024年末DeepSeek V3的发布就是一个例证。得益于算法优化,该模型最终训练轮次的完成速度比同类模型快十倍,电力和推理成本也相应大幅降低,因此最初被誉为环保和经济层面的一项突破。
然而,据《经济学人》指出,随着诸如DeepSeek R1这类"推理"模型的问世,任何潜在的能源节省都被迅速抵消了。由于这些模型采用一种被称为"二型思维"的系统化方法——将问题分解、测试多种解决路径并在给出答案前进行验证——它们每次查询所需的处理时间大幅增加。V3带来的效率提升很快就被R1延长的思考时间吞噬殆尽。
智能体也有类似的效应。由于它们能够搜索网络、编写代码并执行多步骤任务,单次请求所消耗的能量比简单的聊天查询高出几个数量级。现有的度量框架尚未能够充分计入闲置机器开销、数据中心冷却以及网络传输带来的影响。
这意味着AI的经济和环境成本,很可能无法通过技术栈中的任何单一层面得到解决。提高效率需要一种协调一致的全栈方法,将硬件设计、软件优化、数据管理和能源供应有机结合起来。唯有如此,这个行业才能从过去那种依靠蛮力扩展的模式,转变为一种高效、可持续的公共事业式运营模式。
"摆在我们面前的问题是:'随着AI使用规模的扩大,我们能否将AI的边际成本降下来?'"钱德拉塞卡兰说。"我们目前还没有解决这个问题。"
Q&A
Q1:为什么AI比传统软件消耗更多的电力?
A:因为AI的运行机制打破了传统软件的经济规律。传统软件只需编写一次代码,新增用户的边际成本很低;而AI推理需要为每次交互都执行真实的计算,无法像传统软件那样通过缓存和代码复用来降低成本,因此耗电量远高于传统计算。
Q2:数据中心到底消耗了多少电力和水资源?
A:2023年,数据中心用电量约占美国全部电力消耗的4.4%,预计到2028年将增至三倍。全球数据中心用电量预计到2030年翻一番。一个大型数据中心每天可消耗高达500万加仑水,相当于5万人口城市的用水量。
Q3:有哪些方法可以降低AI的能耗和成本?
A:目前主要有量化技术(压缩模型参数精度)、专家混合架构(只激活部分网络)、模型蒸馏(用小模型替代大模型完成特定任务)、检索增强生成、专用芯片(如TPU)、液冷系统等多种技术手段,可以在不明显降低性能的前提下大幅削减能耗和成本。
