英伟达拥有全球最庞大、最复杂的供应链之一,其表现从晶圆产出到首个Token生成全程都受到衡量。这段流程分为两部分:从硅片离开晶圆厂到整机系统运抵数据中心的时间被称为"上架时间";此后涉及电力、冷却、网络以及让基础设施在第一天就能投入生产的软件栈搭建,则被称为"首Token时间"。

英伟达Grace Blackwell NVL72平台需要来自全球数千家供应商的数百万个零部件,最终系统由数十家OEM和ODM厂商组装完成。一个机架中共有十八个计算托盘,仅其中一个托盘就需要两个英伟达Grace CPU、四个英伟达Blackwell GPU,以及三十二个HBM3e堆栈。为Vera Rubin打造的供应链规模是Grace Blackwell的两倍。CPU、GPU和内存都是关键组件,每种组件的供应状况每周都在变化,这周卡住生产的部件可能下周就变得充足。每个组件都有自己的物料清单、供应商和交货周期。将这一情况乘以机架中的每个子组件,最终呈现的与其说是供应链,更像是一道令人头疼的组合数学难题。

代工厂只有在等到所有组件到位后才能开始组装,这些组件来自三个渠道:英伟达直接供货、英伟达寄售库存,以及供应商供货。理想情况下所有组件应同时到达,但当无法同时到达时,先到的组件就要等待迟到的组件。英伟达从制造场地收到物料的那一刻开始计时,直到该物料作为子组件或产品的一部分离开场地为止,这一指标被称为"物料持有时间"(TOO)。

由于物料供应状况高度动态化,英伟达必须决定向每个制造场地分配多少物料以及何种物料,这被称为关键物料分配问题,且每周都需要人工重新调整。分配计划覆盖当前季度及下一季度,其中最近几周已经确定,因此每周新数据主要影响的是更远期的安排。

本文主要关注"上架时间",要压缩这一时间需要满足四个条件:

实时可见性,以便随时精准定位关键运营瓶颈;

冗余机制,以应对单点故障可能导致的生产中断;

可靠性,确保上游生产承诺能够兑现;

将人类专业经验转化为系统性知识,使复杂分配决策背后的判断力成为可持续积累的知识资产。

前三项要求提供了必要的运营基础,而真正带来重大变革的,是对人类专业经验的系统化转化。

在Palantir Foundry中构建供应链指挥中心

英伟达供应链运营团队与Palantir合作,为每一项影响物料分配决策的输入构建统一视图。英伟达团队将这一系统称为"数字供应链智能"指挥中心,它能够呈现风险、阻碍因素及其他为决策提供参考的信号,而这些信息此前可能分散在互不关联的数据源中,难以被发现。

在底层,Palantir Foundry提供了运营环境。其"本体"(Ontology)架构将物料、制造场地、生产承诺、产能、分配方案、生产产出以及非结构化的定性信号,整合到一个统一治理的数据层中。这一架构由对象和关联关系构成,而非传统的行、表结构,从而形成对运营实况的完整呈现。

这种呈现方式使分配规划人员能够模拟和分析多种不同场景,大幅拓宽了他们对决策空间的把握,也为构建AI飞轮奠定了基础——该飞轮能够随时间积累新知识并持续提升表现。

用英伟达cuOpt解决量化问题

跨多个制造场地分配物料首先是一个量化问题,其构建始于决策变量:在未来一段时期内,每种稀缺物料应分配多少给哪些场地、何时分配?围绕这些变量的是所有约束条件,包括每个能够组装特定Blackwell子组件的制造商及其一旦物料到位后能够消化的产能。此外还包括所有必需零部件沿供应链反向追溯形成的依赖关系图,这样求解器就能识别出一个计算托盘的瓶颈是其最稀缺的输入项,而非平均水平的输入项。这一约束瓶颈并非固定不变,它会在以下因素间转移:

GPU、CPU和内存供应状况的周度变化;

三条供应渠道的到货时间安排;

已对客户做出的承诺,这决定了任一场地出现短缺的实际代价。

数千个变量和约束条件最终会解算为一份每周分配方案。

英伟达cuOpt是一款开源的GPU加速决策优化库,正是用来解决这一问题的工具。它从"本体"架构中提取输入数据,并将结果作为分配决策写回系统。分配问题被构建为一个混合整数线性规划问题,其优化目标是最小化"物料持有时间"(TOO)。cuOpt返回的结果不仅是分配方案本身,还会报告哪些约束条件起决定性作用,让规划人员能够看出,本周分配数量受限的原因是台湾产能而非内存供应。

由于求解速度很快,规划人员还可以探索答案周边的可能性空间:如果本期内存减少百分之十会怎样?如果新的制造场地投入运营会怎样?规划人员不再只是向求解器索要答案,而是开始探询各种权衡取舍。

数学模型的局限所在

量化优化并不能说明全部问题。英伟达和Palantir对历史分配决策与实际结果进行回测,结果揭示出cuOpt未能捕捉到的人为因素。

规划人员所依据的信息,求解器根本看不到:那一周与合作伙伴往来的邮件、关键地区的恶劣天气预报或正在发生的地缘政治事件、上次供应商汇报电话的记录,以及多年积累的专业经验。这些输入共同形成了规划人员对未来一段时期该如何分配物料的直觉判断,而正是这种直觉,使人类专家的判断优于纯粹的数学模型。

基于这一认识,英伟达和Palantir围绕这些人类专家构建了工作流程,用于记录分配决策、决策背后的理由、预期结果以及实际结果。这样一来,机构性知识就转化为明确、可审查的决策逻辑,而由于这些数据存储在"本体"架构中,它们也成为训练大语言模型学习专家判断力的基础。

将决策智慧系统化

接下来,团队对一个开放权重的大语言模型进行了后训练,使其能够运用同样的推理方式给出建议。在评估了多个英伟达Nemotron开放模型后,团队选择了Nemotron 3.5 Lightning,因为它专为智能体工作流的执行层设计。它作为一个模型系统中的一部分,执行专门化任务,该系统还包括用于编排和通用任务的更大型变体模型。

其混合专家(MoE)架构有利于实现高效推理。虽然该模型体量较轻,仅有300亿参数、每次前向传播约激活30亿参数,但仍足够大,能够学习出一套聚焦的策略。这种规模使后训练循环切实可行,因为较小的模型学习速度更快,训练和部署所需的算力也远低于更大规模的模型。

由于Nemotron是开放的,可以在自有计算环境边界内完成后训练。任何组织都可以在自己的运营数据上运行同样的飞轮机制,而无需将数据暴露到外部环境。该模型从规划人员实际使用的信号中学习:某制造场地被分配了多少稀缺物料、制造商承诺生产的数量、实际产出的数量,以及决策当时可获得的定性运营证据。

其目标是系统化一套分配策略,使其能够评估生产风险、给出分配范围建议、识别该建议背后的关键因素,并向供应链团队解释其推理过程。

同一份记录也可以用作评估工具。团队用当天可获知的信息重现每一项决策,隐藏实际结果,然后将模型的建议与规划人员当时的判断以及实际结果进行对比。这一评估回答的核心问题是:如果这个模型上个月就已经在运行,它是否会做出正确的分配决策?

从"本体"数据到专业化模型

训练流程始于Palantir"本体"架构中存储的运营历史数据:

匿名化处理:NeMo Anonymizer在训练前移除个人身份信息,并对敏感字段进行模糊处理。

合成数据生成:NeMo Data Designer扩充并平衡样本数据,使模型不仅能学习常规周的情况,还能学习分配增加、产能受限和突发中断等场景。

监督微调:NeMo AutoModel训练一小部分LoRA适配器参数,同时保持基础权重不变,从而缩短训练时间、降低内存需求并减小检查点体积。

评估:基于时间点的回测将同样的历史决策分别输入基础模型和微调模型进行重现,从而分离出后训练带来的具体提升。

Palantir Autopilot负责管理整个生命周期,从"本体"数据启动每项训练任务,监控已部署的定制化Nemotron模型,并保持从数据到模型版本再到建议结果的完整溯源链条。

模型部署后,会读取当前运营环境信息,返回带有理由说明和风险提示的建议,规划人员审核后做出最终决定。

形成闭环

每一次采纳、修改、否决以及实际生产结果都会被写回"本体"架构,持续积累直至有足够的代表性数据以支撑新一轮受治理的训练。

未来,这些反馈信息将用于强化学习。被采纳和被否决的建议将形成偏好数据对,其奖励机制将涵盖分配准确性、策略合规性和证据支撑度等方面。该模型不会在生产环境中自我重新训练。

这一成果带来两方面的复合效应:规划人员用于重构常规决策的时间减少,从而能够覆盖更多场地和产品;同时,分配方面的专业经验也转化为机构性知识,缩短了新人培养周期,并在组织内部推广关键经验。

后训练带来的成效

英伟达供应链运营团队与Palantir合作,明确规定了模型接收的信息、可给出的建议类型,以及这些建议的评分方式。这一工作流程既是实际应用系统,也成为了分配决策智能评测基准。

团队在相同任务和相同评估数据上比较了三种模型:

基础版Nemotron 3.5 Lightning(BF16精度)

Nemotron 3 Ultra(NVFP4精度)

经过后训练的Nemotron 3.5 Lightning(BF16精度)

在开发评测基准上,经过后训练的Lightning模型分配决策准确率达到86.7%,Ultra达到55.5%,基础版Lightning仅为17.5%。这意味着后训练模型比Ultra高出31.2个百分点,比自身的基础版本高出69.2个百分点。

在另外两个对不同决策类型给予同等权重(而非按样本数量加权)的指标上,该模型同样领先。平衡准确率对每类的召回率取平均值,使罕见决策与常见决策具有同等重要性:后训练模型达到58.6%,Ultra为42.0%。宏观F1值对每类F1值取平均,并将精确率纳入考量,从而避免模型通过过度预测某个罕见类别来虚增召回率:后训练模型为57.5%,Ultra为39.5%。这两项指标都很关键,因为供应受限意味着规划人员削减分配的频率远高于增加分配的频率,因此单纯的准确率指标会让一个总是猜测多数类别的模型显得表现更好。

这一结果给出的启示具体而重要:在有明确边界的分配任务上,一个经过专业化训练的300亿参数模型,其表现可以超越参数规模超出其一个数量级以上的通用模型。

这并不意味着较小的模型在整体能力上更强,其优势集中体现在经过后训练的特定领域内。尽管经过微调,未来生产风险预测依然是一项难题。专业化训练提升了决策任务的表现,但并未解决与该任务相关的全部预测难题。

LoRA训练任务在2块英伟达B200 GPU上仅用几分钟即可完成,这样的训练成本足够轻量,可以随着反馈数据的积累反复进行。这正是主权AI理念的实际体现:专有的供应链数据、模型权重以及推理过程全部保留在一个受统一治理的环境内。这套AI技术栈可以部署在本地或云端,使组织能够根据自身数据、系统和运营需求,在最合适的环境中运行AI。

一条能够自我学习的供应链

本文所讨论的供应链工作流程并非半导体行业专属。任何由经验丰富的人员依据分散信号进行关键产能分配的运营场景,都可以运行同样的飞轮机制,并将其调整应用于新的领域。

这需要满足三个基本条件:

一个受统一治理的运营数据层;

包含决策理由和实际结果的决策记录机制;

一个可以在自有安全计算环境边界内完成后训练的开放模型。

运营数据训练模型,模型改进决策,决策又成为下一轮受治理训练的新运营数据。这就是英伟达和Palantir压缩从晶圆产出到首个Token生成所需时间的方式,也是这套全球最可靠的AI基础设施供应链能够比其自身增长速度更快地实现自我学习的原因。

Q&A

Q1:英伟达和Palantir合作的这套供应链系统主要解决什么问题?

A:主要解决的是英伟达复杂供应链中的关键物料分配问题。由于GPU、CPU、内存等核心组件的供应状况每周都在变化,团队需要决定如何在多个制造场地之间分配稀缺物料,这套系统结合了量化优化工具和AI模型,帮助规划人员做出更准确的分配决策。

Q2:为什么选择Nemotron 3.5 Lightning这个模型进行后训练?

A:因为该模型专为智能体工作流的执行层设计,采用混合专家架构,推理效率很高。虽然参数量仅300亿、每次实际激活约30亿参数,规模不大,但足以学习出聚焦性的决策策略,训练和部署所需的算力成本也远低于更大规模的模型。

Q3:经过后训练的模型效果到底提升了多少?

A:在开发评测基准上,经过后训练的Nemotron 3.5 Lightning模型分配决策准确率达到86.7%,而参数规模大得多的Nemotron 3 Ultra只有55.5%,未经训练的基础版Lightning仅为17.5%,说明专业化训练能让小模型在特定任务上超越大得多的通用模型。

NVIDIA