KV Cache的激增,足以催生出一个全新的存储市场,这是英伟达CEO黄仁勋在GTC 2026上提及的一个重要判断。

当大模型越来越大、能力越来越强,并逐步通过Copilot、智能体等形态进入企业应用,推理开始从幕后走向台前。相较于模型训练,模型推理发生得更高频、更持续,也更直接关系到企业AI应用的成本与体验。

作为全球AI产业的风向标,英伟达已经意识到,模型推理太贵、上下文管理太重,正在成为大模型规模化落地的新瓶颈。于是,在其AI基础设施技术栈中,一个以太网连接、专为KV Cache优化的闪存层被提出,也就是G3.5层。

这背后并不只是多了一层存储,而是AI基础设施的重心正在发生变化。

过去,行业习惯用GPU数量、模型参数和集群规模来衡量AI能力,但在AI工厂时代,真正决定系统产能的,越来越是数据能否快速、稳定、高效地抵达GPU。

这也意味着,存储正在从数据中心的后台容量池,走向AI算力生产线的关键位置。

对于专注于面向数据中心、云计算和AI工作负载研发存储产品的Solidigm而言,这一变化不仅意味着SSD市场需求的扩大,也意味着存储技术在AI架构中的战略价值正在被重新定义。

当推理撞上“内存墙”,Solidigm如何抓住AI工厂的新机遇?

01 AI工厂改变存储角色

传统数据中心更像通用IT基础设施。

它的任务是承载数据库、ERP、网站、虚拟化、数据分析、备份归档等多种应用,核心指标围绕稳定运行、容量管理、批量计算、多租户隔离和成本控制展开。

在这样的体系中,存储首先是数据容器。行业讨论存储时,通常谈的是容量、可靠性、IOPS、吞吐、每TB成本和数据保护。存储当然重要,但更多是后台系统,是支撑业务运行的基础设施。

但AI工厂的提出,正在悄然改变存储的角色。

什么是AI工厂?

所谓AI工厂,实则一个原生AI的生产环境,旨在以工业规模将数据转化为“智能”,通过可衡量的吞吐量持续训练、微调和提供模型服务,以确保有效的推理。

当推理撞上“内存墙”,Solidigm如何抓住AI工厂的新机遇?

它不是简单运行应用,而是持续把数据转化为模型能力、推理结果、token输出、预测、推荐和智能体行动。

它更像一条智能生产线:数据被摄取、清洗、转换、训练、微调、评估、部署,再进入大规模推理和持续迭代。

因此,AI工厂关注的指标不再只是系统是否在线,而是训练时间有多短、微调速度有多快、每秒生成多少token、GPU空闲时间有多低、每瓦能产生多少智能输出、每次推理成本能否下降。

AI工厂的核心不是单块GPU的峰值性能,而是从数据进入系统到模型输出结果的端到端吞吐,计算、网络、内存、存储、调度和软件栈必须协同运转,任何一个环节变慢,都会拖累整条生产线。

在AI工厂中,存储成为AI生产线中对性能至关重要的一个环节,不再仅仅是一个存储库。

过去,存储是“仓库”,负责把数据放好。

现在,存储更像“传送带”,必须持续、低延迟地把数据送到GPU。

接下来,存储还会逐渐成为扩展内存层,承载推理上下文、KV Cache、向量检索数据和智能体状态。

这也让企业级SSD的价值被重新审视,对于强于SSD存储技术的Solidigm而言,AI工厂并不是简单带来更多容量采购,而是让高性能、高密度、低功耗SSD开始进入AI系统的关键数据路径。

当推理撞上“内存墙”,Solidigm如何抓住AI工厂的新机遇?

与此同时,存储行业的评价体系已经悄然改变,客户不再只是问一套存储系统有多少容量、多少IOPS,而会追问:

它能否提高GPU利用率?能否降低推理尾延迟?能否提升token吞吐?能否减少数据移动带来的能耗?能否让同样规模的AI集群产生更多输出?

也正因如此,英伟达提出了G3.5层的概念。

在传统分层中,GPU HBM和系统内存负责最热数据,本地SSD承担缓存和热数据,远端文件系统、对象存储、数据湖负责持久化和长期保存。但推理负载增长后,中间出现了一个新缺口,有些数据太大,无法长期放在HBM或DRAM里,有些数据又太热、访问太频繁,不能放到远端传统存储里慢慢读取。

这个缺口,就是由G3.5层补齐,英伟达认为,G3.5层应该位于近GPU内存和后端共享存储之间,面向机柜级、低延迟、高容量的推理上下文存储,它不是普通冷数据层,也不是简单SSD缓存,而是为了AI推理中持续增长的上下文状态而设计的新型闪存层。

对存储行业来说,这意味着存储不再只为保存数据而优化,而是要为生产智能而优化。

02 推理撞上“内存墙”,高并发、长上下文成新瓶颈

在ChatGPT问世和百模大战期间,大模型基础设施的主要矛盾集中在训练阶段。

模型越来越大,训练数据越来越多,GPU集群规模越来越庞大,行业自然把注意力放在训练算力、并行通信和数据集吞吐上。

但随着AI商业化深入,推理正在成为新的主战场。

训练是阶段性的,推理却是持续发生的,每一次用户提问、每一次企业知识库检索、每一次智能体调用工具、每一次代码生成或文档分析,都会触发推理。AI应用越普及,推理负载越会以高频、高并发、长周期的方式增长。

更重要的是,今天的推理已经不再是一问一答。

在ChatGPT问世初期,大模型更像是一个聊天机器人,一个提示词可能对应一次模型调用,到了Copilot和智能体阶段,一个请求可能被拆解为理解任务、检索资料、调用工具、生成中间结果、反思修正、再次调用模型,最后输出答案。一次用户交互背后,可能产生数十次甚至上百次的模型操作。

当推理撞上“内存墙”,Solidigm如何抓住AI工厂的新机遇?

这让模型推理场景呈现出四个鲜明特点:

第一,高并发,企业级AI服务需要同时响应大量用户、应用和智能体任务,单个会话看似不大,但汇聚到系统层面,就会形成巨大的上下文工作集;

第二,长上下文,模型要处理更长文档、更长对话和更复杂任务,KV Cache随之膨胀,它保存模型生成过程中可复用的中间状态,可以减少重复计算,但也会持续占用内存空间;

第三,小IO高频读写,推理上下文、KV Cache、RAG检索结果、向量索引和智能体状态,并不总是大文件顺序读写,而是大量小块数据的频繁访问;

第四,低时延刚需,推理服务面对的是实时体验,一次慢读取、一次上下文调度延迟,都可能影响token生成速度,拉高尾延迟。

这些特点共同放大了行业长期存在的“内存墙”和“存储墙”。

所谓内存墙,是指靠近GPU的高速内存容量有限、成本高昂,HBM和DRAM很快,但不能无限扩展。面对长上下文和高并发推理,系统往往不是先达到GPU算力上限,而是先遇到内存容量上限。

所谓存储墙,是指传统共享存储或对象存储虽然容量大,但离计算端较远,延迟和网络路径难以满足token生成关键路径上的实时需求。如果把活跃KV Cache或推理上下文放到传统远端存储中,就可能出现不可预测的延迟波动,让GPU等待数据。

当推理撞上“内存墙”,Solidigm如何抓住AI工厂的新机遇?

这正是AI基础设施的新现实,GPU仍然关键,但AI算力顶峰不再主要由GPU定义。

如果数据不能持续抵达GPU,如果上下文不能快速调入,如果存储层延迟不稳定,再强的GPU也无法充分释放性能。

这也解释了为什么闪存在AI推理中的位置会前移,过去SSD更多承担本地缓存、热数据加速和容量替代,但在长上下文、高并发推理场景下,SSD开始具备“有效内存扩展”的意义,它既比DRAM更具容量经济性,又比传统远端存储更靠近计算。

对于Solidigm而言,这正是其产品能力与AI新需求发生交汇的地方。

AI工厂需要的不只是更大的存储池,而是在有限机架空间、功耗预算和时延约束下,提供更高密度、更稳定性能和更优能效的闪存基础设施。

英伟达提出的G3.5层理论,也正是在为这个问题提供新的架构位置。

它将一部分推理上下文、KV Cache、多轮对话历史和智能体状态,放在比传统数据湖更近、比DRAM更具容量经济性的闪存层中,这样既可以减少重复计算,也可以提高上下文复用效率,降低GPU等待时间。

换句话说,闪存正在从存储介质变成AI有效内存的扩展层。

03 在新存储体系中,Solidigm如何找到自己的位置

当AI工厂和G3.5层概念逐渐清晰并成为英伟达造就的又一个时代潮流后,一个自然的问题也随之出现:什么样的存储产品,才能真正承接这个新层级?

答案并不是单纯更大或更快的存储产品,而是要同时满足AI推理对性能、容量、密度、能效和稳定性的复合要求。

推理规模化会持续拉动高容量SSD需求,长上下文、多轮对话、RAG和智能体工作流,会不断产生KV Cache、向量索引、会话状态和模型工件,仅靠DRAM和HBM承载并不现实,高容量NVMe SSD因此成为扩展上下文空间的重要选择。

高并发推理也会提升对稳定低延迟SSD的需求,AI服务不只看平均吞吐,更看高负载下的尾延迟和服务质量,如果SSD能在真实混合IO场景下保持稳定读写性能,就能帮助减少上下文调度等待,提高GPU利用率。

与此同时,AI工厂还受机柜空间、电力和散热约束。单位机架能提供多少TB、每瓦能承载多少数据、能否减少数据搬移,会直接影响AI基础设施的扩展效率。

这也意味着,SSD正在参与AI单位经济性的优化。企业最终关心的是每次推理成本、每千token成本、每瓦token数。如果合适的闪存层可以减少GPU空闲、降低重算、提升并发和吞吐,它创造的价值就不只是降低存储成本,而是优化整个AI服务成本结构。

在这样的背景下,Solidigm的机会就不再只是提供SSD,而是以不同类型的企业级SSD,承接AI工厂中不同层级的数据访问需求。

当推理撞上“内存墙”,Solidigm如何抓住AI工厂的新机遇?

从产品布局来看,Solidigm已经形成了比较清晰的产品路线图,既包括面向性能敏感场景的D7-PS1010等产品,又包括面向高容量密度场景的D5-P5336。

D7-PS1010是一款PCIe Gen5 NVMe SSD,更适合高吞吐、低延迟、高并发的AI工作负载,放在AI工厂场景中,它可以服务于热数据访问、本地缓存、KV Cache卸载、RAG检索、检查点读写,以及对延迟更敏感的推理上下文调度。

如果放到英伟达的G3.5层存储概念中,D7-PS1010对应的是性能敏感的热路径,当AI推理需要频繁调入上下文、复用中间状态、快速访问向量索引时,高性能SSD就是维持推理连续性的关键部件。

而G3.5层不仅需要快,也需要足够大的容量。

它要承载大量并发会话、长上下文状态和动态KV数据,容量需求会随着GPU数量、用户规模和智能体复杂度同步增长。如果每个AI机柜都需要更多闪存容量,那么单位空间、单位功耗下能提供多少TB,就会成为关键指标。

这正是Solidigm的D5-P5336的价值所在。

作为高容量NVMe SSD,D5-P5336可提供高达122TB级别的容量配置,天然更适合AI数据湖、高密度训练数据集、模型工件、向量数据库和推理上下文容量池等场景,它的意义在于,帮助AI工厂在有限机架和功耗预算内,获得更高的数据承载能力。

面向当下的AI工厂,Solidigm的产品布局很清晰:

GPU HBM和DRAM负责最热、最即时的计算状态,本地高性能NVMe SSD负责热数据、缓存、数据混洗和低延迟访问,G3.5层闪存负责机柜级共享KV Cache、推理上下文和智能体状态,后端数据湖和对象存储负责长期数据、日志、模型工件和归档。

在这个体系中,D7-PS1010更偏向性能敏感的热路径,D5-P5336更偏向容量密集的上下文与数据池,二者共同覆盖了AI工厂对快和大的双重需求。

AI工厂的竞争,不是单颗芯片的竞争,而是整个系统的竞争。

这其中,GPU决定计算潜力,但存储决定这种潜力能否被持续释放,英伟达提出3.5层存储理论,本质上是在提醒行业,AI的下一轮扩展,不只发生在GPU内部,也发生在GPU之外的数据路径上。

谁能让数据更快、更近、更节能地抵达GPU,谁就能帮助客户提高AI工厂的智能产出效率,而Solidigm要抓住的,正是闪存在AI推理链路中从后台走向核心的这一刻。

至顶网人工智能频道 作者:金旺