很多 AI 项目最先算错的是任务分类。当项目启动时,训练、模型加载、检查点写入和在线请求很容易共用一套存储方案。确实可以跑起来,让团队有机会把注意力放回模型和算力。但等训练集开始扩容、服务请求持续进来,问题才露出来:有的数据等不得,有的数据占得太久,还有的数据会在几周后重新变成高频访问对象。

WAIC 2026

WAIC 2026 的议程包括多模态科学智能体、具身空间交互和空天地智能计算等。图像、传感器信息、仿真结果与连续状态记录会进入同一个系统,但它们的访问方式并不相同。计算侧需要及时拿到数据;另一批资料则需要长期在线,等待下一轮训练、分析或回溯调用。

闪迪参展WAIC 2026

这也是企业级AI存储开始重新分工的原因,闪迪此次参展WAIC 2026, 旗下的SANDISK SN861 NVMe SSD和SANDISK SN670 NVMe SSD,提供了一个具体样本:前者服务训练、推理和 AI 服务部署,后者面向数据准备与AI数据湖。两款SSD分别接住了两种节奏截然不同的数据工作。

企业采购存储时,容量、接口和价格都容易写进表格,数据在业务中的流动方式却常常留到部署之后再处理。这个顺序在小规模验证阶段问题不大;一旦进入生产,训练数据要持续读取,模型和检查点要反复写入,线上服务还要接住随时到来的请求,原先看似够用的资源就会开始互相挤占。

WAIC 反复出现的多模态智能体和具身智能,放大了这种差异。一个系统既要处理图像、文本和传感器数据,也要保留模型版本、实验结果与运行记录。部分内容要立即进入计算侧,部分资料隔几周才会被重新调用,还有一些需要长期保存以便复盘。把它们都压在同一层里,性能、容量和维护成本很快会彼此牵制。

容量只是存储选择的一项变量,训练任务等待数据时,昂贵的计算资源无法发挥作用;长期留存的资料如果始终占在性能层,又会把更高成本的空间消耗在不紧急的内容上。AI 项目开始规模化后,存储需要先回答一件更实际的事:哪些任务必须优先获得 I/O,哪些资料可以留在容量层等待调用。

训练和在线推理最怕 I/O 等待,数据集读取、模型加载、检查点写入与在线请求的频率并不一致,却会同时压向计算侧。存储链路一旦放慢,GPU 再贵,也不能替数据搬家。

SANDISK SN861 NVMe SSD

这类环境里,持续供数和持续写入同样重要。SANDISK SN861 NVMe SSD 采用 PCIe Gen5 接口,容量高达16TB,并提供1次或3次每日全盘写入选择。训练数据会更新,检查点需要反复保存,服务日志也在不断写入。DWPD 反映设备每天能够承受多少次完整容量写入,直接对应这类长期、反复发生的负载。

写入压力还来自 SSD 内部,设备整理数据时会产生额外的数据搬移,实际写入量可能高于应用提交的数据量。闪迪SN861 支持 FDP,通过更明确的数据放置减少盘内搬移和写入放大,降低持续写入对性能稳定性和设备寿命的影响。

PCIe Gen5 的价值需要放进整套系统里衡量,服务器平台、网络、文件系统和软件调度仍会决定数据能否顺利进入计算侧。闪迪SN861 的 E1.S 版本已通过 NVIDIA GB200 NVL72 系统认证,U.2 与 E1.S 版本也获得 OCP Inspired 认证;这些信息可用于相应服务器和开放计算环境的兼容性评估,系统级设计仍要结合具体部署完成。

对基础架构团队来说,这意味着选型不能停在峰值性能上。训练阶段的数据读取、检查点落盘和在线服务的突发请求,可能在不同时间把压力推向同一组资源。把对时延最敏感的任务安排在靠近计算侧的位置,先是为了减少等待,随后才谈得上把计算资源用得更充分。

计算侧首先要处理数据及时抵达,另一批资料则在不断积累。原始数据、中间结果、模型版本和运行记录不必一直占用最高性能的资源,却需要在下一次训练开始时能够被快速找到。过早转入离线归档会拉长回调时间,长期占用性能层,也会持续推高容量成本。

SANDISK SN670 NVMe SSD

SANDISK SN670 NVMe SSD 基于 UltraQLC 平台,单盘容量高达 256TB,面向 AI 数据湖和数据准备。它适合承接需要反复调用、但对访问时延相对不敏感的数据。更多资料保持在线后,团队可以减少在性能层与离线归档之间频繁搬运数据。

数据湖并不是一处只进不出的仓库,一次训练结束后留下的样本、标注结果和模型版本,可能在新的实验里被重新筛选和组合;业务团队也会回看历史记录,确认模型行为变化的原因。容量层的价值,正在于让这类资料不必一直留在最贵的资源上,也不必每次调用都从离线介质重新取回。

容量层有清晰的适用边界,频繁改写和高并发请求仍需进入更匹配的性能层;容量层更适合规模持续增长、保存周期更长且仍有在线调用价值的资料。闪迪SN861与闪迪SN670放在同一套架构里,对应同一项目里两段不同的数据路径。

硬件分层以后,难题转到数据迁移上,哪些训练数据继续留在性能层,哪些实验结果随着访问频率下降进入容量层,不能靠设备自己判断。迁移和调度规则缺位,数据仍可能滞留在不合适的层级,新的拥堵也会出现。

基础架构团队需要把这些规则放进日常运维:训练集多久未被调用后再迁移,重新进入训练时怎样回迁,模型版本保留到什么阶段,异常任务如何回退。存储分层会增加设备种类,也会增加数据生命周期管理的工作量,规则还要随着模型更新频率和业务调用的变化持续调整。闪迪SN861 和闪迪SN670可以成为两类任务的硬件基础,架构如何组织仍由企业自己的业务节奏决定。

数据离开机房以后,判断标准还会变化,手机端的本地模型、影像处理与内容加载更接近日常使用体验。SANDISK iNAND MC EU721 嵌入式闪存驱动器采用UFS 4.1接口,基于先进的SANDISK BiCS8 QLC 3D NAND技术打造,1TB 版本顺序读取和写入速度分别为 4,500MB/s 与 4,300MB/s;Advanced RPMB隐私加密、设备健康异常监测及HID碎片文件管理等功能,在保障高性能、高安全性和稳定运行的同时,帮助确保设备长期使用的流畅体验。

SANDISK iNAND MC EU721 嵌入式闪存驱动器

汽车的约束又不同,SANDISK iNAND AT EU752 UFS4.1嵌入式闪存驱动器面向智能网联汽车和软件定义汽车,是闪迪首款采用 UFS 4.1 标准的车规级嵌入式闪存产品。根据闪迪官方资料,闪迪EU752 的性能较其前代 UFS 3.1 产品提升超过两倍;1TB 版本顺序读取和写入速度分别为 4,300MB/s 与 4,100MB/s。持续写入、可靠性和维护条件,需要从产品设计阶段一并考虑。

SANDISK iNAND AT EU752 UFS 4.1 嵌入式闪存驱动器

WAIC 2026 展示了大量新模型和新硬件,真正进入生产的系统却要面对更细碎的日常问题:数据有没有及时送到计算侧,历史资料能否保持在线,迁移之后还能否在需要时回到正确的位置。模型能力和算力规模仍是竞争条件,存储的职责则开始落到数据的流动和留存上。

训练、推理和数据准备会长期并行。AI 存储的比较也会从单盘参数转向分层能力:硬件只是起点,数据调度和运维规则会更直接地影响算力利用效率与长期成本。

业界供稿