RustFS 1.0.0,正式来了。

这个2023年启动、2024年写下第一行代码的开源项目,在正式版发布前已经跑出一条很陡的增长曲线。官方数据显示,RustFS经历6600多次代码提交、135多个版本,吸引全球180多位开发者参与;开源14个月,GitHub Star超过3.2万,全球安装量超过270万,其中70%以上来自欧美,Docker Hub镜像累计拉取超过1000万次,并已经进入AI、能源、金融、云计算等生产场景。

放在对象存储这个并不大众的赛道里,这组数字很容易让人产生一个疑问:一个成立时间并不长的项目,为什么能在这么短时间里跑到全球?

答案多少与MinIO有关。长期以来,AWS S3和MinIO都是对象存储领域绕不开的名字。随着MinIO调整商业化策略和开源生态,一批开发者开始寻找新的选择,RustFS恰好出现在这个时间窗口。但它最近做的事情已经逐渐超出“MinIO平替”的范围。S3 Tables被做进对象存储内核并直接开源,后面还有S3 Vector、RDMA、DPU以及面向AI数据中心的一系列计划。

沿着这些动作看下去,RustFS创始人兼CEO Kevin真正关心的问题已经越来越清晰:AI时代的数据应该怎么存、怎么流动,一家开源基础软件公司又该靠什么长期生存。

两年做到全球安装量超270万,RustFS还想把路修到哪里?

一开始就把路铺向全球

2023年启动RustFS时,团队最先看到的,其实是国内市场的机会。当时,越来越多企业开始重新审视自己的基础技术栈,而MinIO已经用多年的发展证明,对象存储拥有一个足够大的市场。对RustFS来说,一个很自然的起点,就是围绕这些正在发生变化的需求,做一套更容易被这些企业部署和使用的对象存储产品。

真正开始摸索商业化之后,Kevin发现国内外的软件付费环境存在很大差异。欧美企业更习惯持续订阅,国内不少IT采购仍围绕年度预算和项目制展开。同一套软件商业模式换一个市场,很难原样照搬。

与此同时,MinIO本身也在调整。许可证变化,以及Docker镜像、控制台等开源内容的变化,让一些开发者开始寻找新的选择。RustFS由此重新规划了路线,既然代码已经决定开源,面对的也可以直接是全球开发者,RustFS最初的官网甚至只有英文版本。代码发布到GitHub后,不管用户在欧洲、北美还是亚洲,都可以同时下载、部署和测试。Kevin把这种打法概括为“第一天全球化”。

一年多之后,这条路线已经反映在用户分布上。RustFS官方披露,目前超过70%的安装来自欧美。开源当然能降低第一次尝试的门槛,但真正决定一个基础软件能不能留下用户的,还是几个很具体的问题:装起来麻不麻烦,长期运行稳不稳,出了问题有没有人解决。

这些问题,也把RustFS带到了下一段更难走的路上。

让企业信任的底气,来自一次次暴力测试

对于存储软件来说,用户一旦开始把真实数据放进去,衡量产品的标准就变了。一款普通软件崩溃,重新启动往往还能继续工作;存储系统如果发生严重故障,代价可能是一批业务数据再也找不回来。

RustFS早期为此搭建过接近300个节点的分布式测试环境,并主动制造各种故障。团队会直接拔电源、拔网线、拔硬盘,也会随机下掉一批机器,再格式化设备、重新加入新节点。很多数据中心里让运维人员头疼的事故,被他们提前反复演练。

就像新桥通车前的压力测试一样,晴天时车辆能够顺畅经过只说明基本功能正常,真正决定这座桥能不能长期使用的,是重载、故障和意外出现后,结构还能不能撑住。

到了企业客户环境里,验证时间还会进一步拉长。Kevin提到,有些同行的POC可能只跑一周,RustFS愿意让客户跑三个月甚至半年。同时,系统会持续监控硬盘、网络、并发和操作系统状态,一旦接近资源阈值,就提前提示扩容或调整。

目前RustFS已经进入运营商、铁路,以及海外金融科技、云服务等场景,部分商业客户的数据规模已经达到PB甚至数十PB级。到了这个规模,一次性能测试很难说明全部问题。客户更关心系统能不能连续运行,故障出现之后能不能恢复,问题发生时有没有人快速响应。

Kevin因此把大企业存储生意理解为一种“信任生意”。代码和性能只是底层,长期运行经验、服务响应,以及最终有人愿意对结果负责,同样是产品的一部分。

GPU越来越快,存储却开始站到AI的路中央

今天谈AI基础设施,人们很容易把注意力集中在GPU上。芯片算力提高多少、显存有多大、模型能跑多少Token,都有非常直观的数字。

Kevin关注的是另一段正在变得拥堵的路:GPU越来越快以后,数据能不能及时送过去?

模型训练以前,原始数据要保存、清洗和标注;进入训练阶段,GPU需要不断读取数据;模型训练完成以后,权重和结果又要重新存下来。到了多模态阶段,图片、视频、音频不断增加,数据的体量和类型同时变得复杂。

如果把GPU看作高速运转的加工厂,对象存储更接近它背后的仓库和物流系统。工厂加工速度再快,原料送不过来,机器还是会等。

RustFS这次重点投入S3 Tables,就和这条变化有关。它把Apache Iceberg REST Catalog直接内置进对象存储内核,Spark、DuckDB、PyIceberg等工具可以直接连接。用更通俗的话说,相当于在原来的大仓库里,同时增加货架、目录和管理系统,让结构化数据与图片、视频、模型文件等数据能够放进同一套体系里管理。

Agent的出现又提出了新的要求。过去,人通过账号和文件夹访问数据;未来可能是大量Agent自动读取企业内部的数据。某个Agent能够读取什么、能不能修改、哪些数据完全不能接触,都需要更加细致的权限控制。

因此Kevin很看重Catalog和Policy,希望数据被存下来时,就已经带着明确的目录和访问规则。

再往底层走,还有RDMA和DPU。前者可以理解成数据运输的高速通道,后者负责分担网络、存储等数据搬运工作,让CPU和GPU把更多资源留给计算。RustFS已经进行了相关技术储备,不过没有急着全面铺开,因为不同厂商的硬件和协议还比较分散。

加入NVIDIA Inception后,RustFS也开始更早接触英伟达的工程体系和开发者资源。Kevin尤其关注DOCA这类技术,它正在尝试把GPU、DPU、网络和存储连接得更紧。现阶段,通用对象存储依然是更大的现实市场。RustFS的选择更像提前把施工设备准备好,等车流真正出现,再决定高速公路修到哪里。

如果AI以后连软件都能写,RustFS还靠什么赚钱?

AI编程能力越来越强,Kevin也在考虑一个更远的问题:如果有一天,AI能够直接理解一套软件的全部代码,再根据一句话生成类似产品,人们还会不会按照今天的方式为软件付费?

这个问题很难提前回答,但有一些东西不会那么容易消失。

其中之一是数据。假设用户已经把大量照片、视频或者企业资料保存在RustFS里,未来可以直接授权AI处理这些内容。家庭用户可以让模型读取多年的照片,整理孩子的成长记录;企业也可以让AI读取特定数据完成分析。RustFS希望未来连接不同的模型和Token资源,让数据留在原有存储体系里,就能直接调用AI能力。

另一块是备份。Kevin观察到,海外企业对备份的重视程度很高,因此RustFS计划建设云上云下一体化能力:企业的数据可以继续保存在本地,需要备份时经过加密再上传到云端,平台拿不到密钥,也无法直接读取用户的数据。开源软件负责覆盖更多用户,云端的备份、存储和资源服务则可以形成持续收入。

Kevin甚至考虑过把IPFS一类分布式存储资源用于低成本备份。经常访问的数据需要高速读取,备份数据却可以接受几分钟的恢复时间,只要数据足够安全,并且有更高的性价比。沿用前面的道路比喻,重要数据需要高速公路,一些长期归档的数据完全可以走成本更低的路线。

无论软件本身发生怎样的变化,Kevin认为“信任”依然很难被AI完全替代。AI能够写代码、部署软件、自动扩容,但当一家大型企业把几十PB数据交给一套系统时,最终仍然会问一句:出了问题,谁负责?

这也解释了RustFS为什么承诺永久开源。Kevin希望开源版本继续降低存储的使用门槛,公司则围绕云服务、备份、资源和企业服务寻找收入。商业化可以慢一些,产品原来的路线不能因为短期收入发生变形。

从2023年启动,到2026年发布1.0.0,RustFS走过的时间并不长。早期,它抓住的是对象存储生态变化带来的窗口;随后进入全球开源社区,如今又开始把路线延伸到S3 Table、AI数据、云备份、RDMA、DPU以及Agent的数据基础设施。

模型会变,芯片会变,软件形态也可能继续变化。但数据依然需要保存、调用、备份和恢复,企业依然需要有人为这些数据负责。因此,Kevin反复提到的“信任”,在AI能力不断增强之后反而有了更具体的含义。

它可以是一套存储系统连续运行几年没有丢过数据,可以是在硬盘和网络接近极限之前提前发出预警,也可以是在Agent自动完成部署之后,仍然有人愿意在最终结果上签字。RustFS早期反复拔电源、拔硬盘、断网络做稳定性测试,后来让大型客户跑三个月甚至半年的POC,本质上都在积累这种很难被一次模型升级抹掉的东西。

软件会变,模型会变,芯片也会变。存储与记忆、计算与数据之间的调度效率、Agent对数据的调用,以及产品可靠性和用户信任,却更像穿过技术周期之后依然存在的底层需求。

如果后AI时代真的存在一张通行证,它上面写的或许不会只是“更强的模型”或者“更多的算力”。数据能不能存住,计算能不能及时拿到,Agent能不能安全使用,以及出了问题有没有人负责,这些能力才更接近那张长期有效的凭证。

而RustFS正在做的事情,就是把这些能力一块一块拼起来。当这条路继续向前延伸时,RustFS已经拿到了通往后AI时代的通行证。

至顶网存储频道 作者:刘文轩