本文来源于 Y Combinator 旗下播客节目《Lightcone》的一期访谈,节目由 YC 团队主持,嘉宾是 Ollama 联合创始人兼 CEO 杰弗里·摩根(Jeffrey Morgan)。节目于 2026 年 9 月上线,讨论的核心话题是开源模型正在如何重塑 AI 行业的经济结构。
Ollama 是 2021 年那批 YC 加速器(W21)孵化出来的项目,如今已成为在本地和云端运行开源 AI 模型最主流的工具之一:9 百万开发者在使用它,GitHub 上积累了 17.8 万颗星,财富 500 强企业里有 85% 都在用它。这意味着摩根几乎坐在全球开源模型流量的十字路口,能够第一时间看到哪些模型真正被开发者下载、留存并大规模使用,而不是仅凭榜单排名或社交媒体热度做判断。这也是本期节目最有价值的地方:谈话不建立在猜测上,而是建立在真实的调用数据上。
眼下正是开源模型和闭源模型阵营都在剧烈变动的时间点。一边是前沿实验室因为安全和对齐问题可能放缓发布节奏,另一边是开源阵营的模型迭代速度肉眼可见地加快,中国出身的模型在成本和能力上都在快速追赶。摩根提供的第一手数据,恰好为这场行业级别的路线之争,给出了一份来自真实企业客户的注脚。
1. 编码智能体,正在把开源模型推向企业核心
摩根开门见山地说,眼下最大的趋势是企业级场景里正在发生一次向开源模型的整体转移,而且这批模型是美国和中国血统混杂的。推动这一转移的主力,是编码智能体(coding agents),以及像 OpenClaw、Hermes 这类协作型 AI 助手项目。
Ollama 最初的定位很朴素,是让开发者能在自己的 MacBook 或者搭载 Nvidia、AMD、Intel 芯片的机器上本地跑开源模型。但今年早些时候上线的 Ollama Cloud 揭示了一个更有意思的现象:目前云端调用量里占大头的是中国血统的模型,而调用这些模型的企业遍布全球,尤其是美国和德国的调用量非常突出。
2. 省钱只是开始,控制权才是终点
被问到企业转向开源模型是不是单纯为了省钱,摩根给出了一个分层的答案:成本确实是目前开源模型能解决的最大痛点,但每家企业真正的愿景,是对 AI 拥有更强的掌控力,并且能针对自己的业务去定制模型。省钱只是短期内能被解决的问题,它真正打开的,是企业接下来为自身独特场景去做模型定制的空间。
摩根举了一个具体的例子:《The Information》前一天刚刊出一篇报道,AT&T 已经把 40% 的 token 消耗量切换到了开源模型上,目前主要走的是美国和欧洲血统的模型,但同时也在评估中国模型。这些流量绝大部分来自编码智能体类的工作流。摩根提到,今年年初 Kimi、GLM 系列、MiniMax 等开源模型陆续发布后,开源模型第一次真正具备了支撑编码智能体的能力;到了 3、4 月份,OpenClaw 项目的爆发式增长,加上随后 Hermes 智能体项目的走红,把这种"把一个复杂任务丢给开源模型自己去完成"的能力,从开发者群体扩展到了财务、客服、市场、销售等非技术岗位。
3. 一张per-user曲线,藏着150倍的增长故事
摩根展示了一张按开发者人均计算的 token 使用量曲线图,这张图容易被误解成 Ollama 整体业务的增长曲线,但实际上统计的是单个用户每周消耗的 token 数量。这条曲线上有两次明显的拐点:第一次发生在年初,由 Kimi、GLM、MiniMax 等模型上线驱动,开源模型第一次具备了支撑编码智能体的实力;第二次发生在 4 月,由 OpenClaw 的爆发引起——它把"把一个难题交给开源模型,让它自己完成"的能力开放给了更广泛的用户,而这个过程会消耗大量 token,因为模型需要不断判断该调用什么工具、去哪里抓取数据。与此同时,开源模型的上下文窗口也从 12.8 万 token 一路扩展到超过百万级别。
从数字上看,仅 OpenClaw 带来的这一波跃升,大约就把人均周消耗量拉高了 5 倍;而如果把 Ollama Cloud 上的整体流量都算进去,自年初以来的增长在 10 到 20 倍以上,云端 token 总量的增幅达到了 150 倍。
摩根还特意点出了一个此前被忽视的行业变化:在 2024 到 2025 年,开源模型主要是以"底座+微调"的方式被使用的,也就是拿一个 DeepSeek 或 Kimi 这样的现成模型,针对自己的场景做微调后再上线服务,Cursor 就是一个公开报道过的典型案例。但把开源模型直接拿来"开箱即用"地大规模提供服务,其实是从今年年初才真正起势的新现象。
4. 微调热潮:又一轮泡沫,还是这次真的留下来了
主持人提出了一个直接的问题:2024 年初曾经掀起过一波自定义微调开源模型的热潮,随后又迅速降温,业界普遍认为那些投入会被下一次模型发布轻易碾压、变成沉没成本。眼下微调似乎又开始回潮,这到底是又一轮周期,还是这次真的会留下来?
摩根的回答带着一丝矛盾感:模型发布的节奏只会越来越快,这让团队想要长期站在技术前沿变得更加困难。他给出的例证是,光是今年夏天,DeepSeek 的 Flash 模型就已经迭代了三个版本,而过去这种级别的迭代周期通常要六个月。发布节奏的压缩,理论上会让自定义训练变得更不划算,但另一方面,围绕微调的工具链本身也在同步变好,这让那些真正想要跟上节奏的团队具备了更强的能力去做这件事。
摩根还提到一个更大的背景变量:前沿实验室正面临越来越突出的 AI 安全议题,这可能促使它们放慢发布节奏,去解决对齐和安全问题;与此同时,开源和开放权重模型这边不会停下脚步,会持续变强变快。这形成了一种此消彼长的态势。
5. "让Claude做渗透测试,它会直接拒绝"
围绕安全话题,谈话转向了一个更具体的场景。摩根提到 GLM 5.3 模型在网络安全方面展现出的能力令人印象深刻,这给安全和治理领域的创业公司或者现有企业打开了一个明确的机会窗口。他重新提起前面那篇 AT&T 的报道:企业不愿意采用开源模型,主要的阻力恰恰来自安全和合规层面。但根据 Ollama 团队和欧洲、美国客户交流的直接经验,只要能把安全问题解决,采用中国血统的模型完全是摆在桌面上的选项,这对这些企业来说是一件让人兴奋的事。
主持人补充了一个耐人寻味的细节:就在不久前,Hugging Face 甚至是靠使用开放权重模型,才检测出了针对前沿闭源模型的一次攻击。而摩根进一步指出,一个非常常见的问题是——开源模型到底在哪些场景上能真正甩开闭源模型一个身位?他给出的答案是安全测试。原因很直接:如果你让 Claude 去对自己的产品做渗透测试,它大概率会直接拒绝。而 Hugging Face 上确实存在一批被"魔改到底"(obliterated,指经过特殊训练、几乎没有安全限制)的安全研究专用模型,能够正面完成这类攻击性测试任务。摩根澄清,即便是那些没被特意魔改过的开箱即用模型,虽然仍带有基础的安全训练,但相比闭源模型,它们对"这是出于善意的安全研究用途,还是恶意攻击用途"这种语境的区分更宽容一些。
6. Ollama如何决定一个新模型"发射日"的成败
作为几乎所有主流开源模型上线时的关键分发渠道,Ollama 拿到了一个特殊的位置:模型开发方通常会在正式发布之前就联系团队,提前协调发布节奏,摩根因此常常能提前看到即将发生的事情,并且亲历新模型上线那一刻流量瞬间飙升的场面。
摩根总结出了一套"发射日"(day zero)的操作方法论。第一步,要确保新模型被主流推理引擎支持,这通常是一个持续数周的过程,需要保证推理速度、准确率,以及和研究团队公布的参考实现完全对齐。第二步,是为开发者和用户找到合适的使用场景和运行框架(harness),因为几乎每个新模型都会带来新的能力——就在访谈当天早上,DeepSeek 刚刚发布了自己第一个真正意义上的多模态大模型,此前公司只有一些偏小型的 OCR 模型,这次发布解锁了一整批新的应用场景;与此同时 DeepSeek 团队也同步更新了自己的运行框架,让它能够支撑这个新能力。第三步,是在正式发布前对最终产品跑一轮完整的基准测试,确保结果和实验室研究团队公布的数据完全一致。
摩根把 Ollama 在这个生态里扮演的角色概括为三件事的打包:一是运行框架,可以是现成的开源框架,也可以是配套的 SDK,比如 Codex 的开源框架和目前在 Ollama 用户里最受欢迎的 OpenCode;二是把这个框架和模型本身适配打通;三是保证整个服务的可用性和稳定性,尤其是在云端要保证有足够的算力承接住"发射日"当天通常是全生命周期里最大的一波流量。
回到节目开头的那个问题——微调到底是又一轮会被淘汰的周期,还是这次真的会留下来——摩根没有给出一个非黑即白的答案。真正在发生的,是两股力量的同步加速:模型发布得越来越快,让"跟上前沿"本身变得更难;但与此同时,围绕开源模型的整套基础设施、运行框架和分发渠道也在同步变得成熟。企业选择开源模型,起点常常是省钱,但真正留下来的理由,是获得对 AI 更彻底的控制权和定制自由。而这,正是摩根口中开源模型正在改写的那套 AI 经济学。
