尽管大多数 AI 编程工具默认依赖云端托管模型,但本地模型运行时已逐渐成为可行的替代方案。对于那些希望将代码保留在本机、避免按请求计费的 API 费用,或需要在离线环境下工作的开发者来说,本地运行越来越具有吸引力。
Cline、Continue、Aider 等工具已经可以接入 Ollama 或 LM Studio 等运行时。与此同时,GitHub 也于今年 4 月为 Copilot CLI 添加了本地模型支持,并提供了完全断网环境下的离线模式。
不过,"本地运行"通常仍需开发者自行完成大量配置工作:选择模型、针对硬件进行量化适配、配置运行时和上下文参数,还要摸索出与智能体配合最佳的方案组合。
而最后这一环节尤为关键:能在笔记本上流畅运行的小型模型,往往难以应对编程智能体所要求的工具调用、推理能力以及长时间任务执行。
正是出于这一考量,JetBrains 推出了 Junie Local——一款完全在开发者本机运行的免费编程智能体。
Junie Local 的背景与定位
JetBrains 是 IntelliJ IDEA、PyCharm 和 WebStorm 背后的开发者工具公司。2025 年 1 月,该公司正式推出 Junie,这是一款嵌入其 IDE 的 AI 编程智能体,能够规划任务、修改代码、运行测试和检查,并结合开发者项目的上下文进行工作。此后,Junie 又扩展为独立的命令行工具(CLI)。
Junie 本身对本地模型并不陌生。JetBrains 营销负责人 Dmitry Savelev 在本周一发布的博客文章中指出,开发者此前已能将该智能体接入 Ollama、LM Studio 等运行时,自行加载所需模型并在本地运行。
然而,Junie Local 的不同之处在于:JetBrains 已替开发者选好了模型、完成了量化,并针对该特定组合对推理引擎和智能体框架进行了专项调优。整个配置流程均在 Junie 内部完成:执行 /local 命令即可自动下载模型和推理引擎、启动本地服务器,并将智能体切换至本地模式。无需额外安装 Ollama 或 LM Studio,无需手动配置接入端点,也无需编写模型配置文件。
第一步只需在模型选择器中选择 Junie Local,它将与其他云端托管模型一同显示在列表中。下载和配置完成后,Junie 会切换至本地 Qwen 模型,该模型将像其他模型选项一样出现在 CLI 中。此后,推理运算将完全在开发者本机上进行。
为何选择 Qwen3.6-27B?
值得关注的是,JetBrains 在模型选择上非常审慎,并未追求最新最亮眼的开源版本。Junie Local 采用的是 Qwen3.6-27B——一款于今年 4 月发布的 270 亿参数开源模型,尽管更新的 Qwen3.8-27B 已于 8 月初发布并带来了诸多改进。
Savelev 解释称,这一选择取决于两款模型在当前 Mac 上运行 Junie 时的实际表现。Qwen3.8 需要开启推理模式才能与智能体可靠协作,而一旦开启推理模式,任务耗时将延长约四倍。就目前的 Junie Local 而言,Qwen3.6 在可靠性与速度之间提供了更好的平衡。
"在当前的 Mac 上,3.6 更胜一筹。"Savelev 写道。
JetBrains 采用基于 mlx-vlm 的推理引擎以 4-bit 量化方式运行 Qwen3.6-27B,底层依托 Apple 专为 Apple Silicon 打造的机器学习框架 MLX。这与 Ollama 今年 3 月将 Apple Silicon 引擎迁移至 MLX 的技术路径如出一辙,均旨在充分发挥芯片统一内存架构的优势。
硬件门槛较高
不过,硬件要求相当苛刻:JetBrains 确认,Junie Local 需要约 20GB 的下载量,同时还需满足 macOS 26 系统、至少 64GB 统一内存以及 Apple M5 或更新芯片的要求。从实际情况来看,64GB 内存的要求意味着 MacBook Pro 用户至少需要配备 M5 Pro 或 M5 Max 芯片——这无疑是一个定位明确的高端 Mac 解决方案。
JetBrains 坦承,这些要求将使许多原本有兴趣尝试 Junie Local 的开发者望而却步。
"我们知道,一台搭载 64GB 内存的 M5 Mac 要求不低,我们不会粉饰这一点。这就是当前流畅运行 270 亿参数模型所需付出的代价,而降低这一门槛也是我们正在努力的方向。"Savelev 写道。
JetBrains 表示,后续计划将持续降低内存需求、扩大硬件兼容范围,并对底层技术栈进行持续优化。
"如果较高的配置要求是您暂时无法体验 Junie Local 的原因,请放心,我们正在努力降低这一门槛。"Savelev 补充道。
预填充性能才是真正的瓶颈
硬件要求与 JetBrains 对本地编程智能体真正性能瓶颈的判断密切相关。每秒生成 Token 数(tokens/s)衡量的是模型输出速度,但智能体在开始生成答案之前,往往需要花费大量时间摄取源文件、提示词及其他上下文内容——这一阶段被称为"预填充(prefill)"。
"所有人都在测评生成速度,"Savelev 写道,"但对于编程智能体而言,这并不是最关键的指标,因为大部分时间都耗费在预填充阶段——模型需要先读取文件、理解当前状态,才能开始工作。优化预填充才是真正能带来性能提升的地方。"
由于免费且不计用量,Junie Local 也改变了开发者愿意委托给智能体处理的任务类型。JetBrains 将 Junie Local 定位为特别适合处理耗时长、重复性高、机械性强的工作,例如跨多文件的重构与重命名、补充测试覆盖、依赖升级以及框架迁移等——在这些场景下,智能体可以持续迭代作业,开发者无需时刻担心 Token 消耗量。
"冗长、重复、机械性的工作恰恰是智能体存在的意义,也是当你盯着账户余额时最不舍得交给它做的事。"Savelev 写道。
对于日常开发工作,Savelev 认为用户不太可能感受到与强云端模型之间的明显差距。不过他也坦承,对于更复杂的架构层面推理,云端模型仍然更胜一筹。
隐私保护:本地运行的核心吸引力
当然,开发者青睐本地模型,还有一个更根本的原因:隐私。将整个智能体完全本地化运行,意味着开发者与代码之间不再有任何外部模型提供商介入,源代码、提示词或生成的修改内容均无需离开本机。对于开发专有代码、受客户保密协议约束,或所处环境不允许将源代码发送至第三方的开发者而言,这一特性具有举足轻重的吸引力。
"下载完成后,所有操作均在您的硬件上进行,您的提示词、源代码和代码差异都不会离开本机。"Savelev 写道。
Q&A
Q1:Junie Local 对硬件有哪些具体要求?
A:Junie Local 要求用户使用搭载 Apple M5 或更新芯片、至少 64GB 统一内存的 Mac,并需安装 macOS 26 系统,同时需要约 20GB 的下载空间。对于 MacBook Pro 用户而言,这意味着至少需要 M5 Pro 或 M5 Max 配置,定位偏向高端用户群体。JetBrains 表示已意识到这一门槛较高,正在努力降低未来版本的硬件要求。
Q2:Junie Local 为什么选择 Qwen3.6-27B 而不是更新的 Qwen3.8-27B?
A:JetBrains 经过实测发现,Qwen3.8-27B 需要开启推理模式才能在 Junie 智能体中稳定运行,而开启该模式后任务耗时会延长约四倍,严重影响使用体验。相比之下,Qwen3.6-27B 在当前 Mac 上能在可靠性与运行速度之间取得更好的平衡,因此成为 Junie Local 的首选模型。
Q3:Junie Local 如何保护开发者的代码隐私?
A:Junie Local 完全在本地运行,所有推理计算均在开发者自己的硬件上完成。用户的提示词、源代码以及生成的代码修改内容均不会上传至任何外部服务器或第三方模型提供商。这对于处理专有代码、受保密协议约束或有严格数据安全要求的开发者来说,是选择 Junie Local 的重要原因之一。
