Meta推出了一款测试版编程智能体,专为处理大型代码库中的复杂软件开发任务而设计。
Muse Code目前支持macOS和Linux系统,采用该公司最新推出的Muse Spark 1.2模型。与以往需要为每项任务单独创建智能体的方式不同,Muse Code内置了多个可在整个会话期间持续运行的专属后台智能体。
这些智能体以异步方式执行任务,并可自主判断何时向主智能体汇报工作进展。Meta表示,保持智能体持续活跃的设计,能够减少重复收集信息的开销,并降低开发者在处理复杂多步骤任务时的介入需求。
"Muse Code采用本地事件日志机制,每一次模型调用、工具运行、操作审批和代码编辑都会被记录其中,"Meta在官方博文中表示,这套记录机制"使运行时具备精确回放能力和安全重启能力",智能体在崩溃后可从中断位置精准恢复。
Muse Spark 1.2模型可通过Muse Code及Meta模型API使用,Meta同时宣布扩大该API的全球访问权限。
Meta表示,Muse Spark 1.2与Muse Code经过协同训练,以提升模型在智能体环境下的表现和易用性。训练过程融合了Muse Code的工具集和智能体工作流程,同时Meta增加了用于代码生成的算力投入,并扩展了所覆盖的开发环境范围。此外,该模型还针对更长周期的任务进行了专项训练,包括整仓代码生成和大型端到端软件项目。
Omdia首席分析师苏连杰表示,Meta的协同训练方式未必能形成明显的竞争优势,因为竞争对手同样在同步推进各自编程模型与智能体框架的深度协同开发。"OpenAI和Anthropic等厂商已将智能体框架工程纳入训练流程的一部分,"他说。
Pareekh Consulting首席执行官Pareekh Jain指出,模型与智能体的协同优化确实有助于提升任务规划和上下文处理能力,但要形成真正的竞争优势,还需在企业级项目上拿出更好的实际成绩,并切实减少人工干预。
在基准测试方面,Muse Spark 1.2在Terminal-Bench 2.1上取得了82.9%的pass@1得分,低于Claude Opus 5,但略高于GPT-5.6 Terra;在DeepSWE 1.1上得分为59.3%,落后于上述两款竞品。值得注意的是,Meta在进行Terminal-Bench 2.1和DeepSWE 1.1评测时,对每款模型均搭配其对应的编程智能体,而非使用统一的智能体框架。Meta也坦承,竞品专有模型若使用专为其设计的工具和提示词,表现可能有所不同。
Counterpoint Research研究副总裁Neil Shah表示,只有采用第三方工具或统一智能体框架进行评测,跨厂商的横向比较才更具参考价值。"对于CIO而言,真正关键的指标是模型在企业自有开发流水线上的通过率,这才是衡量模型与智能体框架组合是否成功的核心标准——对Meta的Muse Spark 1.2和Muse Code来说也不例外,"他说。"这才是真正意义上的基准测试。"
在企业采用层面,苏连杰指出,安全合规与治理要求可能会拖慢落地进程,尤其是在编程智能体需要与企业现有身份认证系统对接的场景下。"很多企业对于将AI工具接入CI/CD环境仍持谨慎态度,"他说。
Shah则表示,企业需要建立完善的访问管控机制,规范智能体对代码仓库的访问行为,并保留模型和智能体工作流处理企业数据的完整记录。他还特别提到了Token用量难以预测这一问题及其对成本的潜在影响。
Meta的定价结构也带来了数据治理方面的选择。Meta表示,低价的Contributor版本所产生的数据可能被用于改进其产品,而标准版则不作此用途。Contributor版定价为每百万输入Token 0.10美元、每百万输出Token 0.20美元;标准版则分别为1.25美元和4.25美元。
"此外,企业对厂商绑定和依赖性也存在顾虑,担心这会影响长期的系统灵活性和互操作性,"苏连杰补充道。
Jain认为,企业的实际采用路径可能会从定义清晰、风险较低的工作场景起步,在允许持续运行的智能体修改关键生产代码之前,会经历较为审慎的渐进过程。
Q&A
Q1:Muse Code和普通编程工具有什么区别?
A:Muse Code最大的不同在于引入了持续运行的后台智能体。普通工具通常为每个任务临时创建智能体,而Muse Code的智能体在整个会话中保持活跃,能够异步执行任务、自主决定何时汇报进展,并在崩溃后精准恢复中断前的状态,特别适合处理大型代码库中复杂的多步骤开发任务。
Q2:Muse Spark 1.2在基准测试中表现如何?
A:Muse Spark 1.2在Terminal-Bench 2.1上的pass@1得分为82.9%,低于Claude Opus 5,但略高于GPT-5.6 Terra;在DeepSWE 1.1上得分59.3%,落后于两款竞品。需要注意的是,Meta的测评方式是为每款模型配套其专属智能体,而非使用统一框架,因此跨模型比较的客观性存在一定局限。
Q3:企业在采用Muse Code时主要面临哪些顾虑?
A:企业的顾虑主要集中在三个方面:一是安全与合规要求,许多企业不愿将AI工具接入CI/CD环境;二是数据治理风险,需要明确智能体访问代码仓库的权限边界及数据使用记录;三是Token用量难以预测带来的成本不确定性,以及对厂商绑定影响长期系统灵活性的担忧。
