Meta正在升级其Muse Spark系列模型,推出一款针对长周期编程任务和智能体软件开发的新模型,同时保持标准API定价不变,让开发团队无需支付更高的单Token费用即可获得更强的能力。
新款Muse Spark 1.3模型声称,与前代产品相比,完成编程任务所需的Token数量减少约25%,工具调用次数减少约20%,这可能让开发团队在相同的单Token价格下获得更高效的AI辅助编程体验,该公司在一篇博客文章中写道。
效率提升的原因在于,Muse Spark 1.3在不必要时减少了交互轮次,生成的回复也更加简洁,同时通过自主生成上下文、纠正计划中的漏洞、遵循复杂指令、管理多个工作流以及识别自身局限性,提升了持续处理长时间运行任务的能力,公司补充道。
对开发者而言,能力提升与价格不变的组合可能会提高生产效率,同时鼓励团队将AI应用于更广泛的编程任务,Pareekh Consulting首席分析师Pareekh Jain表示。
“由于该模型更擅长理解复杂提示并遵循指令,开发者可以减少重试次数获得更好的结果,并可能用更少的AI资源完成相同的任务,同时由于其可靠性的提升,也更容易将该模型扩展到更广泛的编程和软件开发工作负载中,减少人工监督需求,”Jain说。
这些工作负载可能包括理解大型代码库、调试、修改多个文件、使用开发工具以及测试代码,Jain补充道。
这反过来可能会降低CIO们在AI辅助软件开发方面的推理成本。
“如果Muse Spark 1.3能用更少的Token、工具调用和重试次数完成任务,CIO们就有可能在相同的Token价格下获得更多的工作产出,”Jain进一步表示。
然而,推理成本的降低未必会转化为整体AI支出的减少。
主要原因在于,大多数企业团队会将这一更强大的模型用于运行时间更长、更复杂的任务,从而抵消推理成本的降低,Avasant首席分析师Abhishek Satapathy表示。
这种情况更有可能发生,因为企业往往会在效率提升使某种资源的使用成本降低时,增加对该资源的使用,这一动态正体现了杰文斯悖论,Jain说。
因此,企业应该关注成功完成任务的总成本,而不是模型的单Token价格,Jain补充道。
Meta对新模型进行的基准测试是内部完成的,与独立评估结果相比也存在一些需要注意的问题。
尽管Meta声称Muse Spark 1.3比前代产品使用更少的Token,但独立评估得出了不同的结果,这引发了关于这些效率提升能否在不同工作负载中保持一致的疑问。
AI基准测试平台Artificial Analysis发现,Muse Spark 1.3在完成其智能指数评估时生成了约1亿个Token,而其评估的所有模型的Token使用中位数为7100万。
尽管这些结果并未直接复现Meta衡量特定编程任务Token使用情况的内部评估,但它们凸显了模型效率会因工作负载和评估方法的不同而产生显著差异,Nord-IQ Research首席分析师Manoj Chandra Jha表示。
“这些不同的结果进一步表明,企业在为预期的效率提升做预算之前,有必要针对自身的工作负载对模型进行测试,”Jha补充道。
AI生产力平台Eesel AI也提醒用户对Meta关于Muse Spark 1.3性能的说法保持谨慎。
“Meta的评分对比将1.3版本的最大模式(发布时仍处于安全测试阶段)与1.2版本的xhigh模式进行比较,因此部分性能提升源于推理层级的变化,而非纯粹的代际飞跃,”其在一篇博客文章中写道。
这使得企业更难判断报告中的性能提升有多少来自1.3版本本身的改进,又有多少来自Meta对比时所用的更高推理配置,Jha表示。
Reddit用户也对Meta的基准测试表示怀疑,将其称为“典型的刷分行为”,即为了在基准测试中获得高分而对模型或工作负载进行优化,而非针对真实使用场景进行优化。
不过,分析师们对新模型的价值及其采用前景仍持乐观态度。
“这是Meta打出的价值牌,新模型的定价比Anthropic和OpenAI的旗舰产品低4到6倍,同时产出的结果仍能与更昂贵的模型相竞争,”Jha说。
这有望使其成为企业在大规模运行复杂软件开发工作负载时的“强力”替代方案,Satapathy也表达了类似观点。
Q&A
Q1:Muse Spark 1.3相比前代模型有哪些改进?
A:Muse Spark 1.3完成编程任务所需的Token数量减少约25%,工具调用次数减少约20%,同时提升了处理长周期任务、生成自身上下文、遵循复杂指令和管理多个工作流的能力。
Q2:Muse Spark 1.3的价格是否有变化?
A:Meta保持了标准API定价不变,这意味着开发团队可以用相同的单Token价格获得更强的编程能力,无需支付额外费用。
Q3:独立评估机构对Muse Spark 1.3的效率提升说法有何看法?
A:独立评估机构Artificial Analysis发现该模型在智能指数评估中使用的Token数量高于行业中位数,这表明模型效率可能因工作负载和评估方法不同而有所差异,企业应针对自身场景进行实测。
