周五,Anthropic正式发布了Opus 5,这是其旗舰重量级模型的最新版本。距Opus 4.8发布仅两个月,继6月相继推出Mythos 5、Fable 5和Sonnet 5之后,Opus 5的到来基本完善了新一代模型阵容,目前只有轻量级的Haiku尚待升级。
与旗舰级Fable 5相比,Opus 5在体量上更小,但价格明显更低,限制也更少。它专为长时间执行编程任务而设计,能够在无需频繁人工干预的情况下持续工作。
定价方面,Opus 5每百万输入Token收费5美元,每百万输出Token收费25美元,在智能体任务的性价比上实现了重大突破。在Frontier-Bench和GDPval-AA等编程与知识工作评测中,Opus 5刷新了业界最优水平。在OSWorld 2.0电脑操作基准测试中,它以约Fable 5三分之一的成本超越了后者的最佳成绩。在考验模型解决全新问题能力的ARC-AGI 3评测中,其得分是第二名的三倍。
Anthropic在官方公告中表示,Opus 5"在验证自身工作、反复迭代直至成功方面能力显著增强"。在基准测试过程中,该模型曾收到一个不完整的提示,且被故意阻止查看一张机械零件图纸,但它没有放弃,而是自行编写了一套计算机视觉流程,从图像数据中重建出该零件。
由于运行成本更低,团队能够负担得起让Opus 5处理更大规模编程任务的开销。这也意味着安全性的思路需要随之改变,这正是微型虚拟机(microVM)日益受到关注的原因之一。与长期运行的容器不同,microVM能为平台团队提供隔离环境,并在任务完成后立即销毁。
当一个模型在多个系统间跨系统运行、缺乏持续人工监督时,访问权限必须是临时的、易于撤销的。这也是为什么短期有效的即时凭证日益受到重视——类似于1Password正在为Claude开发的委托认证模型。
赋予AI持续不懈的执行能力,也带来了一个隐患:它不知道何时该停下来。标准的API日志无法及时发现这种行为。团队需要构建更智能的遥测系统,真正理解工作流的上下文语义,需要一种语义层面的"熔断器",在模型耗尽计算预算之前及时介入。
Opus 5相比Fable 5降低了Token单价,但自主编程仍可能迅速带来高昂成本。一个在后台循环运行数小时的智能体,在提交一个拉取请求(PR)之前就可能消耗数百万Token。对于平台团队来说,按会话管理开销将成为新的运营要求。
为防止后台任务在边缘情况下崩溃,Anthropic正在测试版中推出"自动回退"(Automatic Fallbacks)功能。若某个提示在Opus 5上触发了安全分类器,API将悄无声息地将该任务路由至Opus 4.8,而不是抛出硬性错误、中断整个流程。Opus 5同样继承了其前代的零数据保留策略,跳过了Fable和Mythos强制执行的30天数据记录要求。
在生物科学领域,Anthropic发言人向The New Stack表示,Opus 5是"在生物任务上相比Opus 4.8有显著提升的版本,是目前面向科学研究最强的通用可用模型"。在内部有机化学基准测试(如从光谱数据推断分子结构)上,其得分比Opus 4.8高出10.2个百分点;在预测蛋白质序列变异如何决定功能方面,高出7.7个百分点。
然而,Anthropic的测试也发现该模型"在长时间自主研究任务上存在显著局限",而这类任务被认为具有最高潜在风险。因此,Opus 5保留了与Opus 4.8相近的生物安全保障机制。对于自主药物设计等长周期、开放性工作,无上限版本的Mythos 5仍是更强的选择。
在网络安全方面,Opus 5可用于防御性安全工作中的源代码审查。Anthropic表示,其安全防护触发频率将远低于Fable 5——据该公司统计,降幅约达85%。
模型的进步显而易见,但更大的挑战在于:承载这些模型运行的平台基础设施,能否跟上它们的发展步伐。
Q&A
Q1:Opus 5的价格是多少?和Fable 5比哪个更划算?
A:Opus 5每百万输入Token收费5美元,每百万输出Token收费25美元。在OSWorld 2.0基准测试中,Opus 5以约Fable 5三分之一的成本超越了后者的最佳成绩,在编程等智能体任务上具有明显的性价比优势,但总体运行成本仍需按会话管理,自主编程任务量大时费用依然可能快速累积。
Q2:Opus 5的"自动回退"功能是什么?
A:自动回退(Automatic Fallbacks)是Anthropic为Opus 5推出的一项测试版功能。当某个请求触发Opus 5的安全分类器时,API不会直接报错中断整个流程,而是悄无声息地将该任务自动转交给Opus 4.8继续处理,从而保证工作流的连续性,避免因安全拦截导致任务失败。
Q3:Opus 5在生物科学领域表现如何?有没有使用限制?
A:Opus 5是Anthropic目前面向科学研究最强的通用可用模型,在有机化学基准测试上比Opus 4.8高出10.2个百分点,在蛋白质功能预测上高出7.7个百分点。但由于在长时间自主研究任务上存在局限且风险较高,Opus 5保留了与Opus 4.8相近的生物安全保障机制,自主药物设计等高级任务仍建议使用Mythos 5。
