Anthropic今日正式推出新一代大语言模型Claude Opus 5,面向其聊天服务及开发者平台全面开放。

Anthropic表示,Opus 5在多个领域的输出质量已接近其顶级算法Mythos 5的水准,但成本却大幅降低。

目前,Anthropic尚未对外公开发布Mythos 5,而是以一个名为Fable 5的精简版大语言模型对外提供服务。Fable 5保留了Mythos 5的诸多特性,但网络安全风险更低。Anthropic在13项基准测试中对Fable 5与Opus 5进行了横向比较,结果显示Opus 5在其中8项测试中得分更高,而其成本仅约为Fable 5的50%。

在Frontier-Bench和AutomationBench两项基准测试中,Opus 5的优势尤为突出。其中,Frontier-Bench涵盖物理、化学、密码学等74项跨领域任务,Opus 5在该测试中的得分比Fable 5高出9.7%;而在包含多种知识型工作任务的AutomationBench测试中,Opus 5的得分也高出8.5%。

Opus 5性能出众的原因之一在于其具备自我验证能力。以Frontier-Bench基准测试中生成三维机械零件示意图的任务为例,由于模型无法直接查看图纸,准确性验证极具挑战。Opus 5采用了一种创新方式来解决这一难题——自主编写"计算机视觉流水线,从原始像素中提取几何数据",从而完成了验证。

输出验证功能同样适用于生物学研究。Anthropic表示,Opus 5在所有内部生命科学基准测试中均超越了此前的Opus 4.8版本,在自动化蛋白质研究领域表现尤为突出。该领域正是2024年诺贝尔化学奖所关注的重要研究方向。

在安全性方面,Anthropic表示Opus 5是其迄今为止最安全的模型,多项指标均优于前代产品。与前代模型相比,该大语言模型发生欺骗性行为及难以撤销错误的概率均有所降低。

Anthropic之所以未公开发布旗舰级的Mythos 5,是出于对其可能被黑客用于发起网络攻击的担忧——该模型不仅能发现系统漏洞,还能制定漏洞利用工作流程。相比之下,Opus 5在Anthropic一项专门评估大语言模型漏洞利用能力的内部基准测试中得分为零。

Anthropic为Opus 5配备了比Fable 5更为宽松的安全防护机制。用户可借助Opus 5扫描代码中的安全漏洞,但该模型会屏蔽黑客常用的漏洞扫描方式。Anthropic预计,Opus 5的安全防护机制触发频率将比Fable 5降低约85%。

目前,Opus 5已成为Claude聊天服务顶级Max套餐的默认模型,同时也适用于中级Pro套餐。开发者可通过Anthropic的应用程序编程接口将Opus 5接入自己的软件系统。此次更新还为API新增了两项功能:一是支持在大语言模型执行工作流程途中进行中断并更换工具;二是可将被安全防护机制拦截的提示词自动转发至其他模型处理。

Q&A

Q1:Claude Opus 5和Fable 5相比,哪个模型更值得选择?

A:根据Anthropic的测试数据,Opus 5在13项基准测试中有8项得分高于Fable 5,而其成本仅约为Fable 5的50%。尤其在Frontier-Bench和AutomationBench两项测试中,Opus 5分别高出9.7%和8.5%。此外,Opus 5的安全防护触发频率比Fable 5低约85%,使用体验更加流畅。综合性能与成本考量,Opus 5性价比更高。

Q2:Claude Opus 5在安全性上有哪些改进?

A:Opus 5是Anthropic迄今最安全的模型。与前代相比,它发生欺骗性行为和难以撤销错误的概率更低。在漏洞利用能力评估的内部测试中,Opus 5得分为零,而旗舰级Mythos 5因能发现并利用系统漏洞,存在被黑客滥用的风险,因此未对外公开。Opus 5的安全防护机制触发频率也比Fable 5降低约85%。

Q3:开发者如何接入Claude Opus 5?API有哪些新功能?

A:开发者可通过Anthropic的应用程序编程接口(API)将Opus 5集成到自己的软件中。此次更新为API带来两项新功能:一是支持在模型执行工作流程中途中断并更换工具,提升了调用灵活性;二是可将被安全防护机制拦截的提示词自动转发至其他模型处理,确保任务连续性。

SiliconANGLE