毫无悬念,Anthropic正式发布了Claude Opus 5。继上个月推出备受争议的Mythos 5和Fable 5,以及7月1日发布Sonnet 5之后,Opus从4.8升级至5.0可谓水到渠成,而这一天终于到来。
笔者此前对Opus 4.8颇为满意,将其用于多个大型编程项目,表现相当出色。但根据部分用户的早期反馈,Claude Code很可能将在此次更新中迎来又一次重大提升。
Anthropic的发布公告中引用了多位业内人士的评价。Stripe软件工程师Cristian Rivera表示:"Opus 5相比Opus 4.8有着清晰的代际进步。在某个周末,我让它担任我开发环境的'总参谋长':它自己搭建了监控系统,接管了各个节点,只在需要做判断的关键时刻才拉我介入。"
专注于AI法律工具的Harvey公司,其应用研究负责人Niko Grupen表示:"与之前的Opus系列相比,Claude Opus 5在法律智能体任务上的表现有了明显提升,尤其在公司治理和仲裁等实务领域收益最为显著。"他补充道:"Opus 5在较低推理级别下依然能保持高质量输出,与Opus 4.8的最高推理模式相比,平均减少了26%的Token消耗,同时达到相近的性能水平,这一点令我们印象深刻。"
Token消耗量不仅仅反映成本,它同样衡量着AI在处理复杂任务时所承受的压力。即便使用拥有百万Token上下文窗口的Opus 4.8,笔者使用Claude Code时也曾多次遇到模型主动请求"暂停休息"的情况。以更少的Token完成相同的工作,意味着单次会话能走得更远,这无疑是个令人期待的改进。
Anthropic表示,"Opus 5在众多领域的能力已接近Claude Fable 5,而价格仅为后者的一半。"官方称其是Anthropic迄今发布的知识工作性能最强的模型,并在复杂编程任务上取得了显著进步。这两点提升将直接转化为Claude Cowork和Claude Code在实际使用中的效率增益。
AI开发工具Cursor的联合创始人Sualeh Asif也印证了这一判断:"Claude Opus 5以Opus的速度和成本,提供了接近Fable 5的智能水平。在CursorBench基准测试上,它略低于Fable 5,但在许多行为表现上高度相似。我们期待看到开发者如何在Cursor中发挥它的潜力。"
Anthropic预计Opus 5将成为日常主力模型,尤其在企业级场景中。笔者以每月100美元的Claude Max计划深度使用Opus 4.8,过去一周进行了大量长流程智能体任务的测试,目前本周使用量仅达上限的31%,并未遭遇任何限速。预计切换至Opus 5后,将拥有更充裕的余量来完成复杂任务。
在能力层面,Opus 5不仅强化了知识工作处理能力,还显著提升了自主性,减少了反复交互的需要,错误恢复能力更强,自我检查频率也更高。
值得关注的是,Anthropic再次提及Opus在生物学及其他科学研究领域的应用。官方表示,Opus 5"在生物学任务上的表现超越了Opus 4.8"。尽管"超越"的具体含义尚未明确界定,但可以合理推断,这意味着更优质、更高效、更低成本的输出。
在定价方面,Opus 5与Opus 4.8保持一致:API调用按Token计费,输入为每百万Token 5美元,输出为每百万Token 25美元。对于Claude Max订阅用户,Opus 5将作为默认模型提供,并在"所有付费计划内享有标准使用限额"。
Anthropic仍建议将Fable 5用于"最具挑战性的任务——那些需要数天时间、此前任何模型都无法胜任的自主项目"。笔者目前正准备为自己的iPhone和Mac应用接入内购功能,计划将这个颇具挑战性的项目交给Fable 5来处理,届时将观察其实际表现。
Opus 5现已向所有此前拥有Opus 4.8访问权限的用户层级开放。
Q&A
Q1:Claude Opus 5的定价是多少?
A:Claude Opus 5的定价与Opus 4.8保持一致。对于API Token用户,输入费用为每百万Token 5美元,输出费用为每百万Token 25美元。对于Claude Max订阅用户(每月100美元),Opus 5将作为默认模型提供,并在所有付费计划内享有标准使用限额。
Q2:Claude Opus 5和Claude Fable 5有什么区别?
A:Opus 5在众多领域的能力已接近Fable 5,但价格仅为后者的一半。Fable 5更适合"最具挑战性的任务",即需要数天时间的长周期自主项目。而Opus 5被定位为日常主力模型,尤其适合企业级场景,在知识工作和复杂编程任务上表现出色,同时拥有更强的自主性和错误恢复能力。
Q3:Claude Opus 5在Token消耗上有哪些改进?
A:根据Harvey公司的测试数据,Claude Opus 5在较低推理级别下能达到与Opus 4.8最高推理模式相近的性能,同时平均减少了26%的Token消耗。Token消耗量减少不仅意味着成本降低,还代表AI处理复杂任务时的压力更小,单次会话能够完成更多工作,减少中途"暂停"的情况。
