Claude Opus 5 登场:Anthropic 两个月内发布的第四个模型

新闻摘要
Anthropic 于 2026 年 7 月 24 日(太平洋时间)星期五正式推出了 Claude Opus 5,将其定位为迄今为止性能最佳且最具成本效益的版本。该公司表示,Opus 5 的能力几乎与其顶级模型 Claude Fable 5 不相上下,但每 token 的成本却只有其一半,并且现在已成为 Anthropic 大部分消费者和开发者产品的默认模型。这是 Anthropic 在不到两个月的时间里发布的第四个模型,此前在 2026 年 6 月发布了 Claude Mythos 5、Claude Fable 5 和 Claude Sonnet 5。
定价和可用性
Claude Opus 5 的定价为每百万输入 token 5 美元,每百万输出 token 25 美元,与前代 Claude Opus 4.8 相同。这意味着开发者和企业客户可以在不增加成本的情况下获得显著的能力升级。相比之下,Anthropic 最强大的模型 Claude Fable 5 的每 token 价格大约是其两倍,这使得 Opus 5 成为需要强大推理能力但又不想支付高昂价格的团队更经济的选择。该模型现已通过 Claude API、AWS 上的 Claude Platform 以及包括 Amazon Bedrock 和 Google Cloud Vertex AI 在内的支持的云合作伙伴提供。
基准性能
Anthropic 强调了多项独立和内部基准测试结果,以展示 Opus 5 相较于 Opus 4.8 在能力上的飞跃:
- 在 FrontierBench v0.1 上,这是一个评估真实软件工程工作的代理终端编码基准,包括多文件更改、调试和根据规范构建功能,Opus 5 在最大推理努力下得分 43.3%。相比之下,Opus 4.8 为 18.7%,Fable 5 为 33.7%,领先的竞争模型为 37.5%。
- 在 ARC-AGI-3 上,这是一个旨在测试在没有明确规则或目标的情况下,在交互式、回合制环境中进行新颖问题解决能力的基准,Opus 5 达到了 30.2%——几乎是排名第二的竞争模型近四倍。该基准专门设计用于抵制记忆和简单的模式匹配,奖励能够逐步推理不熟悉情况的模型。
Anthropic 表示,这些进步主要归功于模型在规划和验证自身工作方式上的改进,而非仅仅是原始规模的提升。
新的“努力”控制,平衡成本与能力
Opus 5 最显著的新增功能之一是面向用户的“努力”设置,允许开发者为给定的任务或提示选择低、中、高三个推理深度级别。较低的努力级别可以更快、更经济地完成简单的请求,而较高的级别则会分配更多的计算资源用于规划、自我检查和解决更难的问题。Anthropic 表示,这使得开发者能够精细地控制响应速度、成本和准确性之间的权衡,而不是强制对每个请求都采用单一固定的行为。
判断和自我验证
Anthropic 强调,Opus 5“在验证其工作和仔细迭代直到成功方面要强大得多”,公司认为这是由于训练模型在规划过程中就能捕捉到自身的逻辑错误,而不是仅在生成答案后才进行。实际上,这意味着 Opus 5 会花费更多的推理过程来检查中间步骤是否正确以及答案为何有效,而不是简单地生成输出然后继续。Anthropic 将此视为迈向更可靠的代理行为的一步——这对于多步编码项目、数据分析和工作场所自动化等任务非常有用,在这些任务中,一个被忽视的错误可能会在许多步骤中累积。
Anthropic 近期模型路线图中的背景
Opus 5 的推出是 Anthropic 在 2026 年夏季快速发布模型的一部分。6 月份,该公司推出了 Claude Sonnet 5,旨在平衡日常开发工作的速度和智能;推出了 Claude Fable 5,这是其最强大、最昂贵的模型,用于最困难的推理和长周期代理任务;以及 Claude Mythos 5,这是一个通过有限研究计划提供的专业变体。随着 Opus 5 以不变的价格填补了产品线的中高端市场,Anthropic 在两个月内有效地更新了其整个模型家族,这一速度反映了公司更快的内部培训和评估周期。
对开发者和教育者的意义
对于探索应用人工智能的学生、研究人员和开发者来说,Opus 5 结合了更强的推理基准和不变的价格,降低了尝试更强大的代理系统的门槛——包括编码助手、自动化研究工具和多步任务代理——而无需增加运营成本。新的努力控制也提供了一个具体的、实践性的例子,说明现代语言模型如何通过计算来换取准确性,这一概念在机器学习课程和应用人工智能工程中越来越重要。