← 返回首页 — Anthropic News — 进阶
模型公司 · 深度解读 · IMPACT 8/10

Claude Opus 5 发布:半价接近顶配,Anthropic 的“长跑智能体”思维变了

原文: Introducing Claude Opus 5

Anthropic 发布 Opus 5,以 Fable 5 一半的成本实现接近顶级的智能水平,其自我迭代和自主构建工具的能力,预示着智能体模型的新方向。

核心要点
  • Opus 5 以 Fable 5 一半的成本,在多项基准上达到或逼近其性能,成为性价比之王。
  • 在 ARC-AGI 3 上得分是第二名的三倍,展现了强大的推理和泛化能力。
  • 面向长跑智能体优化,能自我验证、迭代,甚至自主构建计算机视觉管道完成任务。
  • 引入“努力程度”设置,允许开发者按需在智能、速度和成本间灵活权衡。
深度解读

当整个 AI 圈还在盯着“最高分”的时候,Anthropic 却转身发布了一款“半价优等生”——Claude Opus 5。它没有在绝对智商上碾压自家旗舰 Fable 5,却在多个维度上扔出了一串让人不得不重新思考“模型该长什么样”的信号。

起因:大模型竞赛进入“下半场”

过去一年,模型公司卷参数、卷基准分数。但一个尴尬的现实是:API 榜单上的最高分模型,因为成本太高,实际落地时很少被用到复杂的智能体场景。智能体需要长时间运行、反复调用,成本像漏水的水龙头。Anthropic 这次发布的 Opus 5,定位非常清晰:比 Fable 5 便宜一半,但在编码和知识工作上几乎同等聪明,甚至在某些智能体任务上靠自主性实现反超。这就是一篇写给开发者的“实用主义宣言”。

拆解:聪明之外,它更会“做事”

Opus 5 的性能无需多言:Frontier-Bench v0.1 上超越所有模型;ARC-AGI 3 得分是第二名的三倍;在计算机使用基准 OSWorld 2.0 上,只用 Fable 5 三分之一的成本就打破了 Fable 的最佳纪录。但真正让人印象深刻的,是它展现的“行动力”。

描述中一个案例:给 Opus 5 一张机器零件的图纸,让它编写代码重建 3D 模型,但故意不提供任何查看图纸的方式。Opus 5 没有抱怨工具不足,而是自己写了一个计算机视觉流水线,从像素中提取几何信息,完成了重建。其他模型在同一设置下五次尝试全部失败。另一个案例是它修复了一个真实的知名开源包管理器的边缘 bug,从定位根因到补丁一气呵成。

这揭示了一个深层变化:模型正从“问答机”变为“问题解决者”。它不再只是被动响应,而是会主动寻找路径、构建缺失的工具。Opus 5 被明确设计为“善于验证自己的工作并谨慎迭代直到成功”,这种自我纠错和工程能力,才是长跑智能体真正需要的肌肉。

趋势洞察:中间层模型的“智能体逆袭”

很多人认为,只有最顶尖的模型才能做好智能体。但 Opus 5 给出了另一种范式:如果一个模型足够便宜,且具备足够的工具使用和自我迭代能力,它完全能用“更勤奋”来弥补“稍微少一点的天赋”。这有点类似人类专家团队:一个经验略逊但更细致、更会使用工具的工程师,可能比一个孤独的天才更靠谱。

另外,Opus 5 引入“努力程度”设置,允许用户在智能与成本/速度之间动态调节,这是一项重要的工程化思维。它承认了真实世界中预算和延迟的约束,让同一模型可以灵活适配从即时聊天到后台慢跑的多种场景。这或许会成为一种行业标配。

实用价值:开发者应该怎么用?

如果你在构建需要多步骤、长时间运行的智能体应用(如自动化测试、代码审查、研究分析),Opus 5 提供了一个高性价比的新选择。你可以先用高努力设置让它攻克最难的子任务,再降低设置来节省成本。对于企业来说,它的成本控制和自主性意味着更可控的智能体预算和更少的人工兜底。

反常识:最好的模型不总是“最聪明的”

在 AI 基准的军备竞赛中,我们习惯盯着最高分。但 Opus 5 提醒我们:在实际工作流中,“会做事”比“最聪明”更重要。一个能主动构建工具、自我校验的模型,比一个单纯 IQ 更高但成本爆表的模型更有商业价值。Anthropic 这一招,本质上是把智能体竞赛的战场从“谁的智商更高”拉到了“谁更会干活”。

总之,Opus 5 不只是一次模型更新,它可能是智能体时代模型设计的转折点——不再追求绝对的最强,而是追求在预算内最可靠、最能自主完成任务的助手。对于天天跟智能体打交道的开发者,这才是真正的“版本答案”。


原文地址: Introducing Claude Opus 5

分析由 BitByAI 生成 · 阅读原文

原文来自 Anthropic News · 由 BitByAI 自动解读