返回列表
Anthropic 发布 Claude Opus 5:性能逼近旗舰 Fable 5 且成本大幅降低
产品发布ClaudeAnthropic大语言模型

Anthropic 发布 Claude Opus 5:性能逼近旗舰 Fable 5 且成本大幅降低

Anthropic 正式推出 Claude Opus 5,这是一款兼具周全性与主动性的 AI 模型。其智能水平接近顶级模型 Claude Fable 5,但价格仅为一半。Opus 5 在编程、知识工作及复杂问题解决(如 ARC-AGI 3)方面表现卓越,刷新了多项行业基准。作为 Claude Max 的默认模型,它通过灵活的“努力程度设置”实现了极高的性价比,成为日常高效办公与软件工程的新标杆。

Hacker News

核心要点

  • 极致性价比:智能水平逼近旗舰模型 Claude Fable 5,但单次任务成本仅为其 50%。
  • 编程与知识工作 SOTA:在 Frontier-Bench 和 ARC-AGI 3 等多项权威评估中刷新纪录,性能远超前代。
  • 灵活成本控制:引入“努力程度设置”,允许用户根据需求在智能水平与 Token 消耗之间进行优化。
  • 广泛应用场景:成为 Claude Max 的默认模型及 Claude Pro 的最强模型,擅长自动化任务与软件工程。

详细分析

性能跨越:接近 Fable 5 的智能体验

Opus 5 的核心竞争力在于其极高的效能比。根据官方数据,在 CursorBench 3.2 评估中,Opus 5 在最高努力模式(max effort)下的表现与顶级模型 Fable 5 的峰值得分差距不足 0.5%,而成本却缩减了一半。相比前代 Opus 4.8,它在保持价格不变的前提下实现了性能的巨大飞跃,尤其在 Frontier-Bench v0.1 中,其表现达到了前代的两倍以上,且单次任务成本更低。

突破性的问题解决与自动化能力

在衡量模型解决新颖问题能力的 ARC-AGI 3 测试中,Opus 5 的得分达到了次优模型的三倍,展现了极强的逻辑推理能力。此外,在 Zapier AutomationBench 业务自动化测试中,其任务通过率是同等成本下其他模型的 1.5 倍。即使在最低努力设置下,Opus 5 的任务完成度依然领先于竞品,证明了其在处理端到端业务流程中的可靠性与高效性。

针对日常效率的优化设计

Opus 5 被设计为一款“周全且主动”的日常工具。它不仅在 OSWorld 2.0 计算机使用基准测试中超越了 Fable 5 的最佳纪录,还通过更高效的运行机制降低了延迟。虽然在网络安全特定任务上仍逊于 Mythos 5,但其在编程、知识处理和通用办公领域的全面表现,使其成为了 Claude Max 用户的首选默认模型,能够更高效地处理日常复杂任务。

行业影响

Opus 5 的发布标志着 AI 行业进入了“高智能、低成本”的普及化阶段。通过将接近顶级旗舰的性能下放到中端价位,Anthropic 正在重塑大模型的商业竞争格局。特别是其在 ARC-AGI 3 上的突破,暗示了模型在处理未知复杂任务上的巨大潜力,将推动软件工程自动化和企业级工作流自动化的进一步成熟。同时,灵活的“努力程度设置”为开发者提供了更精细的成本管理手段,有助于 AI 应用的大规模落地。

常见问题

问题 1:Claude Opus 5 与 Claude Fable 5 相比如何?

Opus 5 的智能水平非常接近 Fable 5(在某些测试中差距不足 0.5%),但其使用成本仅为 Fable 5 的一半,具有极高的性价比。

问题 2:Opus 5 在哪些领域表现最强?

它在编程(Frontier-Bench)、复杂问题解决(ARC-AGI 3)和业务自动化(Zapier AutomationBench)方面表现尤为出色,均达到了行业领先水平。

问题 3:用户如何控制 Opus 5 的运行成本?

Opus 5 支持“努力程度设置”(effort setting),用户可以根据任务需求选择更高的智能水平,或选择更低的设置以节省 Token 并获得更快的响应速度。

相关新闻