
Claude Opus 5 登顶 Artificial Analysis 智能排行榜,多项 AI 模型性能数据披露
根据 Artificial Analysis 最新发布的 AI 模型性能评估报告,Claude Opus 5 (max) 与 Claude Opus 5 (xhigh) 成功超越 GPT-5.6 Sol 等竞争对手,位居智能指数榜首。该报告详细对比了全球主流 AI 模型在智能、速度、延迟、价格及上下文窗口等关键维度的表现。Mercury 2 以 939 t/s 的速度领跑性能榜,而 Llama 4 Scout 则以 1000 万 token 的上下文窗口刷新纪录。
核心要点
- 智能巅峰:Claude Opus 5 系列(max 和 xhigh 版本)目前在 Artificial Analysis 智能指数中排名第一,超越了 GPT-5.6 Sol。
- 性能突破:Mercury 2 展现了极高的推理速度,达到每秒 939 个 token,成为目前最快的模型。
- 极低延迟:Gemini 2.5 Flash-Lite 以 0.35 秒的延迟在响应速度上领先,紧随其后的是 Command A+。
- 超大上下文:Llama 4 Scout 提供了高达 1000 万 token 的超大上下文窗口,远超其他竞争对手。
- 成本优势:Devstral 2 和 North Mini Code 在价格维度上表现最突出,每百万 token 成本为 0 美元。
详细分析
智能维度的巅峰对决
在最新的 Artificial Analysis 智能指数 v4.1 中,Claude Opus 5 展现了卓越的性能。该指数是一个综合性的评估体系,包含了 GDPval-AA v2、𝜏³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 以及 AA-LCR 等 9 项严苛评估。Claude Opus 5 (max) 和 Claude Opus 5 (xhigh) 的登顶,标志着 Anthropic 在大语言模型逻辑推理与知识理解方面的领先地位。紧随其后的是 Claude Fable 5(带回退机制)和 GPT-5.6 Sol (max),这显示出顶级模型之间的竞争已进入白热化阶段。
速度、延迟与效率的权衡
除了纯粹的智能,性能指标也是衡量模型实用性的关键。在输出速度方面,Mercury 2 以惊人的 939 t/s 位居榜首,远超 HyperNova 60B 2605 的 436 t/s。在低延迟应用场景中,Google 的 Gemini 2.5 Flash-Lite 和 Command A+ 表现突出,响应时间分别控制在 0.35 秒和 0.41 秒。这些数据表明,针对实时交互和高吞吐量需求,行业内已经出现了专门优化的轻量化或高性能模型,如 Gemini 3.5 Flash-Lite 和 Granite 4.0 H Small。
上下文容量与成本控制的新标杆
在处理长文本能力上,Llama 4 Scout 以 10M(1000 万)token 的上下文窗口遥遥领先,Grok 4.20 0309 则以 2M 紧随其后。这种超大规模的上下文支持为处理超长文档、复杂代码库和长时间对话提供了可能。与此同时,成本控制也达到了极致,Devstral 2 和 North Mini Code 实现了零成本($0.00/M tokens),而 Gemma 3 系列(4B 和 27B)也保持了极高的性价比。这反映了 AI 市场在追求高性能的同时,也在不断下探使用门槛。
行业影响
此次排名更新反映了 AI 行业竞争的最新格局。Claude Opus 5 的登顶挑战了 OpenAI 在智能领域的传统统治地位,证明了多维度评估体系下模型表现的多样性。同时,模型性能的分化愈发明显:一部分模型追求极致的智能(如 Opus 5、GPT-5.6),另一部分则在速度(Mercury 2)或成本(Devstral 2)上寻求差异化竞争。这种多样化的发展趋势将为不同需求的开发者提供更精准的选择,推动 AI 应用在各行各业的深度落地,尤其是在需要超长上下文或极速响应的专业领域。
常见问题
问题:什么是 Artificial Analysis 智能指数 v4.1?
答:它是衡量 AI 模型综合能力的指标,包含了 GDPval-AA v2、SciCode、GPQA Diamond 等 9 项专业评估,旨在通过多维度测试反映模型的真实智能水平。
问题:目前最快的 AI 模型是哪一个?
答:根据最新数据,Mercury 2 是目前输出速度最快的模型,达到每秒 939 个 token,远高于行业平均水平。
问题:哪些模型在上下文窗口上具有显著优势?
答:Llama 4 Scout 拥有最大的上下文窗口,达到 1000 万 token,其次是 Grok 4.20 的 200 万 token,这使得它们在处理超长文本任务时具有明显优势。


