返回列表
NanoGPT Speedrun 挑战赛:Fable 5 领跑,AI 智能体正逼近人类优化极限
行业新闻AI 榜单编程智能体性能基准测试

NanoGPT Speedrun 挑战赛:Fable 5 领跑,AI 智能体正逼近人类优化极限

Prime Intellect 发布了最新的 NanoGPT Speedrun Frontier 排行榜,展示了全球顶尖 AI 模型在优化 NanoGPT 训练任务中的表现。数据显示,Fable 5 以 81.7% 的人类记录差距闭合率位居榜首,Opus 5 和 Kimi K3 紧随其后。该榜单揭示了 AI 智能体在复杂编程与系统优化任务中的最新进展。

Hacker News

核心要点

  • Fable 5 占据统治地位:目前以 81.7% 的人类记录差距闭合率领跑榜单,是唯一突破 80% 大关的模型。
  • 第二梯队竞争激烈:Opus 5 和 Kimi K3 分别以 53.6% 和 52.2% 的闭合率位列二、三名,差距极小。
  • 智能体多样化:挑战涉及 claude-code、prime-agent、kimi-code、codex 等多种 AI 智能体工具。
  • 时间跨度差异显著:各模型完成任务的时间从 0.6 天到 9 天不等,反映了不同策略下的计算效率。

详细分析

性能梯队:Fable 5 展现代差优势

根据 NanoGPT Speedrun Frontier 的最新数据,Fable 5 在这项旨在优化 NanoGPT 训练的挑战中展现了显著的领先优势。其“人类记录差距闭合率”(Share of the human record gap closed)达到了 81.7%,这一成绩远超其他竞争对手。紧随其后的 Opus 5 和 Kimi K3 虽然也表现出色,闭合率均超过 50%,但与 Fable 5 相比仍有约 30 个百分点的差距。这表明在处理高度复杂的代码优化和底层性能调优任务时,Fable 5 所采用的架构或智能体策略具有更强的逻辑推理与工程实现能力。

智能体协同:编程助手的实战检验

榜单不仅展示了底座模型的实力,也体现了 AI 智能体(Agent)在实际工程环境中的表现。Fable 5 配合使用的 claude-code 智能体在 8.7 天的运行周期内完成了高质量的优化。而 Opus 5 同样使用 claude-code,在 2.9 天内达到了 53.6% 的闭合率。此外,Kimi K3 结合 prime-agentkimi-code 也展现了极强的竞争力。这些数据证明,AI 已经能够通过长时间的自主尝试(Agent time),在复杂的编程挑战中不断逼近人类专家的优化水平。

行业覆盖:全球大模型集体参与

此次 Speedrun 挑战赛涵盖了目前市场上主流的几乎所有顶级模型,包括 GPT-5.6 系列(Sol, Luna, Terra)、Grok 4.5/4.6、Qwen3.8 Max、GLM 5.2 以及 DeepSeek V4 Pro 等。从数据分布来看,虽然 Fable 和 Opus 系列暂时领先,但国产模型如 Kimi K3、Qwen3.8 Max 和 GLM 5.2 也展现了不俗的实力,处于榜单的中上游位置。这种全球范围内的技术竞技,加速了 AI 在自动化编程和系统级优化领域的演进。

行业影响

NanoGPT Speedrun 的意义在于它将 AI 的评估从简单的对话或逻辑题,转向了具有实际工程价值的“性能优化”任务。Fable 5 逼近人类记录的表现预示着,AI 智能体正从辅助写代码进化到能够独立进行复杂的系统调优。这对于降低未来大模型的训练成本、提升计算效率具有极高的参考价值。同时,这也标志着 AI 编程工具(如 claude-code 和 prime-agent)正在成为开发者提升生产力的核心基础设施。

常见问题

什么是 NanoGPT Speedrun 挑战?

这是一个衡量 AI 模型优化 NanoGPT 训练速度能力的基准测试。它通过计算 AI 优化的结果与人类专家记录之间的差距闭合百分比,来评估 AI 在复杂编程任务中的表现。

目前表现最好的模型和智能体是什么?

根据最新榜单,表现最好的是 Fable 5 模型,配合使用 claude-code 智能体,其人类记录差距闭合率达到了 81.7%。

为什么不同模型的运行时间差异很大?

运行时间(Agent time)反映了智能体在寻找最优解过程中消耗的计算时长。有些模型如 Sonnet 5 在 2 天内就达到了 26.8% 的闭合率,而 Fable 5 则通过长达 8.7 天的持续优化获得了更高的分数,这体现了不同智能体在效率与深度搜索之间的权衡。

相关新闻

哈佛商学院推出699美元创业训练营:引入导师AI化身提供实时反馈
行业新闻

哈佛商学院推出699美元创业训练营:引入导师AI化身提供实时反馈

哈佛商学院(HBS)在其Foundry项目中推出了一项创新的创业训练营,售价699美元。该项目的核心亮点是引入了导师的AI化身(AI Avatars),旨在为学员在模拟路演和董事会会议期间提供即时的专业反馈。这一举措展示了顶级教育机构如何利用AI技术提升教学互动性,并降低高质量商业教育的获取门槛。

DeepMind前员工创办Inherent,发布AI智能体Faraday,科研复现能力超越OpenAI与Anthropic
行业新闻

DeepMind前员工创办Inherent,发布AI智能体Faraday,科研复现能力超越OpenAI与Anthropic

由DeepMind前成员创立的英国AI实验室Inherent近日发布了名为Faraday的AI智能体。该工具被定位为AI“队友”,在复现科学论文的研究能力上表现卓越。据Inherent官方表示,Faraday在科研复现任务中的表现已超越了行业巨头Anthropic和OpenAI。这一突破被视为推动科研创新的重要里程碑,展示了AI在处理复杂学术任务中的巨大潜力。

为什么你的本地大模型感觉比实际“笨”?深度解析推理实现中的性能损耗
行业新闻

为什么你的本地大模型感觉比实际“笨”?深度解析推理实现中的性能损耗

本文探讨了本地运行大语言模型(LLM)时性能不如预期的深层原因。作者指出,硬件差异(如不同代际的GPU指令集)、软件实现以及量化过程中的损失,导致本地推理环境与实验室的“参考实现”之间存在显著差异。即使运行相同的模型权重,底层数学运算的执行偏差也会影响Token的生成质量,使得本地模型在实际体验中显得不如宣传中聪明。