
NanoGPT Speedrun 挑战赛:Fable 5 领跑,AI 智能体正逼近人类优化极限
Prime Intellect 发布了最新的 NanoGPT Speedrun Frontier 排行榜,展示了全球顶尖 AI 模型在优化 NanoGPT 训练任务中的表现。数据显示,Fable 5 以 81.7% 的人类记录差距闭合率位居榜首,Opus 5 和 Kimi K3 紧随其后。该榜单揭示了 AI 智能体在复杂编程与系统优化任务中的最新进展。
核心要点
- Fable 5 占据统治地位:目前以 81.7% 的人类记录差距闭合率领跑榜单,是唯一突破 80% 大关的模型。
- 第二梯队竞争激烈:Opus 5 和 Kimi K3 分别以 53.6% 和 52.2% 的闭合率位列二、三名,差距极小。
- 智能体多样化:挑战涉及 claude-code、prime-agent、kimi-code、codex 等多种 AI 智能体工具。
- 时间跨度差异显著:各模型完成任务的时间从 0.6 天到 9 天不等,反映了不同策略下的计算效率。
详细分析
性能梯队:Fable 5 展现代差优势
根据 NanoGPT Speedrun Frontier 的最新数据,Fable 5 在这项旨在优化 NanoGPT 训练的挑战中展现了显著的领先优势。其“人类记录差距闭合率”(Share of the human record gap closed)达到了 81.7%,这一成绩远超其他竞争对手。紧随其后的 Opus 5 和 Kimi K3 虽然也表现出色,闭合率均超过 50%,但与 Fable 5 相比仍有约 30 个百分点的差距。这表明在处理高度复杂的代码优化和底层性能调优任务时,Fable 5 所采用的架构或智能体策略具有更强的逻辑推理与工程实现能力。
智能体协同:编程助手的实战检验
榜单不仅展示了底座模型的实力,也体现了 AI 智能体(Agent)在实际工程环境中的表现。Fable 5 配合使用的 claude-code 智能体在 8.7 天的运行周期内完成了高质量的优化。而 Opus 5 同样使用 claude-code,在 2.9 天内达到了 53.6% 的闭合率。此外,Kimi K3 结合 prime-agent 和 kimi-code 也展现了极强的竞争力。这些数据证明,AI 已经能够通过长时间的自主尝试(Agent time),在复杂的编程挑战中不断逼近人类专家的优化水平。
行业覆盖:全球大模型集体参与
此次 Speedrun 挑战赛涵盖了目前市场上主流的几乎所有顶级模型,包括 GPT-5.6 系列(Sol, Luna, Terra)、Grok 4.5/4.6、Qwen3.8 Max、GLM 5.2 以及 DeepSeek V4 Pro 等。从数据分布来看,虽然 Fable 和 Opus 系列暂时领先,但国产模型如 Kimi K3、Qwen3.8 Max 和 GLM 5.2 也展现了不俗的实力,处于榜单的中上游位置。这种全球范围内的技术竞技,加速了 AI 在自动化编程和系统级优化领域的演进。
行业影响
NanoGPT Speedrun 的意义在于它将 AI 的评估从简单的对话或逻辑题,转向了具有实际工程价值的“性能优化”任务。Fable 5 逼近人类记录的表现预示着,AI 智能体正从辅助写代码进化到能够独立进行复杂的系统调优。这对于降低未来大模型的训练成本、提升计算效率具有极高的参考价值。同时,这也标志着 AI 编程工具(如 claude-code 和 prime-agent)正在成为开发者提升生产力的核心基础设施。
常见问题
什么是 NanoGPT Speedrun 挑战?
这是一个衡量 AI 模型优化 NanoGPT 训练速度能力的基准测试。它通过计算 AI 优化的结果与人类专家记录之间的差距闭合百分比,来评估 AI 在复杂编程任务中的表现。
目前表现最好的模型和智能体是什么?
根据最新榜单,表现最好的是 Fable 5 模型,配合使用 claude-code 智能体,其人类记录差距闭合率达到了 81.7%。
为什么不同模型的运行时间差异很大?
运行时间(Agent time)反映了智能体在寻找最优解过程中消耗的计算时长。有些模型如 Sonnet 5 在 2 天内就达到了 26.8% 的闭合率,而 Fable 5 则通过长达 8.7 天的持续优化获得了更高的分数,这体现了不同智能体在效率与深度搜索之间的权衡。


