Opus 5 挑战 SlopCodeBench 编程基准测试:24% 通过率揭示长程代码演进难题
2026年7月,研究人员针对 Anthropic 的 Opus 5 模型在 SlopCodeBench 基准测试上进行了深度评估。该测试模拟真实软件开发过程,要求模型在需求不断演进的情况下维护代码库。结果显示,Opus 5 虽然以 24% 的通过率领先于前代模型,但在应对代码冗余、复杂度和“代码异味”方面表现欠佳。测试观察到 Opus 5 生成的函数数量远超前代,反映出当前 AI 在处理长程软件工程任务时仍面临严峻挑战。
核心要点
- 动态需求测试:SlopCodeBench 区别于传统一次性给出问题的基准测试,它通过多个“检查点”逐步发布需求,要求模型随时间演进代码库。
- Opus 5 表现:在测试子集中,Opus 5 取得了 24% 的严格通过率,略高于此前 Opus 4.6 的 17% 和 GPT-5.4 的 11%。
- 代码质量隐忧:所有受测模型在任务过程中均表现出冗余度(Verbosity)和复杂度的显著增加,存在明显的“代码异味”问题。
- 函数激增现象:Opus 5 在相同任务集中编写的函数/调用数量是 Opus 4.8 的五倍,显示出其在代码组织上的局限性。
- 行业现状:测试结果表明,目前的 AI 模型在处理真实场景下的持续性软件工程工作时,依然难以维持代码库的长期质量。
详细分析
动态演进:SlopCodeBench 的独特测试机制
SlopCodeBench 是由威斯康星大学麦迪逊分校(UW Madison)实验室开发的一种新型长程编程基准测试。与传统测试不同,它解决了开发者最关注的问题:即大多数基准测试会预先披露所有问题细节。而在 SlopCodeBench 中,每个挑战都包含多个“检查点”,模型无法预知后续需求,必须像人类开发者一样,在不断变化的要求下逐步优化和扩展代码库。这种模式更贴近真实的软件开发流程,对模型的逻辑一致性和架构设计能力提出了极高要求。
Opus 5 的性能表现:提升与代价并存
在针对 Claude 系列模型(包括 Opus 4.8、Sonnet 5 和 Opus 5)的实测中,Opus 5 虽然在技术指标上胜出,取得了 24% 的通过率,但这一进步并未达到令人满意的程度。研究发现,随着挑战的深入,Opus 5 生成的代码变得异常臃肿。具体数据显示,Opus 5 生成的函数和可调用对象数量竟然是 Opus 4.8 的五倍。这种复杂度的提升往往伴随着“代码异味”的增加,意味着模型在解决问题的同时,也在不断引入难以维护的技术债。
真实软件工程的挑战:从“生成”到“维护”
本次测试结果为 AI 行业提供了一个重要的信号:当前的 AI 模型在处理“一次性”代码生成任务时表现出色,但在面对需要逐个解决 issue、持续迭代的真实软件工程任务时,依然显得力不从心。尽管 Opus 5 在通过率上有所突破,但其在代码简洁性和长期维护性上的表现,证明了 AI 距离成为真正合格的“AI 软件工程师”仍有很长一段路要走。未来,如何让模型在保持功能正确性的同时,兼顾代码的优雅与精简,将是行业研究的重点。
行业影响
该新闻揭示了 AI 编程领域从“简单任务完成”向“长程工程维护”评估的范式转移。SlopCodeBench 的未饱和状态(最高通过率仅 24%)为下一代编程模型指明了方向。对于开发者工具厂商而言,这预示着未来的竞争焦点将不再仅仅是代码生成的准确性,更是对代码库演进过程中的质量控制能力。此外,Opus 5 的表现也提醒行业,模型规模的增长并不直接等同于软件工程能力的质变。
常见问题
什么是 SlopCodeBench?
SlopCodeBench 是由威斯康星大学麦迪逊分校于 2026 年 3 月发布的一种长程编程基准测试。它的核心特点是采用“检查点”机制,模拟真实开发中需求逐步披露的过程,测试模型在代码库演进中的维护能力。
Opus 5 在测试中的主要问题是什么?
虽然 Opus 5 的通过率有所提升,但其生成的代码存在严重的冗余和复杂性问题。在测试中,它生成的函数数量是前代模型的五倍,表现出明显的“代码异味”,难以维持高质量的代码库架构。
目前表现最好的模型有哪些?
根据已知数据,在 SlopCodeBench 上表现较好的模型包括 Opus 5(24% 通过率)、Opus 4.6(17%)和 GPT-5.4(11%)。未来预计还将有 Fable 和 5.6 Sol 等模型加入测试对比。


