DeepSeek V4 Flash 0731 发布:ARC-AGI 跑分创纪录,推理能力大幅提升
DeepSeek 发布了 V4 Flash 0731 模型,在 ARC-AGI 基准测试中表现出色。该模型在 ARC-AGI-1 半私有测试中达到 89.0% 的最高分,在 ARC-AGI-2 中达到 61.4%。通过提供三种不同的推理变体(Max, High, Low),DeepSeek 展示了其在处理复杂抽象推理任务时的极高成本效益,单次任务成本低至 0.02 美元。
核心要点
- 卓越的跑分表现:DeepSeek V4 Flash 0731 在 ARC-AGI-1 半私有测试中取得了 89.0% 的最高分。
- 挑战高难度测试:在更具挑战性的 ARC-AGI-2 半私有测试中,该模型最高得分达到 61.4%。
- 灵活的推理变体:模型提供 Max、High、Low 三种推理强度,以平衡性能与资源消耗。
- 极高的成本效益:ARC-AGI-1 的单次任务成本仅为 0.02 美元,ARC-AGI-2 为 0.04 美元。
- 详尽的任务验证:在 ARC-AGI-2 公开评估集的 120 个任务中进行了多层级推理通过率验证。
详细分析
卓越的推理性能表现
DeepSeek V4 Flash 0731 在 ARC-AGI(抽象与推理语料库)基准测试中展现了极强的竞争力。根据 2026 年 7 月 31 日公布的数据,在“Max effort”(最大努力)模式下,该模型在 ARC-AGI-1 半私有测试中达到了 89.0% 的准确率。即使在难度显著提升的 ARC-AGI-2 测试中,其得分也达到了 61.4%。这表明该模型在处理抽象推理、逻辑推演和泛化任务方面具有显著优势,能够有效应对未曾见过的逻辑谜题。
多层级推理变体与成本控制
DeepSeek 为该模型设计了三种推理变体:Max、High 和 Low。这种分层设计允许用户根据任务的复杂程度和预算灵活选择。在 ARC-AGI-1 测试中,Max 变体得分为 89.0%,High 为 87.0%,Low 为 84.0%;而在 ARC-AGI-2 中,得分分别为 61.4%、56.0% 和 46.0%。值得注意的是,该模型在保持高性能的同时,单次任务成本极低,ARC-AGI-1 仅需 0.02 美元,这为大规模应用复杂推理能力提供了可能。
任务通过率的深度观察
在对 ARC-AGI-2 公开评估集的 120 个任务进行的详细测试中,DeepSeek 展示了其在不同推理水平下的稳定性。通过对具体任务 ID(如 135a2760, 16de56c4 等)的 Pass/Fail 记录可以看到,Max 和 High 变体在绝大多数任务中表现一致,但在部分极端复杂的任务中,只有 Max 模式能够成功破解。这种详尽的数据披露为开发者理解模型的推理边界提供了重要参考。
行业影响
DeepSeek V4 Flash 0731 的测试结果再次证明了国产大模型在 AGI(通用人工智能)核心推理能力上的重大突破。ARC-AGI 被公认为衡量 AI 真正智能而非简单的模式记忆的关键指标。DeepSeek 以极低的成本实现了接近人类水平的推理准确率,这将推动 AI 行业向更高效、更具逻辑性的方向发展,显著降低了复杂逻辑分析和抽象任务的商业化门槛,预示着 AI 在解决复杂现实问题上的潜力进一步释放。
常见问题
DeepSeek V4 Flash 0731 在 ARC-AGI 测试中的最高分是多少?
在 ARC-AGI-1 半私有测试中,该模型的最高得分为 89.0%;在 ARC-AGI-2 半私有测试中,最高得分为 61.4%。
该模型的推理成本如何?
DeepSeek V4 Flash 0731 具有极高的成本效益。在 ARC-AGI-1 任务中,单次任务成本为 0.02 美元;在 ARC-AGI-2 任务中,单次任务成本为 0.04 美元。
什么是 ARC-AGI 测试?
ARC-AGI(Abstraction and Reasoning Corpus)是一个旨在评估人工智能系统通用智能和抽象推理能力的基准测试。它要求模型能够通过极少量的示例,解决从未见过的视觉逻辑谜题,是目前衡量 AGI 进展的重要指标之一。


