返回列表
SpaceXAI 发布 Grok 4.5:专为编程与代理任务设计的史上最强模型
产品发布SpaceXAIGrok人工智能

SpaceXAI 发布 Grok 4.5:专为编程与代理任务设计的史上最强模型

SpaceXAI 正式推出 Grok 4.5,这是其迄今为止最智能的模型,专注于编程、代理任务和知识工作。该模型采用数万个 NVIDIA GB300 GPU 训练,并与 Cursor 深度协作。在多项工程基准测试中,Grok 4.5 展现出卓越的工程实践能力,在 SWE Bench Pro 等指标上甚至超越了 GPT 5.5,标志着 SpaceXAI 在高性能 AI 领域取得重大突破。

Hacker News

核心要点

  • 定位明确:Grok 4.5 是 SpaceXAI 迄今为止最智能的模型,专门针对编程、代理任务(Agentic tasks)和知识工作进行了优化。
  • 深度协作训练:该模型与知名 AI 编程工具 Cursor 共同训练,旨在提升真实世界的工程处理能力。
  • 顶级算力支撑:训练过程动用了数万个 NVIDIA GB300 GPU,并应用了专门的大规模运行稳定性技术。
  • 基准测试表现:在 SWE Bench Pro 测试中,Grok 4.5 以 64.7% 的解决率超越了 GPT 5.5 (58.6%),展现出极强的软件工程问题解决能力。

详细分析

卓越的工程与编程能力

Grok 4.5 的核心优势在于其对工程任务的深度理解。根据 SpaceXAI 的介绍,该模型在包含编程、科学、工程和数学的广泛数据集上进行了训练。特别值得注意的是,Grok 4.5 是与 Cursor 共同训练的,这种协作确保了模型在实际开发环境中的实用性。在 SWE Bench Pro 基准测试中,Grok 4.5 取得了 64.7% 的解决率,这一成绩优于 GPT 5.5 (58.6%),显示出其在处理复杂软件工程问题上的独特优势。

大规模算力支撑与技术稳定性

为了打造这款最强模型,SpaceXAI 投入了巨大的硬件资源。Grok 4.5 的训练过程动用了数万个 NVIDIA GB300 GPU。除了庞大的算力支持,团队还专门开发了针对大规模运行的训练和稳定性技术。这种技术积累不仅保证了模型训练的效率,也为其在处理复杂逻辑推理和知识工作时提供了坚实的基础。除了原始的 Token 吞吐量,SpaceXAI 还重点投资了训练架构的优化。

行业基准测试表现

在多项权威基准测试中,Grok 4.5 均位居行业前列。在 Terminal Bench 2.1 中,它以 83.3% 的得分紧追 GPT 5.5 (83.4%)。虽然在 DeepSWE 1.1 中 53% 的得分略逊于 Fable 和 GPT 5.5,但在综合工程实践和真实世界任务处理上,Grok 4.5 证明了自己作为顶级大模型的竞争力。这些数据表明,Grok 4.5 在处理终端操作和复杂工程逻辑方面已达到世界领先水平。

行业影响

Grok 4.5 的发布标志着 AI 模型竞争进入了“工程化”和“代理化”的新阶段。通过与 Cursor 的深度绑定,SpaceXAI 展示了模型与开发工具协同进化的新范式,这可能会改变未来软件开发的工作流。此外,大规模 GB300 GPU 的应用也预示着顶级 AI 厂商在算力竞赛上的持续加码,进一步抬高了通用人工智能(AGI)研发的门槛。

常见问题

问题 1:Grok 4.5 相比前代模型有哪些核心提升?

Grok 4.5 是 SpaceXAI 迄今为止最智能的模型,特别强化了编程、代理任务(Agentic tasks)和知识工作能力,并在多项工程基准测试中表现出色,部分指标超越了竞争对手的最新模型。

问题 2:Grok 4.5 的训练使用了什么硬件?

该模型使用了数万个 NVIDIA GB300 GPU 进行训练,并采用了专门设计的大规模训练与稳定性技术,以确保在海量数据下的训练效果。

问题 3:Grok 4.5 在编程测试中的表现如何?

在 SWE Bench Pro 测试中,Grok 4.5 的解决率为 64.7%,超过了 GPT 5.5 (58.6%) 和 Opus 4.7 (64.3%),展现了极强的软件工程问题解决能力。

相关新闻

Clipnote 正式登陆 Product Hunt:开发者 Okumura Daichi 发布全新效率工具
产品发布

Clipnote 正式登陆 Product Hunt:开发者 Okumura Daichi 发布全新效率工具

2026年9月7日,开发者 Okumura Daichi 在知名产品发现平台 Product Hunt 上正式发布了名为 Clipnote 的新产品。作为一款在效率工具领域崭露头角的新作,Clipnote 的上线引起了社区的关注。尽管目前原始信息未披露具体的功能细节,但其发布标志着个人开发者在 2026 年效率工具市场的持续活跃与创新尝试。

Grok Bot 深度分析:兼具 OpenClaw 的强大性能与 MacBook 式的极致简易
产品发布

Grok Bot 深度分析:兼具 OpenClaw 的强大性能与 MacBook 式的极致简易

本文深入探讨了 SpaceXAI 最新推出的 Grok Bot。根据 Dan McAteer 的实测反馈,Grok Bot 在编程能力上已达到 OpenClaw 的顶尖水平,但其核心优势在于提供了更高维度的编程抽象层级。这种设计使得复杂的 AI 编程任务能够以类似 MacBook 的简洁方式完成,标志着高性能 AI 工具正向极致易用性演进。

OpenAI 旗舰模型 GPT-6 Astra 正式上线 OpenRouter:支持 1M 上下文与端到端智能体任务
产品发布

OpenAI 旗舰模型 GPT-6 Astra 正式上线 OpenRouter:支持 1M 上下文与端到端智能体任务

2026年9月4日,OpenAI 的最新旗舰级模型 GPT-6 Astra 正式登陆 OpenRouter 平台。该模型专为高难度端到端任务设计,在软件工程、深度研究及科学工作领域表现卓越,尤其擅长涉及计算机与浏览器操作的长程智能体任务。GPT-6 Astra 提供高达 1M 的超长上下文支持,定价为输入每百万代币 10 美元,输出每百万代币 50 美元,标志着 AI 智能体能力进入全新阶段。