返回列表
产品发布OpenAIGPT-5硬件加速

OpenAI发布Ultrafast模式:GPT-5.6 Sol推理速度提升14倍,每秒输出750个Token

OpenAI官方宣布推出全新的API服务层“Ultrafast”,专门针对GPT-5.6 Sol模型进行优化。该服务由Cerebras提供硬件支持,实现了高达14倍的速度提升,每秒可输出750个Token。这一进展标志着大模型推理效率进入了全新阶段,将显著改变实时AI应用的交互体验。

OpenAI Blog

核心要点

  • 性能飞跃:OpenAI推出Ultrafast API服务层,将GPT-5.6 Sol的运行速度提升了14倍。
  • 极高吞吐量:该模式下模型每秒可输出高达750个Token,远超现有标准推理速度。
  • 硬件驱动:此次性能突破由Cerebras提供的专用硬件技术提供核心动力。
  • 全新服务层:Ultrafast作为一种新的API服务级别,旨在满足对超高性能推理的需求。

详细分析

速度的量变与质变:14倍性能提升的意义

根据OpenAI Blog发布的最新消息,GPT-5.6 Sol在Ultrafast模式下的表现令人瞩目。14倍的速度提升不仅仅是数字上的增长,更是推理效率的质变。在传统的API服务中,大语言模型的生成速度往往受限于计算架构的带宽和延迟,而Ultrafast模式通过深度优化,将这一瓶颈大幅推后。每秒750个Token的输出能力意味着模型几乎可以在瞬间完成长文本的生成,这种极速响应能力对于需要高频交互和即时反馈的复杂任务至关重要。

硬件协同:Cerebras在推理加速中的角色

此次公告中明确提到,Ultrafast模式的卓越性能是由Cerebras提供支持的。Cerebras以其独特的晶圆级引擎(Wafer-Scale Engine)技术在AI硬件领域占据领先地位。通过将GPT-5.6 Sol部署在Cerebras的专用硬件之上,OpenAI能够利用其极高的内存带宽和极低的通信延迟。这种软硬件的高度协同,使得GPT-5.6 Sol能够充分发挥其架构潜力,实现了在传统通用GPU上难以达到的推理速度。这表明,未来大模型的竞争将越来越依赖于底层硬件的定制化支持。

API服务的新范式:Ultrafast服务层的定位

OpenAI引入Ultrafast作为一种新的API服务层,预示着其商业模式的进一步细分。通过提供不同速度等级的服务,OpenAI能够更好地满足不同类型用户的需求。对于那些对延迟极度敏感的应用场景——如实时同声传译、高频交易辅助或即时代码生成——Ultrafast模式提供了不可替代的价值。这种基于性能梯度的服务划分,也将引导开发者重新思考如何构建更高效、更具响应性的AI驱动应用。

行业影响

Ultrafast模式的推出对整个AI行业具有深远的示范效应。首先,它确立了推理速度的新标杆,迫使其他模型提供商加速其基础设施的升级。其次,每秒750个Token的吞吐量将直接推动实时AI应用的大规模落地,消除过去因延迟带来的用户体验障碍。最后,OpenAI与Cerebras的成功合作证明了专用AI芯片在超大规模模型推理中的巨大优势,这可能会引发行业内新一轮的硬件合作与投资热潮,推动AI计算向更加专业化和高效化的方向演进。

常见问题

什么是GPT-5.6 Sol的Ultrafast模式?

Ultrafast是OpenAI为其GPT-5.6 Sol模型推出的全新API服务层,其核心特点是极高的推理速度,比标准模式快14倍。

Ultrafast模式的输出速度是多少?

该模式每秒最高可输出750个Token,能够极大地缩短文本生成的时间,提供近乎实时的响应体验。

为什么Ultrafast模式能达到这么快的速度?

这主要得益于Cerebras提供的专用硬件支持,通过优化底层计算架构,显著提升了模型的推理效率和数据处理能力。

相关新闻

产品发布

OpenAI正式发布GPT-6 Astra:开启人工智能新纪元的重大里程碑

2026年9月3日,OpenAI官方正式公布了其下一代大模型GPT-6 Astra。作为GPT系列的最新演进版本,GPT-6 Astra的亮相标志着生成式人工智能进入了第六代技术周期。尽管目前详细的技术白皮书和参数细节尚待进一步披露,但该模型的命名与发布时间节点已在科技界引发了巨大震动,预示着AI在理解力与系统架构上的又一次重大跨越。

Qwen 3.8 27B 登陆 Cerebras 推理平台:推理速度高达每秒 1500 Token
产品发布

Qwen 3.8 27B 登陆 Cerebras 推理平台:推理速度高达每秒 1500 Token

Cerebras Inference 平台宣布正式支持 Qwen 3.8 27B 模型。该模型拥有 270 亿参数,在 Cerebras 硬件加持下,推理速度可达每秒 1500 Token。平台提供 64k 至 128k 的上下文窗口,并强调所有模型均为未剪枝的原始版本,通过选择性权重量化技术在保证质量的同时优化存储,为开发者提供高性能的 AI 推理服务。

OpenAI发布GPT-6 Astra:宣称迈入AGI时代,网络安全能力实现代际飞跃
产品发布

OpenAI发布GPT-6 Astra:宣称迈入AGI时代,网络安全能力实现代际飞跃

OpenAI正式推出其下一代旗舰模型GPT-6 Astra,并宣布人工智能已正式进入“AGI时代”。该模型在网络安全、软件工程、科学研究及计算机操作等多个关键领域实现了代际跨越。作为首个达到OpenAI“关键网络安全能力阈值”的模型,GPT-6 Astra不仅提升了专业办公效率,更在系统安全防护方面树立了新的行业标准,预示着AI在处理复杂任务和保障系统安全方面迈上了新台阶。