OpenAI 预览 GPT-5.6 Sol,速度最高达标准速度的 14 倍

Cerebras 硬件将 API 层的输出速率提升至每秒 750 个输出标记,同时在容量增长期间仅向选定客户开放访问。

By · Published · Updated

Primary source: OpenAI on X

Why it matters

OpenAI is making inference speed a distinct API product for voice, coding and operational systems where latency limits usage. Its reach now depends on how quickly Cerebras capacity enters production.

OpenAI previews GPT-5.6 Sol at up to 14x standard speed

OpenAI (@OpenAI) 于 8 月 13 日开启了 Ultrafast 的受限预览,这是一个新的 API 服务层级,OpenAI 表示它可以让 GPT-5.6 Sol 的运行速度相比其 Standard 处理层级快多达 14 倍。

https://x.com/OpenAI/status/2087947721936359705

poster=/api/storage/public-objects/tweet-videos/openai-gpt-5-6-sol-ultrafast-cerebras-preview-poster-38177545.jpg|来自 @OpenAI 在 X 的视频

The Ultrafast 公告 把 OpenAI 的旗舰模型部署在 Cerebras 的推理硬件上,生成速度可达每秒 750 个输出令牌。OpenAI 从部分精选客户开始,并计划随着计算容量的增长扩大可用性。

That rollout turns inference speed into a separate product tier rather than reserving the fastest responses for smaller models. OpenAI is positioning Ultrafast for applications where users or automated systems are waiting on an answer: incident response, voice agents, financial research, customer support, commerce and interactive scientific work.

OpenAI 的 750 令牌数字衡量的是输出生成速度,本身并不说明生成第一个令牌或完成涉及工具和外部系统的工作流所需的时间。所谓 14 倍的比较也是 OpenAI 基于自身 Standard 处理层级的测量。独立的生产环境数据将取决于提示、推理设置、输出长度以及相关应用。

Cerebras 进入 OpenAI 的推理堆栈

Ultrafast 是从一项更大规模基础设施协议中出现的第一个命名 API 服务。1 月 14 日,OpenAI 表示已与 Cerebras 建立合作,通过分阶段方式在 2028 年之前向其平台增加 750 兆瓦的低延迟计算容量。

Cerebras 的系统以晶圆级处理器为核心,将计算、内存和带宽置于单一芯片上。OpenAI 在 1 月表示,这种架构将分配给响应速度至关重要的工作负载,为 OpenAI 提供了除 AI 行业内常用的传统加速器集群之外的另一种推理选项。

8 月的预览开始将该容量呈现给客户。它还为由联合创始人兼首席执行官 Andrew Feldman 领导的 Cerebras 提供了在 OpenAI 旗舰模型上进行晶圆级推理的生产展示,而不是在较小或专用模型上的展示。

OpenAI 最初在其 6 月 26 日对 GPT-5.6 Sol 的预览 中披露了计划中的 Cerebras 部署,当时称每秒 750 令牌的服务将于 7 月推出。GPT-5.6 已于 7 月 9 日达到普遍可用性,而由 Cerebras 支持的该层级则于 8 月 13 日进入受限预览。

尽管有 OpenAI 的预览,Cerebras 股价下跌

尽管 OpenAI 在新的 Ultrafast 层级背后使用了该芯片制造商的硬件,Cerebras 股价在 8 月 13 日仍下跌。此次下跌并不能说明投资者如何看待更广泛的合作关系,尤其是因为 OpenAI 之前已经披露了该基础设施协议和计划中的每秒 750 令牌服务。

最新公告标志着该服务的有限客户预览,而不是两家公司之间的新合同。其商业意义将取决于更广泛的可用性、客户采用情况以及 Cerebras 将额外容量引入 OpenAI 推理堆栈的能力。

OpenAI 从业务工作流开始

OpenAI 指出 Jane Street、Podium、Basis 和 Rogo 是早期 Ultrafast 测试者。这些客户涵盖了编码助手、语音系统和金融研究等领域,这些领域的延迟会直接限制产品的使用方式。

Podium 产品负责人 Courtland Lykins 表示,Ultrafast 在其语音堆栈中非常有价值,因为“速度彻底改变了复杂工作的通话体验”。为金融研究构建软件的 Rogo 告诉 OpenAI,该层级使复杂分析更接近实时交互的感觉。

OpenAI 还在内部测试 Ultrafast 用于事件响应和研究。OpenAI 表示,工程师正在使用它在故障期间检查日志、追踪和讨论,而研究人员则试图将此前需要整夜运行的实验周期压缩为工作日内的重复迭代。

这些案例解释了为什么 OpenAI 首先通过 API 发布该层级。开发者可以围绕更低的延迟重新设计应用,而更快的聊天响应主要改变现有界面的使用感受。语音代理可以以更少的停顿维持对话。编码工具可以在开发者仍专注于任务时返回更大的编辑。事件响应系统可以在故障进入下一阶段之前处理变化的证据。

底层模型仍然是 GPT-5.6 Sol,它支持 105 万令牌的上下文窗口和最多 128,000 个输出令牌。OpenAI 目前列出的标准 Sol API 定价为每 100 万输入令牌 $5,和每 100 万输出令牌 $30。

Ultrafast 的受限发布使得容量成为即时的限制因素。OpenAI 表示,初始客户将帮助确定额外速度在哪些方面产生可衡量的价值以及未来产品应如何使用它。更广泛的分发将取决于 Cerebras 容量是否进入 OpenAI 的推理堆栈,这使得此次推出成为专用硬件是否能在商业规模上支持前沿模型的早期测试。

披露:作者持有 Cerebras 的股票。

Reader comments

Conversation for this story loads after sign-in.