Celeris-1以每秒2,158个词元的速度位居AI速度排行榜首位
Tom Hamer 和 Jesse Clark 的扩散模型在吞吐量方面取得最高得分,并在 Artificial Analysis 的 Intelligence Index 上获得 12 分。
By Ryan Merket · Published
Primary source: X - Celeris
Why it matters
Independent speed leadership gives diffusion language models a concrete commercial proof point. Celeris still has to show that the advantage survives production workloads without widening the intelligence gap.

Celeris-1 在 Artificial Analysis 的当前基准 中,在可比的非推理模型中取得了速度第一的席位,生成速率为每秒 2,157.9 个输出标记。该结果为创始人 Tom Hamer and Jesse Clark 提供了一个独立的数据点,支持他们关于扩散(diffusion)可以让语言模型足够快速以嵌入语音界面、编程工具和多步代理循环的押注。
Celeris 在 在 X 上 8月4日 的 帖子 中表示,较早的基准快照将 Celeris-1 的测得值列为每秒 2,038 个输出标记,是下一个模型速率的两倍,并在 591 个模型的比较中在输出速度、响应时间、首次标记时间和每项智能任务时间上排名第一。Artificial Analysis 的当前公开摘要报告了更高的吞吐量数字,并在其可比价格与能力类别中的 80 个模型中将 Celeris-1 标注为速度第一。它记录的首次标记时间为 0.64 秒。
这一独立结果强化了 Hamer 和 Clark 在 7 月底公开推出 Celeris-1 时所做的论述。二人此前联合创立了 Marqo,为在线零售商构建语义与视觉搜索基础设施。Celeris 表示 Hamer 在 Cambridge 获得了机器学习硕士学位并在 AWS 构建过基础设施。Clark 曾在 Amazon Robotics 领导机器学习,担任 Stitch Fix 的首席机器学习科学家,并在 Stanford 和 University College London 担任过物理学研究岗位。
他们从搜索基础设施向模型推理的转变遵循相同的基本论点:延迟限制了开发者可以投入生产的 AI 系统种类。Celeris 将 Lightspeed Venture Partners、Blackbird Ventures 和 January Capital 列为其支持者。
扩散将生成并行化
大多数商业语言模型使用自回归解码,在生成每个标记时依赖于前一个标记。Celeris 描述了一种不同的过程:Celeris-1 从响应的粗略版本开始,并在若干并行迭代中对序列进行精炼。该方法将广泛与图像生成相关联的扩散架构适配到文本领域。
在 Celeris-1 的 7月27日 发布 中,Celeris 将该模型描述为继 Inception 的 Mercury 之后第二个商业化可用的扩散语言模型 API。Clark 表示,研究问题在于一种新架构能否在保持较强推理能力的同时,在实时延迟限制内运行。
Celeris 自己的 基准测试 测得 1,664 个输出标记每秒,低于随后 Artificial Analysis 的结果。基准吞吐量会随提示长度、端点负载和测试配置而变化,因此这些数字是快照而非模型的固定属性。
在 Celeris 的 MMLU-Pro 测试中,Celeris-1 得分为 75.9%,服务器报告的响应时间中位数为 158 毫秒。GPT-5 在 2,046 毫秒时得分 81.9%,而 Mercury 2 在 257 毫秒时得分 63.7%。Celeris 在比较中对 Celeris-1、GPT-5 和其他具备推理能力的模型都使用了零推理预算,并以即时模式测试了 Mercury 2。大多数延迟数字由模型提供方报告;Gemini 端点则从与之同址的客户端端到端测量。
Artificial Analysis 对 Celeris-1 的智能性给出了更克制的解读。其当前页面在 Artificial Analysis Intelligence Index 上给该模型评分为 12,在 80 个可比模型中排名第 40。因此该基准对 Celeris 的速度论点的支持明显强于其“接近前沿智能” 的说法。
这一画像定义了其直接的市场定位。Celeris 的 开发者文档 指导构建者将其用于短、小、重复的任务,例如分类、抽取、评分、查询重写、实时翻译和代理工具调用。从每次请求中削减数秒的延迟,在一个在返回答案前可能调用数十次模型的代理中会产生复合效果。
Celeris-1 通过兼容 OpenAI 的 API 提供,允许开发者在不重写基本请求格式的情况下切换端点。定价 为每百万输入标记 $0.20,和每百万输出标记 $0.70。企业方案包括专用集群、自定义速率限制和虚拟私有云部署。
对于 Hamer 和 Clark 来说,这一速度排名出现在 Celeris-1 于 7 月 24 日发布不到两周之后。这样的时机把一个架构论点变成了一个开发者获取工具:构建者可以在 Celeris 仍然享有其发布所带来的关注时,将该 API 与既有模型提供商进行比较。更艰难的考验将在生产环境中到来:准确性要求、工作负载变化和持续的端点性能将决定基准速度是否能转化为更好的软件。