Celeris-1、AI速度ランキングでトップ、毎秒2,158トークン
Tom Hamer と Jesse Clark の拡散モデルは、トップのスループットスコアと Artificial Analysis' Intelligence Index の12を組み合わせている。
By Ryan Merket · Published
Primary source: X - Celeris
Why it matters
Independent speed leadership gives diffusion language models a concrete commercial proof point. Celeris still has to show that the advantage survives production workloads without widening the intelligence gap.

Celeris-1 は、Artificial Analysisの現在のベンチマークで同等の非推論モデルの中で最高速度を獲得し、1秒あたり2,157.9出力トークンを生成しました。この結果は創業者のTom Hamer and Jesse Clark に、拡散が言語モデルを音声インターフェース、コーディングツール、複数ステップのエージェントループ内に組み込めるほど高速にできるという彼らの賭けに対する独立したデータポイントを提供します。
Celerisは8月4日のXでのスレッドで、以前のベンチマークスナップショットでCeleris-1が1秒あたり2,038出力トークンを計測し、次点モデルの2倍の速度で、出力速度、応答時間、最初のトークンまでの時間、およびインテリジェンスタスクごとの時間の点で591モデル比較の中で1位にランクされたと述べました。Artificial Analysisの現在の公開サマリーはさらに高いスループット数値を報告し、同等の価格・性能クラスの80モデルの中で速度でCeleris-1を1位とラベル付けしています。最初のトークンまでの時間は0.64秒と記録されています。
この独立した結果は、HamerとClarkが7月下旬にCeleris-1を公開発表した際に行った主張を鮮明にします。二人は以前にMarqo を共同創業しており、オンライン小売向けのセマンティックおよびビジュアル検索インフラを構築しています。Celerisによると、HamerはCambridgeで機械学習の修士号を取得し、AWSでインフラを構築しました。ClarkはAmazon Roboticsで機械学習を率い、Stitch Fixでプリンシパル機械学習サイエンティストとして働き、StanfordとUniversity College Londonで物理学の研究職に就いていました。
検索インフラからモデル推論への移行は同じ根底の論点に従います:レイテンシが開発者が本番導入できるAIシステムを制約します。CelerisはLightspeed Venture Partners、Blackbird Ventures、January Capitalを支援者として挙げています。
拡散により生成が並列化される
ほとんどの商用言語モデルは自己回帰デコーディングを用い、前のトークンの後に各トークンを生成します。Celerisは異なるプロセスを説明しています:Celeris-1は応答の大まかなバージョンから始め、いくつかの並列パスにわたって系列を洗練させます。この手法は、画像生成と広く関連付けられるアーキテクチャである拡散をテキストに適用したものです。
Celeris-1の7月27日のローンチでは、CelerisはこのモデルをInceptionのMercuryに次ぐ商用利用可能な拡散言語モデルAPIの2番目のものと説明しました。Clarkは、研究上の問いは新しいアーキテクチャがリアルタイムのレイテンシ制約内で動作しながら強力な推論能力を維持できるかどうかであったと述べました。
Celerisの自身のベンチマークでは1秒あたり1,664出力トークンを測定しており、その後のArtificial Analysisの結果より低い数値でした。ベンチマークのスループットはプロンプトの長さ、エンドポイントの負荷、テスト構成によって変化する可能性があるため、これらの数値はモデルの固定された性質ではなくスナップショットです。
CelerisのMMLU-Proテストでは、Celeris-1は75.9%のスコアを記録し、サーバー報告の中央値応答時間は158ミリ秒でした。GPT-5は2,046ミリ秒で81.9%、一方でMercury 2は257ミリ秒で63.7%を記録しました。CelerisはCeleris-1、GPT-5および比較に含まれる他の推論可能モデルに対して推論予算をゼロで設定し、Mercury 2はインスタントモードでテストしました。大半のレイテンシ数値はモデル提供者が報告したもので、Geminiエンドポイントは同一コロケートされたクライアントからエンドツーエンドで測定されました。
Artificial AnalysisはCeleris-1の知能についてより控えめな読みを示しています。現在のページでは、モデルにArtificial Analysis Intelligence Indexで12のスコアを付与しており、同等の80モデル中40位です。したがって、このベンチマークはCelerisの速度を示す主張を、最先端に近い知能であるという主張よりも強く支持しています。
そのプロファイルが当面の市場を定義します。Celerisの開発者向けドキュメントは、分類、抽出、スコアリング、クエリ書き換え、ライブ翻訳、エージェントのツール呼び出しなどの短く繰り返し行うタスクを開発者に推奨しています。各リクエストから数秒を削ることは、回答を返すまでに何十回ものモデル呼び出しを行うエージェント全体で累積的な効果を生む可能性があります。
Celeris-1はOpenAI互換のAPIを通じて提供され、開発者は基本的なリクエストフォーマットを書き換えることなくエンドポイントを切り替えられます。料金は入力トークン100万あたり$0.20、出力トークン100万あたり$0.70です。エンタープライズプランには専用クラスター、カスタムレート制限、仮想プライベートクラウドへのデプロイが含まれます。
HamerとClarkにとって、その速度ランキングはCeleris-1の7月24日のリリースから2週間経たないうちに到来しました。このタイミングはアーキテクチャ上の議論を開発者獲得のツールに変えます:Celerisがローンチで集めた注目のうちに、開発者はAPIを既存のモデル提供者と比較できます。より厳しい試練は本番環境で訪れます。精度要件、ワークロードの変動、継続的なエンドポイント性能が、ベンチマークの速度がより良いソフトウェアを生み出すかを決定するでしょう。