TracerがEchoを発表、Claude Fableに近いスコアを実現し価格は3分の1

単独創業者の Adam Rida は、YC S26 システムを構築し、1つの OpenAI 互換エンドポイントを通じてオープンウェイトモデル全体に計算資源を割り当てるようにした。

By · Published

Primary source: X

Why it matters

AI agents multiply model calls, making inference a gross-margin problem. Tracer is betting software can coordinate cheaper open models closely enough to replace premium endpoints for much of that traffic.

Tracer launches Echo with near-Claude Fable scores at one-third the cost

Tracer, the San Francisco AI lab founded by Adam Rida, launched Echo on July 31st, an adaptive inference system that coordinates multiple open-weight models and returns a single answer through an OpenAI-compatible API. Tracer Xでの8投稿からなるスレッドで述べたところによれば、Echoは現行の評価においてAnthropicのClaude Fable 5の品質に近づきつつ、推論コストを概ね3分の1に抑えたという。

https://x.com/tracerml/status/2083297340207886775?s=46

poster=/api/storage/public-objects/tweet-videos/tracer-echo-open-weight-models-claude-fable-inference-cost-p-55a774b9.jpg|X上の@TracerMLによるビデオ

Ridaは一人でTracerを構築している。Y CombinatorはTracerをサンフランシスコ拠点の「1人のSummer 2026企業」として掲載している。Ridaは以前、Sorbonne UniversityとCNRSで機械学習の可解釈性をPhD候補として研究し、その後金融、保険、サプライチェーン分野で応用MLシステムを構築した。TracerのYCローンチ投稿で、Ridaは以前のプロダクトDeepRecallを、ソロ創業者として3ヶ月足らずで年間反復収益約EUR100,000に成長させたと述べている。

Echoは、いつアプリケーションが高価なモデル呼び出しを必要とするかを決定するというRidaの以前の研究を発展させたものである。彼の4月16日付の研究論文は、TRACERというオープンソースのシステムを紹介しており、本番トレースから学習して予測可能な分類リクエストを軽量な機械学習モデルに送信し、不確実な入力はより大きな言語モデルに委ねるという仕組みを示している。

Echoはそのコスト配分の考え方を一般的な言語モデルのワークロードに適用する。Tracerによれば、各プロンプトについてEchoはどれだけの計算を使うかを決定し、オープンウェイトのシステム群からモデルを選び、それらの出力を組み合わせて単一の回答を返す。開発者は既存のOpenAIクライアントを保持し、ベースURL、モデル名、APIキーを変更するだけでよい。TracerはEchoをチャット、コード、エージェントのワークロード向けに売り込んでおり、OpenCodeや互換エージェントハーネス経由での利用も含めている。

Tracerのベンチマークの主張

Tracerは、EchoがMATH-500で98.6%のスコアを記録し、その推論コストは$4.58だったと報告した。Claude Fable 5はAnthropicが入力トークン100万あたり$10、出力トークン100万あたり$50で価格設定しており、Tracerの実行ではFableが99.8%を$12.64で記録した。

LiveCodeBenchでは、TracerによればEchoが92.8%を$5.35で記録し、Fableは92.0%を$8.71で記録した。これらの結果は、そのコーディングテストにおいてEchoがわずかに先行し、かつ記録された推論支出が少ないことを示している。

これらの比較は独立評価ではなく、Tracerによる実行ベンチマークのままである。TracerのEcho Eval Observatoryは、8つのベンチマークと9つのテストセットにまたがる907問をリストしている。完了したMATH-500コホートのために保存された質問、回答、採点を公開しており、モデルの出力は実行間で変わり得ると注意を促している。Tracerはまた、公的ベンチマークがモデルの訓練データに含まれている可能性があり、Echoが本番ワークロード全般でFableを上回ることを確立するには至らないと認めている。

制約は重要である。TracerはEchoが多言語タスクや幅広い知識においてFableに遅れをとると述べており、LiveCodeBenchはリポジトリ規模のソフトウェア作業や、計画、ツール使用、コード変更、エラー回復を要するより長いエージェントループを計測しない。Tracerはそれら長期的なテストを実行中で、SWE-bench Verified、ARC-AGI、BigCodeBenchが評価サイト上に結果なしでリストされている。

一つのルートではなく協調

モデルルーティングはすでに争点となっているインフラのカテゴリーである。Not Diamondはルーティングとプロンプト最適化を販売しており、オープンソースのRouteLLMフレームワークは、より簡単なリクエストをより安価なモデルに振り向け、より強力なシステムを困難なプロンプトに温存する。

Tracerの技術的かつ商業的な賭けは、各リクエストに対して1つのモデルを選ぶ以上の範囲に及ぶ。Echoは複数のオープンウェイトモデルを呼び出し、計算予算を変動させ、それらの成果を組み合わせて1つの応答を生成できる。そのアプローチは回答の質を向上させる可能性があるが、追加のモデル試行はすべてトークンを消費しレイテンシを増す。Tracerは、その協調による利得が実際のアプリケーショントラフィックで一貫してそのオーバーヘッドを上回ることを証明しなければならない。

製品はEcho chat and API interfaceを通じて利用可能である。ブラウザインターフェイスはアカウント不要でゲストメッセージを5回提供し、アカウントとAPI画面ではサービスをプライベートアルファと表示している。Tracerは公開されているEchoがプライベートなユーザートレースで学習しないと述べている。

Tracerはローンチを利用して、かなりの本番推論費用を抱えるAIチームを募集している。Ridaによれば、Echoは顧客のトラフィック分布、品質閾値、データ要件に合わせて構成でき、どのリクエストにより多くの計算を割くべきかをTracerが学べるようにするという。そのワークロード特化型のサービスは、公開モデルデモからビジネスに至る最も明確な道筋である:エージェントがモデルのターンを増やすたびに粗利が縮むAIアプリケーションに対して、より低い推論支出を売ることだ。

Y CombinatorはTracerの唯一の特定された支援者である。YCの公表されている標準条件は各バッチ受け入れ企業に$500,000を投資する:7%に対する$125,000と、無上限の最恵国条項付きSAFEである$375,000である。Ridaにとって、その資金は狭い賭けを支えるものであり、AIアプリケーションに対して広範な含意を持つ:プレミアムなモデル能力は、すべてのリクエストを最も高価なエンドポイントに送るのではなく、より安価なモデルを割り当て組み合わせるソフトウェアによってますます提供されるようになるかもしれない。

Reader comments

Conversation for this story loads after sign-in.