Spekoは言語別ベンチマークを用いてプロバイダー間で音声AIをルーティングする

Spekoは$1.1Mを調達し、YCから$500,000のコミットメントを受け、合計で約$1.6Mとなった。

By · Published

Primary source: Speko

Why it matters

Voice developers face constant model churn across transcription, language and synthesis providers. Speko is turning company-published benchmarks into a paid routing layer, making trust in its measurements as important as integration reliability.

An illustration of sound waves routing through a complex network marked with symbols representing language benchmarks for the Speko API.

Beknazar Abdikamalov は 2026 年に San Francisco を拠点とする音声 AI ルーティングレイヤーとして Speko を創業しました。Speko は言語別ベンチマークを用いて音声認識、言語モデル、音声合成モデルを選択します。Speko は一つの /v1 API を提供しており、1 つの Speko キーで言語、レイテンシ、精度、コストに基づいたベンチマークベースのプロバイダ間ルーティングを行います。

Speko は、Abdikamalov が Speko を始める前に直面した問題から生まれました。Speko は Y Combinator の Summer 2026 バッチ に参加しています。YC の現在の company profile ではチーム規模が 4 人と記載されています。Abdikamalov は、従業員向けメンタルヘルス製品 Ami として始まったシンガポールのリーダーシップコーチングプラットフォーム Hupo の共同創業者兼 CTO を務める中で、何年も音声機能を構築してきました。Hupo 在任中、Abdikamalov は特定の言語に対してどの音声認識・音声合成プロバイダが最適かを判断するのに苦労したと Digital Business のインタビュー で述べています。

Abdikamalov は 2019 年以降音声技術に携わってきたと、2026 年 6 月の Digital Business とのインタビュー で語っています。

その経験が Speko のプロダクト仮説を形成しました。音声エージェントは通常、少なくとも 3 つの技術段階を連結します: speech-to-text、言語モデル、text-to-speech。各段階は異なるベンダーから提供され得て、プロバイダが新しいモデルをリリースしたりインフラを調整したりするたびに、最も性能の良い組み合わせは変わります。Abdikamalov は、開発者がこれらの比較を継続的に実行し、ルーティングを自動で更新するために Speko に支払うと賭けています。

創業者の問題がインフラになった

Abdikamalov はウズベキスタンの Nukus で育ち、小学 6 年生でプログラミングを始め、その後韓国に移ったと 公開されたインタビュー にあります。学部時代に数学とコンピュータサイエンスを学んだ後、UNIST でコンピュータサイエンスの学士号と修士号を取得しました。彼のキャリアには Tridge を含む韓国のスタートアップでのエンジニアリング職や、Amazon でのソフトウェアエンジニア職が含まれます。

彼は 2022 年に元同僚の Justin Kim と共に Ami を作るために Amazon を離れました。Ami は後に Hupo となり、リーダーシップ開発とマネジメントコーチングに注力しました。Hupo は DST Global、Meta、Goodwater Capital、Collaborative Fund を含むと YC が特定 する支援者から約 400 万ドルを調達しました。

Hupo から Speko への道筋が重要なのは、Abdikamalov が既に Speko が今ルーティングしようとしているサービスを購入してテストしていたからです。6 月の Digital Business とのインタビュー で、彼は弱点が最も明確に現れるのは英語以外の言語であり、名目上の言語サポートが本番環境での精度や信頼性の低さを覆い隠す場合があると述べています。

Speko の 公開ベンチマークページ はそのギャップを可視化するために設計されています。ホームページは現在 9 言語と 21 の speech-to-text モデルを含むセレクタを表示しています。Speko は単語誤り率、finalize latency、最初のトークンまでの時間、1 分あたりのコストなどの測定値を公開しています。

表示されている英語の表は例えば、AssemblyAI の Universal-3.5 Pro に対して 2.0% のバッチ単位単語誤り率を 1 分あたり $0.0075 と割り当てています。OpenAI の GPT-4o-mini Transcribe は 2.7% で 1 分あたり $0.0030 と記載されています。この差は Speko が自動化したい決定を示しています: あるテストで最も精度の高いオプションは使用コストが実質的に高くなるかもしれませんし、最も安価なモデルは精度を犠牲にする必要があるかもしれません。

これらの数値は Speko 自身の測定値です。独立した検証というよりは企業が公開したランキングとして扱うべきです。Speko の商業的立場は、開発者がベンダー自身のリーダーボードよりも Speko のテストをルーティングのより良い根拠として受け入れるかどうかに依存しており、ベンチマークの信頼性がプロダクトの中心になります。

プロバイダ横断での One Speko key

Speko は OpenRouter、言語モデル向けのゲートウェイがプロバイダ選択に使う 集約モデルを借用し、それを音声パイプライン全体に適用しています。OpenRouter は価格、スループット、レイテンシでプロバイダを並べ替え、エンドポイントが失敗した際にフォールバックできます。Speko は音声固有の測定値と、文字起こしと合成を跨いだ言語選択を追加しています。

Speko の ドキュメント によれば、開発者は Speko の API キーで認証し、各アップストリームサービスに個別に統合する代わりに Speko の /v1 エンドポイントを呼び出します。

LiveKit 向けに、Speko は LiveKit Agents ワーカー上のアダプタを使った リアルタイムの speech-to-text、言語モデル、text-to-speech パイプライン をドキュメント化しています。この統合により、開発者は既存の音声エージェントプロジェクト内で Speko を設定でき、Speko が API の裏側でプロバイダルーティングを処理します。

ベンチマークは Speko の顧客獲得エンジンでもある

公開ランキングには二つの役割があります。音声開発者にプロバイダを選ぶ前に Speko を訪れる理由を与え、そして Speko が有料ルーティングの判断を正当化するために使用する測定値を生み出します。新しいモデルのリリースごとに Speko が公開する比較が一つ増え、内部評価スイートを維持するのは無駄なエンジニアリング時間だと開発者に納得させる機会が増えます。

YC は資本と集中した顧客プールを提供する

Digital Business は報じています が、Speko は YC 参加前に米国のファンドとエンジェル投資家から 110 万ドルを調達しました。YC の 標準的な契約 はさらに 2 つの SAFE を通じて 50 万ドルをコミットしており、報告された調達済みまたはコミット済みの金額は約 160 万ドルになります。Speko はレビューした情報源でプレYC 投資家を特定しておらず、顧客、収益、利用状況の数字は入手できません。

YC はまた集中した潜在的購入者プールを提供します: 電話エージェント、カスタマーサポートツール、その他の音声プロダクトを構築するスタートアップは、しばしば Speko が解消しようとしているプロバイダ選択の問題に直面します。

Speko の当面の課題は、有用なリサーチの表面をライブ会話内で開発者が信頼するインフラに変えることです。Abdikamalov は Speko が今ルーティングするサービスを購入してテストした経験を持っています。より難しい作業は、Speko がプロバイダ性能の変化を正確に測定し、通話を劣化させることなくプロバイダを切り替え、ルーティングするトラフィックに対して料金を請求しながら信頼性を維持できることを証明することです。

Reader comments

Conversation for this story loads after sign-in.