Nous Research、Hermes Agentの音声チャットを高速化するためにストリーミング音声を追加
オープンソースのエージェントは、回答を生成している間に話し始め、AI音声インターフェースを遅く感じさせる無音の時間を減らします。
By Ryan Merket · Published
Primary source: X
Why it matters
Voice latency is a product problem as much as a model problem. Streaming lets Nous make Hermes feel faster while it builds paid hosting around an open-source, provider-agnostic agent.

Ryan "Teknium" Teknium (@Teknium)、Nous Researchの共同創設者でポストトレーニングの責任者が水曜日にXで述べたところによると、Hermes Agentのボイスチャットは現在、ほとんどのAPIベースのテキスト読み上げバックエンドから音声をストリーミングするようになり、オープンソースのアシスタントをよりライブ会話に近づけているという。
実装自体が基盤の言語モデルにより速く回答を生成させるわけではない。モデルが応答を書き終える前にオーディオ再生を開始することで、ユーザーが聞く遅延を短縮している。この区別はボイス製品において重要で、質問と最初の発話の間の沈黙が有能なモデルを反応が遅いように感じさせることがあるためだ。
Tekniumは2022年にDiscord上のAI研究コミュニティとしてNous Researchを立ち上げ、2023年に会社化する前に共同設立した。彼の個人サイトによれば、以前はStability AIでLLMデータエンジニアとして、Digi AIでキャラクター重視の言語モデルに従事していた。Nousではポストトレーニング、評価、展開を主導しつつ、Hermesモデルファミリーの構築にも関わっている。
How Hermes streams an answer
Hermes Agent voice documentationによると、システムはモデルから入ってくるテキストを収集し、少なくとも20文字以上の完全な文が揃うまで待つ。その後、マークダウン、絵文字、隠れた推論タグを除去し、その文を設定されたテキスト読み上げプロバイダに送信する一方でモデルは残りの応答を生成し続ける。
そのパイプライン内には二つのストリーミングレベルがある。ElevenLabsとOpenAIはチャンク化されたPCMオーディオをサポートしており、プロバイダが返す生のオーディオをHermesが再生できる。他のプロバイダ(デフォルトのEdge TTSオプションを含む)は各文が完了してから合成して再生する。最初のアプローチは最初の可聴語への最短経路を提供し、二番目の方法でもモデルの全応答を待つ必要はなくなる。
Nousによれば、同じ音声パイプラインはコマンドラインインターフェイス、端末UI、デスクトップアプリでも動作する。デスクトップ実装では、生成されたテキストが単一のリプライに結び付けられたWebSocketを通して送られ、モデル生成とオーディオ再生を同時に動かしつつ、文ごとに新しい接続を開かずに済むようになっている。
Hermesはbarge-inコントロールにも対応している。ユーザーは応答の上に話しかけ始めたり、別のメッセージを送ったり、録音キーを押して再生を停止したりできる。次のプロンプトはモデルに前回の応答が中断されたことを伝え、継続するか方向を変えるための文脈を与える。
この音声システムは、永続メモリ、学習済みスキル、ブラウザ自動化、コーディングツール、メッセージング統合を組み合わせたより大きなオープンソースプロジェクトであるHermes Agentの内部にある。ユーザーはNousモデルに限定されず自分のモデルプロバイダを選べる一方で、Nous Portalは1つのアカウントでホストされたモデル、ツール、クラウド展開へのアクセスを販売している。
Nous is turning Hermes into a business
このレイテンシー改善は、Nousがオープンソースのエージェントの周りに商用レイヤーを構築する中で行われた。TechCrunchは7月13日に報じたところによると、NousはRobot Venturesが主導しUnion Square Venturesが大きく参加する少なくとも7,500万ドルの資金調達を最終調整中で、評価額は報道で15億ドルとされていると伝えられた。報道はまた、Nousが以前にParadigm、Robot Ventures、North Island Ventures、Delphi Ventures、OSS Capital、Balaji Srinivasanらを含む投資家から7,000万ドルを調達していたと述べている。
報道されたこの資金調達は、Hermesの採用を持続可能なホステッド製品に変えるようNousに圧力をかける。ボイスはその推進に有用で、エージェントを入力した端末セッションやメッセージングボットからハンズフリーの作業、デスクトップ支援、ライブのDiscord会話へと拡張する。商業的な入り口は明快だ:エージェントとプロバイダの選択肢を開いたままにし、Nousがモデル、音声サービス、ツール、常時稼働のインフラを提供することを望むユーザーに課金する。
ストリーミング音声はその計画の一つの狭い領域に対処するが、重要な領域でもある。ユーザーは自分が話し終えた後の間(ポーズ)でボイスエージェントを評価する。Hermesは今やその間をより早く埋めることができ、Nousが応答を生成するモデルを制御している必要はない。