ngrokがLLMの予測と圧縮を結びつけるインタラクティブなガイドを公開
Annie Sextonのインタラクティブガイドは、トークンの確率がどのように圧縮コストになるかを説明している;ngrokは別途、モデルのトラフィックをルーティングするAI Gatewayを運営している。
By Ryan Merket · Published
Primary source: ngrok
Why it matters
Ngrok is using deep technical education to carry its developer trust from localhost tunnels into AI infrastructure, where routing, latency and token economics shape buying decisions.

Alan Shreveのngrokは8月11日にロスレス圧縮と大規模言語モデルに共通する数学を対話形式で解説するガイドを公開し、予測の品質がデータを符号化するのに必要なビット数をどのように決定するかを示した。
この記事はngrok developer educator Annie Sextonが執筆しており、情報理論のやや難解な概念を一連の実演に変えている。読者はコードを縮小(minify)し、基本的な符号化方式を実行し、算術符号化(arithmetic coding)を順を追って確認し、言語モデルのトークン確率が圧縮コストにどう変わるかを見ることができる。
Sextonはngrokの経歴によると、Heroku、Render、Fly.ioなどの開発者プラットフォームで10年以上にわたり働いてきた。その経験は構成に現れており:各抽象化は数式の羅列ではなく、小さなプログラムや可視化を通じて示される。
このアプローチはngrokを構築したShreveの手法とも一致する。彼はUniversity of Michiganでコンピュータサイエンスを学び、Twilioに初期のエンジニアの一人として参加し、メッセージングチームを構築し分散システムに取り組んだ。ngrokの背後にある実務的な問題は、ローカルで実行中のWebhookベースのアプリケーションに公開URLが必要だったことから生じた。2016年のツール作成に関する報告では、Shreveは当初Goを学び、ウェブ開発を容易にするためにngrokを作ったと述べている。
その直感 ― 開発者がすぐに使えるほど難しいインフラを理解しやすくする ― は、ngrokの元々のトンネルとSextonの圧縮レッスンをつなぐ貫徹線(スルーライン)である。
Prediction has a price in bits
Sextonはまず、不要な要素を取り除くことと予測可能な構造を利用することの区別から始める。Minificationはコメント、空白、人間に読める名前を削除してJavaScriptを縮小できる。一方でロスレス圧縮器は、元のデータをより少ないビットで記述できる冗長性を探す。
彼女の最初の例は、繰り返しの文字を含む28文字のシーケンスにランレングス符号化(run-length encoding)を適用するものだ。各繰り返しを文字とカウントに置き換えることで、簡略化された例では表現が224ビットから96ビットに減少し、57%の削減となる。
記事は次に現代的な圧縮器を大きく3つの要素に分ける:transforms、models、entropy coders。transformはデータを再配置または前処理する。modelは各シンボルの確率を推定する。entropy coderはそれらの確率とシンボルをビットストリームに変換する。
算術符号化は言語モデルへの橋渡しを行う。Sextonのデモは7文字列 "ABABAAC" を処理しながら数値範囲を繰り返し狭める。最終的な区間は10ビットの二進小数で表現でき、例の生のASCII文字の56ビットと比較される。
その比較は符号化されたペイロードを切り出す。完全なデコーダは確率モデル、シンボルの順序、およびいつデコードを終了すべきかを知るための十分な情報にもアクセスする必要がある。実運用のシステムでは、これらの要件とモデルの計算コストが最終的なビットストリームのサイズと並んで重要になる。
核となる関係は変わらない:正しい次のシンボルに高い確率を割り当てれば、その情報コストは下がる。お馴染みの式 -log2(probability) の下では、ありそうなシンボルは少ないビットで済み、驚きのあるシンボルは多くのビットを要する。
LLMは次のトークンを予測する際に同じ確率推定のステップを実行する。圧縮では、実際の次のトークンはすでに既知である。モデルはその確率を供給し、entropy coderがその確率を使ってトークンを符号化する。自信があり正しい予測は短い表現を生み、確信した誤りは高コストになる。
The theory predates the current AI cycle
Sextonのフレーミングは、ICLR 2024の作品として発表された論文 "Language Modeling Is Compression" に基づいている。著者らは長年確立されてきた同値性を記述している:予測モデルはロスレス圧縮器に変換でき、圧縮器は予測モデルを構築するために用いることができる。
研究者たちはテキスト、画像、音声にわたって基盤モデルを汎用圧縮器としてテストした。彼らの結果は、主にテキストで訓練されたモデルが他のデータ型に対しても有用な統計構造を識別できることを示した。この論文は、圧縮をスケーリング、トークナイゼーション、インコンテキスト学習を共通の測定基準、すなわち次に来るデータに関する不確実性がどれだけ残るか、で検討する方法として提示した。
同値性には境界が必要である。Sextonの記事はすべての元のシンボルを復元しなければならないロスレス圧縮に焦点を当てている。JPEGやMP3のようなロッシーなフォーマットは歪み目標に従って情報を破棄できる。LLMの訓練も最終的なエントロピー計算を超えて、アーキテクチャの選択、データの選別、最適化、生成挙動といった決定を含む。
Sextonは最大の実用的制約に直接取り組んでいる。LLMは強い予測を行えるが、小さなウェブ応答を圧縮するために大きなモデルを使うと、gzipやBrotliよりもはるかに多くのストレージと計算を消費する。モデルはデコード時にも利用可能でなければならない。レイテンシ、メモリ使用量、デプロイコストが考慮に入ると、より良い圧縮比は価値を失うことがある。
An AI education layer for a networking company
このテーマは、ローカルホストトンネルを越えてngrokが拡大している流れに合致する。Ngrokは現在、自身をアプリケーション、API、AIモデルへのトラフィックをルーティングおよび保護するためのインフラと説明している。そのAI Gatewayは、ホストされたモデルとセルフホストされたモデル間のリクエストを1つのエンドポイントを通じてルーティングし、アクセス制御、フェイルオーバー、可観測性を提供する。
圧縮に関する記事はngrokの新機能を導入するものではない。それは、モデルの確率が計算、データ移動、システム設計にどのように影響するかを開発者に教える手段をngrokに与えるものであり、まさにngrokがAIルーティングインフラを販売する際に到達する必要がある同じ聴衆に向けられている。
Shreveは機関投資を受ける前にその聴衆を築いたとされる。Ngrokは、最初の資金調達前にサービスを500万人のユーザーに成長させたと述べている。2022年12月13日、ngrokはLightspeed Venture Partnersが主導する5000万ドルのSeries A調達を発表し、Coatueが参加した。Ngrokの現在のAbout pageは1300万人の開発者がサインアップしたとし、そのcareers pageは70人以上の従業員を擁すると説明している。両方の数字は会社発表によるものだ。
ngrokが開発者向けユーティリティからより広いゲートウェイ事業へ移行するにつれて、技術教育はその流通の一部となる。Sextonの記事は圧縮製品を売るものではない。それは読者に、彼らがますます運用を期待されるシステムのための使える心的モデルを与えている。