ngrok 发布交互式指南,将大型语言模型(LLM)的预测与压缩联系起来
Annie Sexton's 互动指南解释了词元概率如何转化为压缩成本; ngrok 则另行运营一个 AI Gateway,用于路由模型流量。
By Ryan Merket · Published
Primary source: ngrok
Why it matters
Ngrok is using deep technical education to carry its developer trust from localhost tunnels into AI infrastructure, where routing, latency and token economics shape buying decisions.

Alan Shreve 的 ngrok 于 8月11日 发布了 关于无损压缩与大型语言模型背后共同数学的交互式指南,展示了预测质量如何决定对数据进行编码所需的比特数量。
该文章由 ngrok 的开发者教育者 Annie Sexton 撰写,将一个密集的信息论概念转化为一系列可运行的演示。读者可以压缩代码、运行一个基本的编码方案、逐步查看算术编码,并观察语言模型的 token 概率如何变为压缩代价。
根据她在 ngrok 的简介,Sexton 在 Heroku、Render 和 Fly.io 等开发者平台工作超过十年。这种背景体现在文章结构上:每个抽象概念都是通过一个小程序或可视化来呈现,而不是一大堆方程式。
这种方法也延续了 Shreve 构建 ngrok 时使用的思路。他在 University of Michigan 学习计算机科学,并作为早期工程师之一加入 Twilio,在那里他建立了消息团队并从事分布式系统工作。ngrok 背后的实际问题来自开发基于 webhook 的应用时需要在本地运行时拥有公共 URL。在一篇 2016 年关于该工具创建过程的回顾 中,Shreve 表示他最初构建 ngrok 是为了学习 Go 并让 Web 开发更容易。
这种直觉——让复杂的基础设施足够易懂,使开发者可以立即使用——是将 ngrok 最初的隧道与 Sexton 的压缩课连接起来的主线。
预测有比特代价
Sexton 从区分删除不必要内容与利用可预测结构开始。代码缩小可以通过删除注释、空白和可读性较强的名称来减小 JavaScript 的体积。无损压缩器则寻找冗余,以便用更少的比特描述原始数据。
她的第一个例子将游程长度编码应用于一个包含重复字母的 28 字符序列。用字母和计数替换每个重复段,将表示从 224 位减少到 96 位,在该简化示例中减少了 57%。
文章随后将现代压缩器分为三个广义组件:变换、模型和熵编码器。变换对数据进行重排或预处理。模型估计每个符号的概率。熵编码器将这些概率和符号转换为比特流。
算术编码为语言模型提供了桥梁。Sexton 的演示在处理七字符字符串 "ABABAAC" 时反复缩小一个数值区间。最终区间可以用一个 10 位的二进制小数表示,而示例中原始 ASCII 字符需要 56 位。
这种比较突出显示了被编码的有效载荷。完整的解码器还需要访问概率模型、符号的排序以及足够的信息以确定何时停止解码。在生产系统中,这些要求以及模型的计算成本在最终比特流大小之外也很重要。
核心关系保持不变:为正确的下一个符号分配高概率会降低其信息成本。根据熟悉的公式 -log2(probability),可能性大的符号花费更少的比特,而出人意料的符号花费更多。
LLM 在预测下一个 token 时执行相同的概率估计步骤。对于压缩而言,下一个实际的 token 已经是已知的。模型提供其概率,熵编码器使用该概率来编码该 token。自信且正确的预测会产生短表示;自信但错误的预测代价很高。
这一理论早于当前的 AI 周期
Sexton 的论述借鉴了 《Language Modeling Is Compression》,一篇作为 ICLR 2024 作品发表的论文。该论文的作者描述了一个由来已久的等价关系:预测模型可以被转换为无损压缩器,而压缩器也可以用于构建预测模型。
研究人员将基础模型作为通用压缩器在文本、图像和音频上进行了测试。他们的结果表明,主要在文本上训练的模型也能识别其他数据类型中有用的统计结构。论文将压缩作为一种通过共同度量来考察模型扩展、分词化和上下文学习的方法:关于下一段数据还剩下多少不确定性。
这种等价关系需要一个边界。Sexton 的文章关注于无损压缩,其中每个原始符号必须被恢复。诸如 JPEG 和 MP3 之类的有损格式可以根据失真目标丢弃信息。LLM 的训练还涉及架构选择、数据选择、优化和生成行为,这些都超出了最终熵计算的范畴。
Sexton 直接处理了最大的实际限制。LLM 可以做出强有力的预测,但使用一个大型模型去压缩一个小的网页响应会消耗比 gzip 或 Brotli 多得多的存储和计算资源。模型在解压时也需要可用。当延迟、内存使用和部署成本进入考量时,更好的压缩比可能会失去其价值。
为一家网络公司提供的 AI 教育层
这个主题契合了 ngrok 超越建立其开发者关注度的 localhost 隧道而进行的扩张。Ngrok 现在将自己描述为用于将流量路由并保护到应用、API 和 AI 模型的基础设施。其 AI Gateway 通过一个端点在托管与自托管模型之间路由请求,并提供访问控制、故障切换和可观测性。
这篇压缩文章并未引入 ngrok 的某项功能。它为 ngrok 提供了一种方式,向开发者教授模型概率如何影响计算、数据移动和系统设计——正是 ngrok 在销售 AI 路由基础设施时需要接触的同一群受众。
Shreve 在接受机构资本之前就建立了这一受众。Ngrok 表示他在首次融资前已将服务发展到 500 万用户。2022 年 12 月 13 日,ngrok 宣布获得 5000 万美元 A 轮融资,由 Lightspeed Venture Partners 领投,Coatue 参与。Ngrok 当前的 About page 表示已有 1300 万开发者注册,而其 careers page 则描述了超过 70 名员工的团队。两项数据均由公司提供。
随着 ngrok 从开发者工具向更广泛的网关业务转型,技术教育成为其分发策略的一部分。Sexton 的文章并未销售任何压缩产品。它为读者提供了一个可用的心智模型,帮助他们更好地操作日益需要他们掌控的系统。