ngrok publica una guía interactiva que vincula la predicción de LLM con la compresión
La guía interactiva de Annie Sexton explica cómo las probabilidades de los tokens se convierten en costos de compresión; ngrok, por su parte, opera un AI Gateway para enrutar el tráfico de modelos.
By Ryan Merket · Published
Primary source: ngrok
Why it matters
Ngrok is using deep technical education to carry its developer trust from localhost tunnels into AI infrastructure, where routing, latency and token economics shape buying decisions.

Alan Shreve's ngrok published an interactive guide to the shared mathematics behind lossless compression and large language models on August 11, showing how the quality of a prediction determines the number of bits needed to encode data.
El artículo, escrito por Annie Sexton, developer educator de ngrok, convierte un concepto denso de la teoría de la información en una secuencia de demostraciones prácticas. Los lectores pueden minificar código, ejecutar un esquema básico de codificación, recorrer la codificación aritmética y observar cómo las probabilidades de los tokens de un modelo de lenguaje se convierten en costos de compresión.
Sexton ha pasado más de una década trabajando en plataformas para desarrolladores como Heroku, Render y Fly.io, según su biografía en ngrok. Ese trasfondo se nota en la estructura: cada abstracción aparece a través de un pequeño programa o una visualización, en lugar de un muro de ecuaciones.
El enfoque también sigue el patrón que Shreve usó para construir ngrok. Estudió ciencias de la computación en la University of Michigan y se incorporó a Twilio como uno de sus primeros ingenieros, donde formó el equipo de mensajería y trabajó en sistemas distribuidos. El problema práctico detrás de ngrok surgió al desarrollar aplicaciones basadas en webhooks que necesitaban URLs públicas mientras se ejecutaban localmente. En una relato de 2016 sobre la creación de la herramienta, Shreve dijo que inicialmente construyó ngrok para aprender Go y facilitar el desarrollo web.
Ese instinto —hacer la infraestructura difícil lo bastante entendible para que un desarrollador la use de inmediato— es el hilo conductor que conecta el túnel original de ngrok con la lección de compresión de Sexton.
Prediction has a price in bits
Sexton comienza con la distinción entre eliminar material innecesario y explotar estructuras predecibles. La minificación puede reducir JavaScript eliminando comentarios, espacios en blanco y nombres legibles por humanos. Un compresor sin pérdida, en cambio, busca redundancias que le permitan describir los datos originales con menos bits.
Su primer ejemplo aplica codificación por longitud de corrida a una secuencia de 28 caracteres que contiene letras repetidas. Reemplazar cada corrida repetida por una letra y un conteo reduce la representación de 224 bits a 96 bits en el ejemplo simplificado, una reducción del 57 %.
El artículo divide luego un compresor moderno en tres componentes amplios: transformaciones, modelos y codificadores de entropía. Una transformación reorganiza o preprocesa datos. Un modelo estima la probabilidad de cada símbolo. Un codificador de entropía convierte esas probabilidades y símbolos en un flujo de bits.
La codificación aritmética proporciona el puente hacia los modelos de lenguaje. La demostración de Sexton estrecha repetidamente un rango numérico mientras procesa la cadena de siete caracteres "ABABAAC." El intervalo final puede representarse mediante una fracción binaria de 10 bits, en comparación con 56 bits para los caracteres ASCII sin procesar en el ejemplo.
Esa comparación aísla la carga útil codificada. Un decodificador completo también necesita acceso al modelo de probabilidades, al orden de los símbolos y suficiente información para saber cuándo debe detenerse la decodificación. En sistemas de producción, esos requisitos y el costo computacional del modelo importan junto con el tamaño del flujo final de bits.
La relación central permanece: asignar una alta probabilidad al siguiente símbolo correcto reduce su costo de información. Bajo la fórmula familiar -log2(probability), los símbolos probables cuestan menos bits y los símbolos sorprendentes cuestan más.
Un LLM realiza el mismo paso de estimación de probabilidad cuando predice un siguiente token. Para la compresión, el siguiente token real ya se conoce. El modelo suministra su probabilidad y un codificador de entropía usa esa probabilidad para codificar el token. Una predicción confiada y correcta produce una representación corta. Un error confiado es caro.
The theory predates the current AI cycle
El encuadre de Sexton se basa en "Language Modeling Is Compression," a paper published as an ICLR 2024 work. Sus autores describen una equivalencia largamente establecida: los modelos predictivos pueden convertirse en compresores sin pérdida, mientras que los compresores pueden usarse para construir modelos predictivos.
Los investigadores probaron modelos foundation como compresores de propósito general en texto, imágenes y audio. Sus resultados mostraron que un modelo entrenado principalmente en texto también podía identificar estructuras estadísticas útiles en otros tipos de datos. El artículo presentó la compresión como una forma de examinar el escalado del modelo, la tokenización y el aprendizaje en contexto mediante una medida común: cuánta incertidumbre queda sobre la siguiente pieza de datos.
La equivalencia necesita un límite. El artículo de Sexton se centra en la compresión sin pérdida, donde cada símbolo original debe recuperarse. Formatos con pérdida como JPEG y MP3 pueden descartar información según un objetivo de distorsión. El entrenamiento de LLM también implica elecciones arquitectónicas, selección de datos, optimización y comportamiento de generación que se extienden más allá del cálculo final de entropía.
Sexton aborda directamente la limitación práctica más grande. Un LLM puede hacer predicciones fuertes, pero usar un modelo grande para comprimir una pequeña respuesta web consumiría mucho más almacenamiento y cómputo que gzip o Brotli. El modelo también tendría que estar disponible durante la descompresión. Mejores ratios de compresión pueden perder su valor cuando la latencia, el uso de memoria y el costo de despliegue entran en la ecuación.
An AI education layer for a networking company
El tema encaja con la expansión de ngrok más allá del túnel localhost que estableció su seguimiento entre desarrolladores. Ngrok ahora se describe como infraestructura para enrutar y asegurar el tráfico hacia aplicaciones, APIs y modelos de IA. Su AI Gateway enruta solicitudes entre modelos hospedados y auto-hospedados a través de un único endpoint, con controles de acceso, failover y observabilidad.
El artículo sobre compresión no presenta una función de ngrok. Le da a ngrok una forma de enseñar a los desarrolladores cómo las probabilidades del modelo afectan el cómputo, el movimiento de datos y el diseño del sistema, el mismo público al que ngrok necesita llegar mientras vende infraestructura de enrutamiento para IA.
Shreve construyó esa audiencia antes de recurrir a capital institucional. Ngrok dice que hizo crecer el servicio a 5 millones de usuarios antes de su primer financiamiento. El 13 de diciembre de 2022, ngrok anunció una Serie A de $50 millones liderada por Lightspeed Venture Partners, con la participación de Coatue. La página About actual de Ngrok dice que 13 millones de desarrolladores se han registrado, mientras que su página de carreras describe una plantilla de más de 70 personas. Ambas cifras son reportadas por la empresa.
A medida que ngrok pasa de una utilidad para desarrolladores hacia un negocio de gateway más amplio, la educación técnica se vuelve parte de su distribución. El artículo de Sexton no vende ningún producto de compresión. Da a los lectores un modelo mental útil para un sistema que cada vez se espera más que operen.