Tokenless enruta solicitudes de LLM a mitad de la generación para reducir los costos de inferencia
Los fundadores de Tokenless, Rohit Agarwal, Andrew Liu y Kevin W., apuestan a que observar cómo varios modelos comienzan una tarea es mejor que elegir uno desde el principio.
By Ryan Merket · Published
Primary source: Tokenless
Why it matters
Inference routing is becoming a valuable control point in the AI stack. Tokenless is betting that partial model output can guide routing more accurately than prompt inspection alone, while its economics depend on making that decision fast enough to offset parallel inference costs.

Rohit Agarwal, Andrew Liu and Kevin W. están construyendo Tokenless, un enrutador de LLM que inicia cada solicitud en varios modelos, observa su trabajo inicial y conserva el modelo que parece más probable que termine con éxito. Kevin W. anunció públicamente Tokenless en LinkedIn en julio.
Los fundadores de San Francisco están haciendo una apuesta precisa sobre los costos de la IA: los desarrolladores a menudo pagan precios de modelos de frontera antes de saber qué tan difícil será una solicitud. Tokenless se inserta entre una aplicación y los proveedores de modelos, y luego intenta tomar esa decisión después de que la generación ha comenzado. Tokenless expone endpoints compatibles con OpenAI y Anthropic, lo que permite a los desarrolladores redirigir las llamadas API existentes en lugar de reconstruir sus aplicaciones alrededor de una nueva interfaz.
Agarwal aporta la conexión de investigación más clara con ese problema. Es estudiante de doctorado en ciencias de la computación en Princeton asesorado por Elad Hazan que works on mathematics for AI, agent alignment and inference pipelines. Agarwal completó previamente una licenciatura en ingeniería eléctrica y ciencias de la computación en UC Berkeley, donde también estudiaron Liu y Kevin W. Su trabajo publicado incluye una canalización de inferencia que combina modelos disponibles para matemáticas de competencia, una versión académica de la misma cuestión subyacente que Tokenless está comercializando: cómo ensamblar modelos disponibles en un sistema que rinda mejor por un costo dado.
En su publicación en LinkedIn, Kevin W. dijo que Tokenless sería parte de la cohorte Summer 2026 de Y Combinator. El sitio web de Tokenless describe por separado a Tokenless como respaldado por YC. YC dice que sus términos estándar comprometen $500,000 a cada empresa aceptada, divididos entre $125,000 por 7% y $375,000 en un safe de nación más favorecida sin tope.
Permitir que los modelos comiencen antes de elegir uno
La mayoría de los enrutadores de LLM inspeccionan un prompt, estiman su dificultad y lo envían a un modelo antes de que comience la generación. El proyecto de código abierto RouteLLM framework, por ejemplo, es un marco de enrutamiento de costo y calidad para servir y evaluar enrutadores de LLM.
Tokenless dice que toma la decisión más tarde. Tokenless lanza una solicitud a varios modelos, observa sus respuestas parciales o trazas de razonamiento, selecciona uno cuando parece estar en buen camino y cancela el resto. Tokenless llama al enfoque automatic model switching, aunque el mecanismo se asemeja a una breve carrera especulativa entre modelos.
Esa distinción da a los fundadores acceso a información que un enrutador que solo mira el prompt carece. Dos solicitudes que se ven similares al principio pueden divergir una vez que los modelos las intentan. Un modelo más débil puede encontrar rápidamente una vía viable en una tarea y atascarse en otra. Tokenless busca detectar esa diferencia mientras todavía hay tiempo para detener la ejecución costosa.
La economía depende de qué tan rápido pueda elegir Tokenless. Cada intento paralelo consume recursos de inferencia, incluso cuando Tokenless no transfiere el trabajo descartado a la factura del cliente. Los ahorros al seleccionar un modelo más barato deben cubrir el costo de esos intentos cancelados, la infraestructura de enrutamiento y cualquier latencia añadida. Tokenless también se convierte en otro sistema en la ruta de la solicitud, donde las interrupciones, cambios de proveedor y selecciones incorrectas pueden afectar aplicaciones en producción.
Esos trade-offs explican por qué importa la capa de compatibilidad. Los desarrolladores pueden crear una cuenta y probar Tokenless con un trabajo de integración limitado antes de decidir si los ahorros justifican otra dependencia.
Las afirmaciones de los benchmarks se mueven con los modelos
Tokenless's homepage dice que su enrutador puede mantener calidad a nivel de frontera mientras reduce las facturas de inferencia a la mitad. Tokenless informa que una configuración llamada PRO resolvió el 72% de las tareas de TerminalBench 2.1 a $0.32 por tarea, la misma tasa de resolución que listó para Opus 4.8 a $2.41 por tarea. En LiveCodeBench, Tokenless reportó una tasa de resolución del 89% para PRO, en comparación con 88.9% para Opus 4.8.
Esos son los propios resultados de benchmark de Tokenless. Tokenless también ha mostrado una comparación diferente que abarca tau3-Banking, Terminal-Bench 2.1 y DeepSWE 1.1, con etiquetas de modelos más nuevas y una tasa de resolución promedio del 40.2% para Tokenless Pro. Las tablas cambiantes muestran qué tan rápido puede envejecer el conjunto de referencia de un producto de enrutamiento a medida que los proveedores lanzan modelos y ajustan precios.
Los benchmarks públicos de código y agentes proporcionan una comparación controlada, pero el tráfico de clientes determinará si el argumento se sostiene. Las distribuciones de prompts, las tasas de acierto de caché, las longitudes de respuesta, los límites de latencia y el comportamiento de reintentos pueden mover la factura sustancialmente. Un enrutador entrenado alrededor de agentes de codificación también puede comportarse de manera diferente en cargas de trabajo de soporte, extracción o conversacionales.
la calculadora de Tokenless ilustra el argumento de ventas con un cliente hipotético que gasta $40,000 al mes en LLMs. Bajo supuestos editables de enrutamiento, Tokenless estima una factura de $26,000, una tasa de ahorro combinada del 34% y el 42% de las solicitudes redirigidas. Tokenless dice explícitamente que el resultado depende del tráfico del cliente y de los precios publicados de los modelos.
Una posición valiosa entre las aplicaciones y los proveedores de modelos
Tokenless entra en un mercado de enrutamiento de modelos que ya ha atraído grandes inversiones en infraestructura. OpenRouter anunció una Serie B de $113 millones el 28 de mayo después de expandirse desde el acceso a modelos hacia enrutamiento consciente de la calidad, failover y controles empresariales. Portkey recaudó una Serie A de $15 millones el 19 de febrero para su gateway de IA y plano de control, antes de que Palo Alto Networks completara su adquisición de Portkey el 29 de mayo.
La atracción es sencilla. Una capa de enrutamiento ve qué modelos usa una aplicación, cuánto cuesta cada solicitud y dónde ocurren las fallas. Esa posición puede expandirse hacia observabilidad, presupuestos, políticas de seguridad, respaldos y compras. Tokenless está comenzando con la promesa más estrecha de elegir modelos después de verlos trabajar.
Tokenless también usa AI Index de Ramp en su calculadora, aplicando una tendencia de gasto en IA mensual del 11.0% para junio de 2025 a junio de 2026 para ilustrar cómo los costos de modelos no gestionados pueden compuestos. El caso exacto de ahorros dependerá de la mezcla de cargas de trabajo, los precios de los proveedores y qué tan rápido Tokenless puede detener ejecuciones perdedoras.
Eso le da a Tokenless un cliente inicial definido: desarrolladores que ejecutan suficiente tráfico de agentes para que pequeñas mejoras de enrutamiento produzcan ahorros materiales. Agarwal, Liu y Kevin W. ahora tienen que probar que observar los primeros pasos de un modelo genera una señal confiable antes de que la carrera paralela consuma el dinero que fue diseñada para ahorrar.