Tracer lanza Echo con puntuaciones cercanas a las de Claude Fable a un tercio del costo
El fundador en solitario Adam Rida construyó el sistema YC S26 para asignar capacidad de cómputo entre modelos de pesos abiertos a través de un único endpoint compatible con OpenAI.
By Ryan Merket · Published
Primary source: X
Why it matters
AI agents multiply model calls, making inference a gross-margin problem. Tracer is betting software can coordinate cheaper open models closely enough to replace premium endpoints for much of that traffic.

Tracer, el laboratorio de IA de San Francisco fundado por Adam Rida, lanzó Echo el 31 de julio, un sistema de inferencia adaptable que coordina múltiples modelos de pesos abiertos y devuelve una única respuesta a través de una API compatible con OpenAI. Tracer dijo en un hilo de ocho publicaciones en X que Echo se acercó a la calidad de Claude Fable 5 de Anthropic en sus evaluaciones actuales, a aproximadamente un tercio del costo de inferencia.
https://x.com/tracerml/status/2083297340207886775?s=46
Rida está construyendo Tracer en solitario. Y Combinator lista a Tracer como una empresa de una sola persona del Summer 2026 con sede en San Francisco. Rida estudió anteriormente interpretabilidad en aprendizaje automático como candidato a doctorado en Sorbonne University y CNRS, y luego construyó sistemas de ML aplicados en finanzas, seguros y cadena de suministro. En la publicación de lanzamiento de Tracer en YC, Rida dijo que hizo crecer su producto anterior, DeepRecall, hasta alrededor de 100,000 EUR en ingresos recurrentes anuales como fundador en solitario en menos de tres meses.
Echo amplía el trabajo previo de Rida sobre decidir cuándo una aplicación necesita una llamada a un modelo costosa. Su artículo de investigación del 16 de abril presentó TRACER, un sistema de código abierto que aprendía de trazas de producción y enviaba solicitudes de clasificación predecibles a modelos de aprendizaje automático ligeros mientras difería las entradas inciertas a un modelo de lenguaje más grande.
Echo aplica esa tesis de asignación de costos a cargas de trabajo generales de modelos de lenguaje. Para cada prompt, Tracer dice que Echo decide cuánta computación usar, selecciona modelos de una reserva de sistemas de pesos abiertos y combina sus salidas. Los desarrolladores conservan su cliente OpenAI existente y cambian la URL base, el nombre del modelo y la clave de API. Tracer está ofreciendo Echo para cargas de trabajo de chat, código y agentes, incluido su uso a través de OpenCode y arneses de agentes compatibles.
Afirmación de evaluación comparativa de Tracer
Tracer informó que Echo obtuvo 98.6% en MATH-500 con un costo de inferencia registrado de $4.58. Claude Fable 5, que Anthropic cotiza a $10 por millón de tokens de entrada y $50 por millón de tokens de salida, obtuvo 99.8% a $12.64 en la ejecución de Tracer.
En LiveCodeBench, Echo obtuvo 92.8% a $5.35, en comparación con 92.0% de Fable a $8.71, según Tracer. Esos resultados colocan a Echo ligeramente por delante en esa prueba de programación mientras usa menos gasto de inferencia registrado.
Las comparaciones siguen siendo benchmarks realizados por Tracer, en lugar de evaluaciones independientes. El Echo Eval Observatory de Tracer lista 907 preguntas a lo largo de ocho benchmarks y nueve conjuntos de prueba. Publica preguntas almacenadas, respuestas y calificaciones para su cohorte completada de MATH-500 y advierte que las salidas de los modelos pueden cambiar entre ejecuciones. Tracer también reconoce que los benchmarks públicos pueden aparecer en los datos de entrenamiento de los modelos y que no se puede establecer que Echo supere a Fable en cargas de trabajo de producción.
Los límites son significativos. Tracer dice que Echo está por detrás de Fable en tareas multilingües y en conocimiento más amplio, mientras que LiveCodeBench no mide trabajo de software a escala de repositorio ni los bucles de agente de mayor duración que requieren planificación, uso de herramientas, cambios de código y recuperación de errores. Tracer está ejecutando esas pruebas de horizonte más largo, con SWE-bench Verified, ARC-AGI y BigCodeBench listados sin resultados en el sitio de evaluación.
Coordinación en lugar de una sola ruta
El enrutamiento de modelos ya es una categoría de infraestructura disputada. Not Diamond vende enrutamiento y optimización de prompts, mientras que el marco de código abierto RouteLLM dirige las solicitudes más fáciles a modelos más baratos y reserva sistemas más potentes para prompts más difíciles.
La apuesta técnica y comercial de Tracer va más allá de elegir un modelo por solicitud. Echo puede invocar múltiples modelos de pesos abiertos, variar el presupuesto de computación y ensamblar su trabajo en una sola respuesta. Ese enfoque puede mejorar la calidad de la respuesta, aunque cada intento adicional de modelo consume tokens y añade latencia. Tracer debe probar que sus ganancias de coordinación superan consistentemente ese sobrecosto en el tráfico de aplicaciones real.
El producto está disponible a través de la interfaz de chat y API de Echo. La interfaz del navegador ofrece cinco mensajes de invitado sin cuenta, mientras que sus pantallas de cuenta y API etiquetan el servicio como una alfa privada. Tracer dice que la versión pública de Echo no entrena con trazas privadas de usuarios.
Tracer también está usando el lanzamiento para reclutar equipos de IA con facturas de inferencia de producción sustanciales. Rida dice que Echo se puede configurar en torno a la distribución de tráfico del cliente, el umbral de calidad y los requisitos de datos, permitiendo a Tracer aprender qué solicitudes merecen más computación. Ese servicio específico para la carga de trabajo es la ruta más clara de una demo pública de modelo a un negocio: vender menor gasto de inferencia a aplicaciones de IA cuyos márgenes brutos se reducen cada vez que un agente realiza otra llamada al modelo.
Y Combinator es el único financiador identificado de Tracer. El acuerdo estándar publicado de YC invierte $500,000 en cada empresa aceptada del batch: $125,000 por 7% y $375,000 a través de un SAFE de nación más favorecida sin tope. Para Rida, ese financiamiento respalda una apuesta estrecha con amplias implicaciones para las aplicaciones de IA: la capacidad de modelos premium podría entregarse cada vez más mediante software que asigna y combina modelos más baratos, en lugar de enviar cada solicitud al endpoint más caro.