Applied Compute agrega flujos de trabajo de autodestilación a AC2 para la retroalimentación de agentes en producción
El conjunto de herramientas utiliza correcciones, fallos de herramientas y otras trazas de agentes para entrenar modelos sobre el comportamiento observado después del despliegue.
By Ryan Merket · Published
Primary source: Applied Compute on X
Why it matters
Applied Compute is turning agent logs into training infrastructure. If AC2 can control regressions, proprietary production feedback could become a durable advantage for enterprise models.

Applied Compute agregó flujos de trabajo nativos de auto-destilación on-policy y de auto-destilación enmascarada por relevancia a AC2, dando a los equipos de IA empresariales una forma de convertir trazas de producción y correcciones de usuarios en datos de entrenamiento para modelos, dijo la compañía en un hilo del 4 de agosto en X. El lanzamiento avanza la apuesta central hecha por los cofundadores Yash Patil (@ypatil125), Rhythm Garg (@rhythmrg) y Linden Li (@lindensli): las empresas querrán modelos que aprendan sus flujos de trabajo internos en lugar de depender indefinidamente de sistemas de propósito general. (appliedcompute.com)
https://x.com/appliedcompute/status/2084429372128403913
Patil, Garg y Li iniciaron Applied Compute después de trabajar en OpenAI. Patil trabajó en el esfuerzo de codificación Codex, mientras que Garg y Li contribuyeron a la system card o1 de OpenAI; Garg también coescribió investigación de OpenAI sobre programación competitiva con modelos de razonamiento. Ese trasfondo ha moldeado Applied Compute en torno al post-entrenamiento, el aprendizaje por refuerzo y la infraestructura requerida para mantener a los modelos especializados mejorando después del despliegue. (theinformation.com)
Entrenamiento con la traza que el modelo ya produjo
Los agentes en producción crean registros de llamadas a herramientas fallidas, reintentos, ediciones aceptadas, aclaraciones de usuarios y comentarios humanos. Esos registros contienen información sobre lo que el modelo debería haber hecho, pero son difíciles de convertir en una recompensa numérica adecuada para el aprendizaje por refuerzo convencional. Los nuevos flujos de trabajo AC2 de Applied Compute, en cambio, entrenan sobre la trayectoria existente del agente. (appliedcompute.com)
Con la auto-destilación on-policy, u OPSD, el modelo estudiante ve el prompt original y su propia respuesta. Una versión maestra que usa los mismos pesos ve ese material más una pista añadida, como una corrección o instrucción que explica la falla. AC2 entonces compara las preferencias de tokens del maestro y del estudiante y entrena al estudiante hacia el comportamiento producido con el contexto extra. El método está diseñado para retroalimentación cualitativa y tareas que son costosas, con estado o imposibles de reproducir múltiples veces. (appliedcompute.com)
La variante enmascarada por relevancia de Applied Compute, RMSD, restringe la actualización a los tokens considerados relevantes para la corrección deseada. Un maestro podría diferir del estudiante en redacción, estilo y otros detalles que tienen poca relación con el error real. RMSD primero filtra posiciones de token con grandes diferencias maestro-estudiante y luego usa un juez basado en un modelo de lenguaje para elegir las posiciones más relevantes para el entrenamiento. AC2 expone esas elecciones junto con la traza completa, la pista insertada y un mapa de calor a nivel de token. (appliedcompute.com)
Esa visibilidad atiende un riesgo práctico en el aprendizaje continuo: una corrida puede mostrar una pérdida decreciente mientras el modelo memoriza un conjunto de datos estrecho o adopta un comportamiento del maestro no relacionado. Applied Compute dijo que ha visto un comportamiento objetivo mejorar en 10 pasos de entrenamiento sin transferirse más allá de los ejemplos usados en la corrida. La interfaz de AC2 está pensada para permitir que los investigadores inspeccionen esa falla mientras el entrenamiento está en curso, en lugar de confiar únicamente en puntajes agregados de evaluación. (appliedcompute.com)
La evidencia pública sigue siendo controlada
Applied Compute presentó RMSD en un informe de investigación del 22 de mayo usando una tarea deliberadamente artificial: entrenar a Qwen3-4B para escribir "pineapple" incorrectamente como "pinapple" en respuestas sobre comida tropical. En ese experimento, RMSD alcanzó el comportamiento objetivo en aproximadamente la mitad de pasos de entrenamiento que la OPSD ordinaria y tomó alrededor de 5% menos tiempo de reloj, según los resultados de la compañía. También retuvo mejor desempeño en varias evaluaciones no relacionadas que el ajuste fino supervisado. (appliedcompute.com)
La prueba demostró si el método podía enseñar un comportamiento fuera de distribución mientras limitaba el daño en otros lugares. No estableció el rendimiento a través de un amplio conjunto de despliegues empresariales. Applied Compute reconoció que la capacidad de RMSD para generalizar entre tareas, su sensibilidad al modelo juez y el mejor momento para actualizar los pesos del maestro siguen siendo preguntas de investigación abiertas. El informe de producto del 3 de agosto añade ejemplos que involucran trazas de producción y corrección de llamadas a herramientas, pero no publica resultados a nivel de cliente para los nuevos flujos de trabajo AC2. (appliedcompute.com)
AC2 soporta tres rutas: entrenar fuera de línea a partir de transcripciones de producción almacenadas, re-muestrear una sola interacción, o ejecutar un entorno completamente reproducible en el que una tarea se califica antes de la destilación. Applied Compute dijo que generalmente comienza con trazas almacenadas para medir ganancias a partir de datos de producción existentes, y luego avanza hacia el re-muestreo y el entrenamiento en línea como parte de una canalización de aprendizaje continuo. (appliedcompute.com)
La apuesta de infraestructura de Applied Compute
El lanzamiento le da una forma de producto concreta al argumento que ayudó a Applied Compute a recaudar $80 millones el 8 de abril con una valoración post-money de $1.3 mil millones. La financiación fue liderada por Kleiner Perkins, con participación de Elad Gil, Lux Capital, Greenoaks, Neo y Hanabi. Applied Compute dice que la ronda elevó su financiamiento total a $160 millones. (appliedcompute.com)
Applied Compute posiciona a AC2 como un plano de control para entrenamiento, evaluación, inferencia, despliegue y mejora continua de modelos. Su sitio web lista a Microsoft, Nvidia, Handshake, NTT Data, DoorDash, Harvey, Cognition, Mercor y varias compañías de biotecnología como clientes o colaboradores. Esas relaciones colocan a AC2 frente a un amplio conjunto de herramientas de entrenamiento de modelos, cómputo en la nube y observabilidad de agentes, mientras que el argumento de Applied Compute combina esas funciones con investigadores integrados junto a los clientes. (appliedcompute.com)
El lanzamiento de la auto-destilación apunta a la ventaja de datos que Applied Compute está vendiendo a esos clientes. Cada agente desplegado produce nueva evidencia sobre las preferencias y procedimientos operativos de una empresa. AC2 está diseñado para mover esa evidencia de los logs a los pesos del modelo, con investigadores inspeccionando qué comportamientos cambiaron y si la actualización introdujo regresiones. Convertir ese ciclo en infraestructura repetible haría que el propio uso en producción sea una entrada para la siguiente versión del modelo, en lugar de un registro revisado solo después de que algo salga mal. (appliedcompute.com)