AgentRadio de Coral elevó la precisión de los agentes de codificación a 62% con un costo seis veces mayor
Cuatro agentes Opus 4.6 superaron a un agente Opus 4.8 en un benchmark de código, aunque un modelo más nuevo ya ha superado ese resultado.
By Ryan Merket · Published
Primary source: VentureBeat
Why it matters
AgentRadio shows that orchestration can extract a model-generation-sized gain from existing coding agents. The commercial tradeoff is a roughly sixfold increase in inference cost.

Caelum Forder y Peter Carroll, los fundadores de Coral AI Labs, han presentado evidencia de que la arquitectura que rodea a un modelo de IA puede importar tanto como actualizar el propio modelo. El paper AgentRadio de sus investigadores, publicado el 30 de julio, informa que cuatro agentes Claude Code que ejecutaban Opus 4.6 de Anthropic resolvieron el 62.1% de un exigente benchmark de comprensión de bases de código cuando podían intercambiar descubrimientos durante la ejecución. Un agente Opus 4.6 resolvió el 32.3% en las pruebas de los investigadores, mientras que un solo agente usando el más nuevo Opus 4.8 obtuvo 57.2% en la tabla pública de clasificación de Scale AI.
La comparación es más estrecha que el resultado titular que circuló después de que VentureBeat informara sobre la investigación el 7 de agosto. AgentRadio no estableció que Opus 4.6 sea generalmente superior a Opus 4.8, ni que los sistemas de cuatro agentes superen consistentemente a modelos más nuevos. Superó a una configuración de Claude Code y Opus 4.8 en 124 tareas de comprensión de código. La tabla de clasificación actual de Scale ya lista a un solo agente Claude Code usando Opus 5 en 63.17%, ligeramente por encima del 62.1% de AgentRadio.
Ese rápido revés agudiza el argumento de Coral. Las publicaciones de modelos pueden borrar una ventaja de benchmark en días. El software de coordinación aún puede generar grandes ganancias a partir de modelos que las empresas ya usan, especialmente en trabajos que se extienden a través de muchos archivos, herramientas y pasos de ejecución. El costo es igual de claro: la configuración de cuatro agentes Opus 4.6 de AgentRadio promedió $19.45 por tarea, frente a $2.96 por un agente.
Forder es el fundador técnico y CTO de Coral. La página actual del equipo de Coral indica que anteriormente construyó infraestructura de IA en IBM Watson, trabajó en seguridad de IA en Conjecture y se desempeñó como ingeniero fundador en el desarrollador de marcos multi-agente CAMEL-AI. Carroll, CEO de Coral, dice que impulsó un estudio de juegos hasta 30 empleados antes de financiar el desarrollo temprano de Coral y ensamblar el negocio alrededor del trabajo de Forder en coordinación de agentes. El investigador principal Xinxing Ren, graduado con PhD de Brunel University London y excolaborador de CAMEL-AI, fue uno de los siete autores del paper junto a Qianbo Zang, Ziyan Wang, Forder, Suman Deb, Carroll y Zekun Guo.
Qué cambia AgentRadio
AgentRadio aborda un problema mundano de sistemas con grandes consecuencias: un agente que ejecuta una tarea normalmente no puede monitorear una conversación en vivo al mismo tiempo. Los diseños multi-agente existentes a menudo envían a varios agentes por caminos separados y fusionan sus respuestas después, o requieren que cada agente se detenga en puntos de control sincronizados antes de intercambiar información. Ambos diseños retrasan descubrimientos que podrían redirigir trabajo ya en curso.
El sistema de Coral añade tres operaciones de comunicación a los arneses existentes para agentes de codificación: create_thread, send_message y wait_for_mention. Un agente puede abrir una conversación nombrada, enviar un mensaje sin bloqueo y ejecutar el monitor de menciones como un proceso del sistema operativo en segundo plano. Los mensajes entrantes aparecen entre los pasos de ejecución del agente sin detener un comando en progreso.
La implementación de código abierto, publicada bajo Apache 2.0, no requiere cambios en Claude Code en sí. Cada agente se comunica con un servidor de mensajes separado mediante scripts de shell ligeros. Los investigadores ejecutaron un servidor y cuatro agentes Claude Code dentro de cada contenedor del benchmark, usando Modal y Harbor para gestionar los trabajos.
Coral envolvió esos primitivos en un procedimiento operativo de cinco fases. Los cuatro agentes primero inspeccionan el repositorio de manera independiente. Luego negocian cómo dividir la pregunta, ejecutan sus investigaciones asignadas en paralelo, revisan las pruebas de los demás y aprueban una respuesta final ensamblada por un agente designado. Durante la ejecución, se instruye a un agente para publicar descubrimientos que afecten la asignación de otro agente, contradigan el plan acordado o expongan un callejón sin salida.
La distinción entre la delegación multi-agente ordinaria y AgentRadio se sitúa en esa fase de ejecución. Bajo la configuración de bloqueo de Coral, un agente debe dedicar un paso en primer plano a esperar mensajes y por lo tanto tiende a trabajar sin escuchar. Bajo la conciencia pasiva, el monitor permanece activo en segundo plano y suministra mensajes en el siguiente límite de paso.
La negociación produjo la mayor ganancia
El experimento de Coral separó la arquitectura en capas en lugar de comparar solo el sistema terminado con un solo agente.
Un único agente Opus 4.6 resolvió 40 de las 124 tareas, o 32.3%. Cuatro agentes con una división básica del trabajo resolvieron 49 tareas, elevando la exactitud a 39.5%. Añadir planificación conjunta y revisión cruzada elevó el resultado a 64 tareas, o 51.6%. Mover la recepción de mensajes al segundo plano produjo el resultado final de 77 tareas, o 62.1%.
La progresión importa porque muestra que añadir agentes fue la intervención más débil. La división básica de tareas entregó 7.2 puntos porcentuales. La negociación añadió 12.1 puntos, y la conciencia pasiva aportó otros 10.5 puntos. El resultado de cuatro agentes provino de un proceso estructurado que obligó a los agentes a negociar asignaciones, exponer pruebas y revisar el trabajo mientras aún estaba en progreso.
Los investigadores repitieron los cambios de arquitectura con DeepSeek V4 Pro dentro del mismo arnés de Claude Code. La línea base de un solo agente obtuvo 29%. La división la elevó a 31.4%, la negociación alcanzó 39.5% y AgentRadio finalizó en 50.8%. La progresión similar a través de dos familias de modelos respalda la afirmación de Coral de que la ganancia provino de la capa de coordinación más que de una peculiaridad aislada en Opus 4.6.
Coral también reportó pruebas de significancia pareadas para el paso de conciencia pasiva. Con Opus 4.6, la comunicación en segundo plano convirtió 15 tareas que habían fallado previamente en aprobadas mientras perdía dos tareas que el sistema de bloqueo había aprobado. Los recuentos correspondientes para DeepSeek fueron 17 victorias y tres pérdidas. Los valores p reportados fueron 0.0023 y 0.0026.
Esas pérdidas son importantes. Los mensajes pueden distraer a un agente de una investigación productiva, propagar una conclusión incorrecta o redirigir la atención hacia la teoría más débil de un compañero. La comunicación entre agentes introduce otra fuente de contaminación contextual incluso cuando el mecanismo de entrega funciona como fue diseñado.
La economía es más difícil que el benchmark
El resultado más fuerte de AgentRadio costó aproximadamente 6.6 veces más por tarea que la ejecución única con Opus 4.6. La división básica promedió $5.38 por tarea, mientras que añadir negociación elevó la factura a $15.59. La conciencia pasiva la llevó a $19.45.
Coral probó si la mejora simplemente provenía de gastar más tokens ejecutando el agente único seis veces de forma independiente y reteniendo la mejor respuesta. Ese enfoque costó $17.76 por tarea, cerca del presupuesto del sistema de cuatro agentes, y resolvió el 37.9% de las tareas. AgentRadio alcanzó 62.1% por $1.69 más. En los experimentos con DeepSeek, seis ejecuciones independientes costaron $2.52 y obtuvieron 31.4%, mientras que AgentRadio costó $2.46 y obtuvo 50.8%.
El control respalda una distinción útil entre volumen de inferencia e inferencia organizada. Repetir el mismo proceso produce intentos adicionales. AgentRadio asigna el presupuesto a través de contextos separados y luego usa negociación y mensajes en vivo para combinar descubrimientos antes de que la respuesta final se fije.
Los compradores empresariales aún tienen que justificar un salto de aproximadamente $3 a casi $20 por una pregunta sobre una base de código. El cálculo se vuelve plausible cuando una respuesta precisa previene horas de trabajo de ingeniería, un incidente de producción o una migración defectuosa. Se vuelve difícil para preguntas de rutina, automatizaciones de alto volumen y flujos de trabajo donde una persona puede verificar la respuesta a bajo costo.
Anthropic llegó a una conclusión económica similar al describir su propio sistema de investigación multi-agente en 2025. Anthropic dijo que los sistemas multi-agente usaban alrededor de 15 veces más tokens que las interacciones de chat ordinarias y funcionaban mejor en trabajos valiosos y altamente paralelizables. Anthropic también identificó la codificación como un caso difícil porque las tareas de software contienen dependencias y los agentes tienen dificultades para coordinarse en tiempo real. AgentRadio es un intento directo de aflojar esa restricción en lugar de eliminar el costo subyacente.
El benchmark recompensa la comprensión exhaustiva
SWE-Atlas Codebase QnA mide si los agentes pueden entender repositorios de producción desconocidos antes de editarlos. Sus 124 tareas cubren 11 repositorios escritos en Go, Python, C y TypeScript. Las preguntas abarcan arquitectura, análisis de causa raíz, incorporación de ingenieros, seguridad y comportamiento de API.
La búsqueda estática de código es insuficiente. Un agente recibe un repositorio en un contenedor Docker y puede necesitar compilarlo, ejecutar comandos, reproducir comportamientos y trazar una ruta a través de múltiples archivos. Cada respuesta se evalúa según un promedio de 12.3 criterios fácticos. Una tarea se considera resuelta solo si pasa cada criterio, y modificar archivos fuente provoca una falla automática.
El diseño convierte a SWE-Atlas en una mejor prueba de investigación de larga duración que las evaluaciones convencionales de codificación centradas en producir un parche. Sigue siendo un punto de referencia con sus propias elecciones de calificación. Los experimentos de AgentRadio usaron Claude Opus 4.5 como juez, fijado en todas las configuraciones, y ejecutaron cada configuración completa de 124 tareas una vez. Por separado, Coral repitió las cuatro configuraciones principales de Opus 4.6 tres veces en un subconjunto de 30 tareas. AgentRadio promedió 64.4% allí con una desviación estándar de dos puntos porcentuales, y su ejecución más débil aún superó a la mejor ejecución de las otras configuraciones.
La tabla pública de clasificación también ilustra lo rápido que se mueve el punto de referencia. El artículo comparó AgentRadio con Opus 4.8 porque esa fue la entrada de un solo agente más fuerte citada por los investigadores. Al 8 de agosto, Scale lista Opus 5 en 63.17%, junto con el resultado de Opus 4.8 de 57.26%. El resultado de Coral sigue siendo evidencia de una mejora de arquitectura. Ya no es la puntuación más alta entre las entradas comparadas.
Live messages helped most when the plan was wrong
Las mayores ganancias aparecieron en preguntas de arquitectura y diseño de sistemas, donde la evidencia tiende a cruzar los límites de los componentes. Una división ingenua en cuatro agentes redujo las tareas resueltas de Opus 4.6 en esa categoría de 15 a 13. La negociación elevó el conteo a 24, y la comunicación pasiva lo aumentó a 30. Dividir un sistema fuertemente conectado en asignaciones aisladas dañó inicialmente el rendimiento; obligar a los agentes a reconciliar esas asignaciones revirtió la pérdida.
El estudio de caso de MinIO de Coral muestra el mecanismo. Una tarea requería evidencia por solicitud en el servidor, pero ninguno de los planes iniciales de los agentes mencionó habilitar el registro de auditoría. En la ejecución bloqueante, dos agentes se encontraron por separado con el problema de registro y no lograron convertirlo en evidencia compartida. Uno encontró la opción correcta MINIO_AUDIT_WEBHOOK_ENABLE sin proponerla a los demás. El grupo posteriormente aprobó una conclusión incompleta.
En la ejecución pasiva, un agente habilitó el webhook de auditoría y publicó los registros resultantes mientras los otros agentes aún trabajaban. Una pieza de instrumentación se convirtió en evidencia disponible para todo el grupo, y la respuesta pasó de cumplir 11 de 16 criterios de evaluación a cumplir los 16.
Una tarea de Grafana expuso el límite de AgentRadio. Cuatro criterios de evaluación requerían que los agentes establecieran que cierto comportamiento no ocurrió. Ninguna de las configuraciones formó la conclusión negativa correcta, incluso después de ejecutar pruebas relevantes. Ambas aprobaron cinco de nueve criterios. Una capa de mensajería puede distribuir un hallazgo que un agente descubre. No puede distribuir un hallazgo al que ninguno de ellos llega.
Coral is turning research into an orchestration product
AgentRadio encaja en la apuesta más amplia de Forder y Carroll por CoralOS, que Coral describe como una capa de orquestación y gobernanza para sistemas de agentes empresariales. CoralOS se construye en torno a conectar agentes de diferentes frameworks, monitorear su comportamiento y permitir que APIs existentes o servidores MCP participen en los flujos de trabajo de agentes. La página del equipo de Coral dice que la investigación también se ha comercializado a través de un producto de codificación llamado Coral Code.
Esa estrategia sitúa a Coral por debajo de los proveedores de modelos y por encima de los entornos de ejecución individuales. Una empresa puede cambiar modelos a medida que cambian las clasificaciones de los benchmarks mientras conserva la lógica de coordinación, monitoreo y aprobación que gobierna cómo los agentes trabajan en conjunto. El diseño de AgentRadio refuerza esa posición porque su servidor de mensajes opera fuera de Claude Code y se comunica mediante comandos de shell en lugar de modificar el harness de Anthropic.
El resultado del benchmark le da a Coral una demostración técnicamente creíble de esa tesis. También define la carga que enfrentan los proveedores de orquestación. Deben probar que la comunicación mejora el trabajo completado después de contabilizar el gasto de tokens, el esfuerzo duplicado, los errores propagados y la llegada de modelos base más fuertes.
AgentRadio superó ese umbral en una prueba de comprensión de código deliberadamente difícil. Su ganancia de 29.8 puntos sobre un agente Opus 4.6 fue mucho mayor que los 5.6 puntos obtenidos al gastar un presupuesto similar en ejecuciones independientes repetidas. Un modelo individual más nuevo ya ha alcanzado la puntuación principal. El resultado durable de Coral es el hallazgo controlado debajo de eso: los agentes que trabajan con el mismo modelo se desempeñaron materialmente mejor cuando podían revisar las investigaciones de los demás antes de que terminara la ejecución.