Supabase lanza un benchmark abierto para agentes de codificación de IA que construyen backends

El framework prueba a Claude Code, Codex y OpenCode en tareas de bases de datos, autenticación y Edge Function, y luego publica las puntuaciones.

By · Published

Primary source: Supabase on X

Why it matters

AI agents now influence which databases and backend tools developers adopt. Supabase Evals gives the platform a way to find and fix agent failures before they become lost projects.

Supabase launches open benchmark for AI coding agents building backends

Supabase, fundada por Paul Copplestone (@kiwicopple) y Ant Wilson (@AntWilson), lanzó un benchmark de código abierto el 31 de julio para medir qué tan bien los agentes de codificación de IA construyen y reparan aplicaciones en su plataforma Postgres.

El lanzamiento formaliza un cambio que ya está remodelando el negocio de Supabase. Copplestone inició Supabase después de encontrarse con limitaciones de Firebase y Firestore mientras construía un producto anterior, lo que lo llevó a él y a Wilson a perseguir una alternativa basada en Postgres. Seis años después, los agentes de IA se han convertido en una fuente significativa de demanda para esa infraestructura. Supabase dijo en junio que las herramientas de IA lanzan más del 60% de sus nuevas bases de datos.

Supabase Evals, desarrollado por el ingeniero de Supabase Matt Rossman (@the_ross_man), ejecuta agentes como Claude Code, Codex y OpenCode contra tareas extraídas de tickets de soporte, reportes de errores e issues de GitHub. Los ejemplos incluyen construir un esquema de base de datos, depurar una Edge Function fallida y reparar una política de seguridad a nivel de fila rota.

Cada escenario opera contra un entorno real de Supabase en lugar de un conjunto estático de preguntas de codificación, según la publicación de lanzamiento de Supabase. Los agentes usan el servidor Model Context Protocol de Supabase o la interfaz de línea de comandos, y su trabajo se califica mediante comprobaciones deterministas junto con un juez LLM para tareas que requieren evaluación semántica.

Convirtiendo fallos de agentes en trabajo de producto

El benchmark cumple dos propósitos dentro de Supabase. Un conjunto público compara agentes a través de áreas de producto y etapas del desarrollo de aplicaciones. Un conjunto de regresión separado rastrea modos de falla específicos diariamente, permitiendo a los ingenieros de Supabase probar si los cambios en la documentación, las instrucciones para agentes o los productos corrigen errores recurrentes.

El repositorio con licencia Apache-2.0 contiene los prompts, los evaluadores (scorers), los estados iniciales de los proyectos y las configuraciones de los experimentos. Los desarrolladores pueden ejecutar escenarios individuales o ejecutar suites de benchmark en múltiples agentes. Las pruebas local-stack colocan al agente dentro de un sandbox de Docker con el Supabase CLI real, mientras que las pruebas basadas en herramientas exponen la plataforma a través de la interfaz MCP de Supabase.

Supabase también da a cada agente un reintento tras un fallo inicial antes de asignar una calificación. Esa elección reduce las fallas causadas por un intento malo aislado, aunque significa que las puntuaciones miden la capacidad de recuperación del agente además de su precisión en el primer intento. La inclusión de calificación basada en LLM añade otra capa de juicio que los usuarios deberían considerar al comparar resultados.

Las primeras ejecuciones expusieron problemas que los benchmarks convencionales de código pasarían por alto. Supabase encontró agentes escribiendo migraciones a mano cuando un proyecto existente usaba esquemas declarativos, y eligiendo patrones de autenticación más antiguos en lugar de una librería más nueva de Supabase para Edge Functions seguras. Supabase respondió revisando su orientación para agentes y publicando documentación más clara.

Supabase también descubrió que el acceso a sus skills para agentes producía ganancias desiguales. En la instantánea de la etapa de construcción publicada con el lanzamiento, Supabase dijo que Claude Opus 5 y Kimi K3 pasaron todos los escenarios sin una skill de Supabase cargada. Claude Sonnet 5 subió del 78% al 100% después de recibir la skill, mientras que GPT-5.4 mini pasó del 78% al 89%.

El comportamiento respecto a la documentación varió drásticamente. Supabase informó que los agentes basados en Codex consultaron su documentación con más frecuencia que los agentes Claude Code. Codex ejecutando GPT-5.6 leyó aproximadamente ocho páginas por escenario, en comparación con unas dos para Claude Code, mientras que Claude Code accedió a la documentación en menos del 40% de los escenarios incluso cuando había skills disponibles. Supabase describe esos resultados como una instantánea porque los tiempos de ejecución y los modelos de los agentes cambian rápidamente.

Supabase está midiendo su nuevo canal de distribución

El benchmark llega a menos de dos meses de que Supabase recaudó $500 millones en una Serie F con una valoración pre-money de $10 mil millones. GIC lideró la ronda del 4 de junio, con inversores existentes participando, Stripe realizando una segunda inversión, y Georgian y Salesforce Ventures uniéndose como nuevos patrocinadores.

Supabase dijo que los lanzamientos de bases de datos habían aumentado 600% respecto al año anterior y que casi 10 millones de desarrolladores usaban sus productos al momento del anuncio de la Serie F. Esas cifras son autoinformadas. Y Combinator, que apoyó a Supabase en su cohorte Summer 2020, lista 120 empleados y describe a Supabase como una plataforma de desarrollo totalmente remota construida alrededor de clusters de Postgres aislados, autenticación, seguridad a nivel de fila, APIs y datos en tiempo real.

Evals le da a Supabase un sistema de retroalimentación para un canal de distribución que no controla directamente. Cuando un agente elige una librería obsoleta, omite una característica de seguridad o no lee la documentación, la falla puede impedir que un desarrollador adopte Supabase incluso si el servicio subyacente funciona como fue diseñado. Publicar el benchmark permite a Supabase identificar esas fallas, revisar las interfaces que consumen los agentes y comprobar si las correcciones sobreviven a actualizaciones posteriores de modelos.

Las puntuaciones siguen siendo específicas a las tareas y entornos diseñados por Supabase. No establecen qué agente de codificación rinde mejor en todo el desarrollo de software, y Supabase tiene un incentivo para mejorar cómo cada agente probado usa sus productos. Para los desarrolladores que construyen sobre Supabase, sin embargo, los escenarios proporcionan un registro concreto de si un agente puede manejar trabajo de seguridad de bases de datos, despliegue y depuración que va más allá de generar código de aplicación.

Reader comments

Conversation for this story loads after sign-in.