Arena lanza AutoEval para clasificar nuevos modelos de IA dentro de una hora

El sistema de modelo de recompensa utiliza millones de preferencias de los usuarios y obtuvo una correlación superior a 0.98 con las clasificaciones en vivo posteriores de Arena.

By · Published

Primary source: Arena on X

Why it matters

AutoEval lets Arena convert years of human votes into immediate model rankings, helping labs compare checkpoints while preserving live evaluation as the final validation layer.

Arena launches AutoEval to rank new AI models within an hour

Los cofundadores de Arena Anastasios Angelopoulos (@ml_angelopoulos), Wei-Lin Chiang (@infwinston) y Ion Stoica lanzaron AutoEval el 30 de julio, dándole a los nuevos modelos de IA una Arena Score preliminar antes de que suficiente gente haya votado para producir un ranking en vivo estable.

Detallado en un hilo de seis tuits en X y en una entrada técnica en el blog, AutoEval entrena modelos de recompensa con millones de preferencias por pares recopiladas a través de Arena. Arena dice que el sistema puede clasificar un modelo en menos de una hora, en comparación con los días que se requieren para acumular votos humanos. La puntuación inicial lleva una etiqueta "AutoEval" y se actualiza después de suficiente votación en vivo.

Angelopoulos y Chiang construyeron el Chatbot Arena original mientras trabajaban en el Sky Computing Lab de UC Berkeley. Ambos obtuvieron doctorados en ciencias de la computación en Berkeley y fueron investigadores postdoctorales y compañeros de departamento mientras el proyecto se convertía en un negocio, según un perfil de Berkeley News. El sistema de evaluación surgió en 2023 después de que los investigadores que trabajaban en el modelo abierto Vicuna necesitaran una forma creíble de comparar aplicaciones de chatbot con modelos de laboratorios más grandes.

AutoEval estima votos antes de que lleguen

AutoEval comienza con prompts y respuestas muestreadas de las evaluaciones en vivo de Arena. Arena genera una respuesta del modelo que se está probando y luego utiliza un modelo de recompensa punto a punto para puntuar cada par prompt-respuesta. Las diferencias entre esas puntuaciones se convierten en votos proxy ponderados por probabilidad y se combinan con los votos humanos existentes para calcular una Arena Score usando el método estándar de clasificación de la tabla de clasificación.

El sistema está entrenado para tener en cuenta las preferencias de los usuarios que cambian, los empates, las diferencias que se reducen entre modelos de frontera y las conversaciones de múltiples turnos donde un voto final puede reflejar decisiones tomadas mucho antes en el intercambio. Las evaluaciones de código añaden otra complicación porque la corrección, la calidad técnica y la interfaz resultante pueden afectar la elección del usuario.

Arena probó el enfoque usando un holdout temporal diseñado para reducir el riesgo de calificar modelos ya representados en sus datos de entrenamiento. Arena entrenó el modelo de recompensa con votos recopilados hasta finales de abril de 2026, y luego evaluó modelos lanzados después de ese corte. Los rankings de AutoEval resultantes tuvieron una correlación superior a 0.98 con las clasificaciones en vivo finales de los modelos, según Arena.

En más de 40 modelos de prueba, Arena dice que AutoEval seleccionó el modelo más fuerte en más del 90% de las comparaciones cuando las puntuaciones finales en vivo estaban separadas por al menos 10 puntos. Su precisión reportada alcanzó el 100% para brechas superiores a 15 puntos. La prueba de Arena también define dónde una puntuación temprana se vuelve menos útil: los modelos dentro de cinco puntos tenían intervalos de confianza superpuestos en la evaluación en vivo y eran estadísticamente indistinguibles.

Arena también afirma que su modelo de recompensa de texto predijo las preferencias de los usuarios entre un 8% y un 10% con más exactitud que los jueces Gemini 3 Flash, Gemini 3 Pro y GPT-5 que probó. Esas cifras provienen de la propia metodología de evaluación de Arena. AutoEval cubre actualmente texto, visión, generación de imágenes y programación. Arena entrenó su modelo de recompensa de texto a imagen con más de 3 millones de pares de preferencias y dice que el modelo superó a otros modelos de recompensa punto a punto en el benchmark MMRB2 de Meta.

Arena convierte su historial de votación en un producto más rápido

El lanzamiento aborda un problema de sincronización creado por el ritmo de los lanzamientos de modelos de vanguardia. Las tablas públicas de clasificación solo se vuelven informativas después de que llegan suficientes votos, mientras que los desarrolladores de modelos necesitan datos comparativos al elegir puntos de control y preparar lanzamientos. AutoEval permite que Arena utilice su historial acumulado de votaciones para estimar el orden eventual y luego entregue la clasificación a los usuarios en vivo para su validación.

Ese enfoque también vuelve los datos comunitarios de Arena más útiles comercialmente. En junio, Angelopoulos dijo que Arena había alcanzado una tasa de ingresos anualizada de $100 millones dentro de los ocho meses posteriores a la introducción de su oferta empresarial. Describió una plataforma con más de 10 millones de visitantes mensuales, 700 millones de conversaciones y 82 millones de votos humanos. Las cifras son autoinformadas, y la tasa de ejecución refleja ingresos basados en consumo en lugar de los convencionales ingresos recurrentes anuales contratados.

Arena ha recaudado $250 millones en dos rondas anunciadas. Su Serie A de $150 millones en enero fue liderada por Felicis y UC Investments, con la participación de Andreessen Horowitz, The House Fund, LDVP, Kleiner Perkins, Lightspeed Venture Partners y Laude Ventures. Reuters informó que la financiación valoró a Arena en $1.7 mil millones.

AutoEval aplica el activo central de Arena, su historial de elecciones reales de los usuarios, al período en el que la evaluación humana es más lenta y la demanda comercial de una respuesta es mayor. Su utilidad dependerá de si los modelos de recompensa continúan siguiendo las preferencias de los usuarios a medida que cambia el comportamiento de los modelos. Las pruebas temporales de Arena y las etiquetas AutoEval visibles dan a los usuarios una forma de comparar la estimación temprana con el resultado en vivo que sigue.

Reader comments

Conversation for this story loads after sign-in.