Cuatro puntos de control de Grok 4.5 aparecen en Arena cerca de la ventana 4.6 de xAI
Las entradas del listado apuntan a variantes multimodales y habilitadas para la web, pero sus etiquetas no establecen que Grok 4.6 esté detrás de ellas.
By Ryan Merket · Published
Primary source: X - leo (@synthwavedd)
Why it matters
Multiple checkpoints suggest xAI is using live user preferences to choose its next Grok configuration, but the shared 4.5 label is not proof of a 4.6 launch.

Cuatro puntos de control etiquetados Grok 4.5 aparecieron en una alerta de roster de Arena el martes, proporcionando a Elon Musk (@elonmusk) un nuevo conjunto de pruebas con usuarios reales mientras xAI prepara la siguiente iteración de Grok.
Las cuatro entradas fueron difundidas en un post en X por leo (@synthwavedd), quien las describió como variantes presuntas de Grok 4.6 ejecutándose bajo el nombre de modelo existente. La captura de pantalla adjunta del monitoreo del roster respalda la afirmación más restringida: se añadieron cuatro identificadores separados bajo "grok-4.5". No las identifica como Grok 4.6. (x.com)

Dos de las entradas están marcadas para entradas de archivo, imagen y texto con salidas de texto y web. Las otras dos aceptan entradas de imagen y texto y devuelven texto. Cada una lleva un identificador interno diferente, lo que indica cuatro endpoints o configuraciones distintas en lugar de listados duplicados.
Musk identificó una corrida de entrenamiento de modelo mayor como Grok 4.6 en una respuesta del 17 de julio en X. La aparición de múltiples puntos de control menos de cuatro semanas después encaja con un ciclo de evaluación en etapa tardía, cuando un laboratorio puede comparar indicaciones del sistema, recetas posteriores al entrenamiento, acceso a herramientas o diferentes instantáneas antes de seleccionar un candidato de lanzamiento. Los datos del roster por sí solos no pueden determinar cuál de esas variables separa las cuatro entradas.
Arena permite a los laboratorios probar varios candidatos
La política de evaluación de Arena permite explícitamente a los proveedores de modelos probar múltiples variantes previas al lanzamiento. Los modelos no publicados pueden recibir etiquetas anónimas, evaluarse hasta que se acumulen suficientes votos y eliminarse después de que Arena comparta los resultados de forma privada con el proveedor. Arena dice que cada candidato anónimo recibe una etiqueta única, mientras que al menos un modelo en cada batalla debe estar ya disponible públicamente. (arena.ai)
Ese proceso convierte a Arena en un sistema externo de selección de productos para laboratorios de vanguardia. Los usuarios envían sus propias indicaciones, comparan dos respuestas sin ver inicialmente los nombres de los modelos y votan por la respuesta más sólida. Las identidades se revelan después de la votación. Arena luego agrega esas comparaciones en calificaciones, ofreciendo a los laboratorios retroalimentación de cargas de trabajo de codificación y chat en vivo que las suites de benchmark internas pueden pasar por alto. (help.arena.ai)
Por lo tanto, los cuatro endpoints de Grok muestran experimentación activa. No prueban que xAI haya finalizado Grok 4.6, definido sus especificaciones o iniciado un despliegue público. La etiqueta compartida Grok 4.5 podría cubrir candidatos de lanzamiento para un sucesor, configuraciones 4.5 actualizadas o una mezcla de ambos.
Grok 4.5 estableció la referencia en julio
SpaceXAI, la marca que se usa en las páginas de modelos actuales de xAI, lanzó Grok 4.5 el 16 de julio, posicionándolo en torno a la programación, el trabajo con agentes y el conocimiento técnico. SpaceXAI afirma que Grok 4.5 se entrenó en decenas de miles de GPUs Nvidia GB300 y fue sometido a aprendizaje por refuerzo en cientos de miles de tareas. SpaceXAI fijó el precio del API en $2 por millón de tokens de entrada y $6 por millón de tokens de salida. Esas cifras de entrenamiento, rendimiento y eficiencia siguen siendo afirmaciones suministradas por la compañía. (x.ai)
Grok 4.5 ya estaba presente dentro de Arena antes de la alerta del roster del martes. El changelog público de Arena registró la adición del modelo a Agent Arena el 13 de julio, tres días antes del anuncio formal de lanzamiento de SpaceXAI. La secuencia proporciona un precedente reciente de que Grok aparezca en Arena antes o junto con un lanzamiento más amplio. (arena.ai)
La tabla de clasificación WebDev de finales de julio de Arena colocó al endpoint público Grok 4.5 en el puesto 10 en general, con una puntuación de 1,550 y un rango de confianza que abarca del séptimo al 16.º lugar. Los cuatro nuevos puntos de control del modelo le dan a xAI una forma de probar si su próxima configuración puede cerrar esa brecha en tareas de codificación mientras preserva la velocidad y los precios que SpaceXAI enfatizó en el lanzamiento. (arena.ai)
Para los desarrolladores, el detalle accionable se limita al cambio en el roster. No hay una ficha del modelo Grok 4.6 verificada, identificador de API, precio o endpoint público adjunto a estas cuatro entradas. Lo que ha surgido es la fase de evaluación: xAI parece estar probando varias configuraciones de Grok en chat general, entrada multimodal, manejo de archivos y salida habilitada para web antes de decidir qué se lanzará bajo el próximo nombre.