Cognition agrega Grok 4.6 a la plataforma de codificación multimodelo de Devin
La integración le da a xAI distribución dentro de un flujo de trabajo de ingeniería establecido y refuerza el argumento de Cognition de que la orquestación, no un único modelo de base, es el producto duradero.
By RuntimeWire Staff · Published
Primary source: Cognition on X
Why it matters
Cognition is positioning Devin as the model-neutral control layer for software agents. Fast Grok integration shows how coding products can capture value even as the best underlying model changes.

Cognition, la empresa de codificación con IA dirigida por Scott Wu (@ScottWu46), añadió el modelo Grok 4.6 de xAI a Devin Desktop y Devin CLI el 12 de agosto, dando a los desarrolladores otro modelo base para trabajo guiado por agentes dentro de repositorios de código locales.
La compañía anunció la integración en un hilo en X y publicó una breve nota técnica que describe a Grok 4.6 como particularmente fuerte para explorar repositorios y diagnosticar causas raíz antes de editar el código. Cognition también acreditó al modelo por seguir las convenciones del repositorio y probar cuidadosamente sus cambios.
Wu fundó Cognition con un grupo de ingenieros que se conocían desde hacía más de una década a través de la programación competitiva. En una publicación anterior de la compañía, describió al equipo inicial trabajando juntos desde un departamento en Nueva York. Cognition dice que su equipo fundador posee colectivamente 10 medallas de oro de la Olimpiada Internacional de Informática, un antecedente que ayuda a explicar el enfoque de la compañía en medir los modelos de codificación contra estándares de ingeniería de producción en lugar de con indicaciones breves de generación de código.
El benchmark de Cognition sitúa a Grok por detrás de dos modelos Claude
Cognition dice que Grok 4.6 mejoró sustancialmente respecto a Grok 4.5 en FrontierCode 1.1 Extended, el benchmark propietario de la compañía para evaluar la calidad y la integrabilidad del trabajo de ingeniería generado por modelos. El nuevo modelo se ubicó por encima de GPT-5.6 Sol de OpenAI y por debajo de Claude Opus 5 y Claude Fable 5 de Anthropic, según Cognition.
Esa clasificación es evidencia del propio sistema de evaluación de Cognition, más que de una tabla de líderes independiente de la industria. La compañía no publicó un nuevo paper de investigación junto con la integración del miércoles. Su metodología FrontierCode 1.1, publicada el 7 de julio, utiliza tareas extraídas de pull requests reales en repositorios de código abierto y califica las presentaciones según criterios definidos por revisores.
El conjunto Extended contiene 150 tareas. FrontierCode utiliza más de 1,000 criterios de evaluación a lo largo del benchmark, con requisitos centrales designados como bloqueantes. Una solución que falla un criterio bloqueante recibe un cero, lo que hace que la evaluación sea más estricta que las pruebas que otorgan crédito parcial por parches incompletos.
Cognition revisó el benchmark en julio tras encontrar que los modelos más fuertes eran cada vez más capaces de localizar soluciones existentes en línea. FrontierCode 1.1 permite el uso legítimo de internet, incluida la lectura de documentación, mientras instruye a los agentes a no recuperar parches upstream u otro material que revele la respuesta. Un verificador comprueba la actividad del modelo y anula con cero las ejecuciones que violen esas reglas.
La clasificación resultante de Grok es más útil como medida de cómo el modelo funciona dentro del entorno de agentes de Cognition. El andamiaje de agentes, las herramientas disponibles, los prompts y la configuración del repositorio pueden afectar materialmente los resultados de codificación, por lo que la tabla de clasificación no debe considerarse un orden universal para cada flujo de trabajo de programación.
Devin se convierte en otro canal de distribución para xAI
Grok 4.6 está disponible en Devin Desktop, el entorno de desarrollo centrado en agentes de Cognition construido a partir de Windsurf, y en el Devin CLI, su agente de codificación local por línea de comandos. El CLI puede implementar funciones, investigar errores, revisar código y responder preguntas mientras opera sobre archivos en la máquina de un desarrollador.
La adición impulsa la estrategia de Cognition de actuar como una capa independiente entre los equipos de ingeniería y los proveedores de modelos base. Cognition dijo en mayo que evalúa modelos en más de 100 categorías de trabajo de ingeniería de software y diseña Devin para seleccionar modelos según el rendimiento en la tarea y el costo. Su producto Desktop también soporta el Agent Client Protocol, permitiendo que agentes externos compatibles se ejecuten junto a Devin.
Esa posición le da a Cognition un incentivo para integrar modelos capaces rápidamente, incluso cuando provienen de compañías que compiten en otros ámbitos de la codificación con IA. Los desarrolladores eligen cada vez más un producto de codificación por su orquestación, contexto del repositorio y flujo de trabajo de revisión, mientras que el modelo subyacente puede cambiar de una tarea a otra. Grok 4.6 le ofrece a Cognition otra opción para el trabajo intensivo en investigación que a menudo determina si un agente arregla el defecto real o simplemente edita el archivo más obvio.
Para xAI, la integración coloca a Grok dentro de un flujo de trabajo de ingeniería de software establecido sin requerir que los desarrolladores muevan sus proyectos a una interfaz de codificación construida por xAI. Para Cognition, la clasificación del modelo respalda la apuesta mayor de Wu: el producto duradero es el sistema de agentes que puede probar, encaminar y supervisar modelos competidores a medida que cambia su rendimiento relativo.