Devin migró el sitio de Cognition y registró sus propias ejecuciones de verificación

Jared Palmer dice que el proyecto Astro-to-Next.js usó pruebas registradas para reproducir fallas sutiles, aunque Cognition no publicó datos sobre el alcance ni el rendimiento.

By · Published

Primary source: X

Why it matters

Cognition's central bet depends on agents returning evidence, not just code. Recorded testing could reduce the review burden as engineering teams delegate more production work asynchronously.

Devin migrated Cognition's site and recorded its own verification runs

Cognition, fundada por Scott Wu (@ScottWu46), Steven Hao (@stevenkplus1) y Walden Yan (@walden_yan), usó Devin para migrar su sitio de marketing de Astro a Next.js, con el agente probando el resultado y registrando ejecuciones que ayudaron a reproducir errores sutiles y confirmar correcciones, según Jared Palmer (@jaredpalmer) en un hilo.

Jared Palmer en X

El momento exacto de la migración no queda claro, por lo que el episodio se lee mejor como un estudio de caso interno en lugar de un lanzamiento de producto nuevo. Palmer no publicó el repositorio, la duración, el número de archivos cambiados, el estado del despliegue ni datos de rendimiento antes y después. Su relato tampoco cuantifica la contribución humana, incluyendo quién definió el alcance de la migración, revisó la salida y aprobó el despliegue final.

Esas omisiones limitan lo que la migración prueba sobre la autonomía. El flujo de trabajo de pruebas sigue siendo el detalle consecuente. Un agente que cambia un framework puede producir un diff impresionante mientras rompe silenciosamente la navegación, el estilo, la autenticación, la analítica o el comportamiento específico del navegador. La narración de Palmer dice que Devin usó ejecuciones grabadas para volver a esos fallos sutiles y verificar correcciones posteriores, convirtiendo la propia ejecución en un artefacto que un ingeniero podría inspeccionar.

La apuesta de los fundadores llega a la etapa de revisión

Wu y sus cofundadores construyeron Cognition en torno a la delegación en lugar de la autocompletación de código en línea. El objetivo declarado de Cognition es un agente que acepta una tarea de software, trabaja dentro del repositorio y del entorno de desarrollo, y devuelve trabajo terminado para revisión. Los fundadores provienen de la programación competitiva: Cognition dice que su grupo fundador en conjunto posee 10 medallas de oro de la International Olympiad in Informatics y agrupa ingenieros de Scale AI, Cursor, Lunchclub, Google DeepMind, Modal, Waymo y Nuro.

Wu, medallista de oro del IOI en tres ocasiones y quien anteriormente cofundó Lunchclub, ha descrito la meta de Cognition como facilitar que las personas construyan software fiable mientras los ingenieros avanzan hacia el diseño de sistemas y la definición de problemas. La migración del sitio de marketing encaja con esa tesis de manera particularmente adecuada. Las conversiones de framework están lo bastante acotadas para dividirse en pasos concretos, pero son lo bastante amplias para exponer si un agente puede navegar una base de código real, preservar el comportamiento y detectar regresiones después de que el código compile.

Palmer también es un mensajero pertinente para el trabajo. Su sitio personal lo identifica como vicepresidente de ingeniería de Cognition. Su relato proviene del vicepresidente de ingeniería de Cognition, no de uno de sus fundadores.

La grabación se convierte en parte del entregable

Cognition ha estado añadiendo verificación grabada a Devin en 2026. En febrero, Cognition lanzó Devin 2.2 con uso de computadora de escritorio, autoverificación y correcciones automatizadas. La documentación sobre el uso de computadora de Cognition dice que Devin puede instalar dependencias, iniciar una aplicación, generar un plan de pruebas, interactuar con la interfaz y devolver un video anotado de la ejecución.

El ingeniero de Cognition Ido Pesok describió el razonamiento estratégico en una publicación del 29 de mayo. A medida que más sesiones de agentes inician mediante horarios, automatizaciones y otros agentes, los ingenieros no pueden ver cada paso en vivo. La salida necesita suficiente evidencia para que alguien que regrese más tarde juzgue si el cambio está listo para revisión. Cognition dice que Devin también puede convertir procedimientos de prueba recurrentes en habilidades reutilizables, lo que coincide con la explicación de Palmer de que los scripts de verificación pueden almacenarse en un bloc de notas de sesión o reutilizarse entre sesiones secundarias paralelas.

Ese flujo de trabajo aborda un problema básico creado por los agentes de codificación asincrónicos: aumentan la cantidad de código disponible para revisión más rápido de lo que aumentan la capacidad de los ingenieros para entenderlo. Una grabación de pantalla por sí sola no establece la corrección. Puede hacer la revisión más acotada al mostrar qué flujos se ejecutaron, qué observó el agente y si la corrección reportada sobrevivió la misma secuencia que expuso el error.

La propia revisión de desempeño de 2025 de Cognition traza el límite con claridad. Cognition dijo que Devin funcionó mejor en tareas con requisitos claros y resultados verificables, mientras que los proyectos ambiguos y la lógica de prueba aún requerían juicio humano. Una migración de framework puede situarse en cualquiera de los dos lados de ese límite. Criterios de aceptación como builds que pasan, rutas preservadas y comportamiento visual estable son verificables. Decisiones sobre arquitectura, accesibilidad, mantenibilidad a largo plazo y compensaciones de rendimiento siguen siendo más difíciles de reducir a una ejecución grabada.

Pruebas independientes han mostrado previamente el costo de fijar mal ese límite. En enero de 2025, Answer.AI reportó 14 fallos, tres resultados inconclusos y tres éxitos en 20 tareas que asignó a una versión anterior de Devin. Los investigadores encontraron que Devin podía quedarse atascado en trabajo mal especificado o desconocido. Esa evaluación es anterior a los lanzamientos de verificación de Cognition en 2026 y no evalúa la migración de Astro, pero explica por qué la evidencia adjunta a la salida se ha vuelto central en el argumento de venta de Cognition.

Cognition necesita pruebas que escalen con la valuación

La migración interna también cumple una finalidad comercial. Cognition dijo en mayo que recaudó más de $1,000 millones con una valuación post-money de $26,000 millones en una ronda liderada por Lux Capital, General Catalyst y 8VC. Cognition también reportó $492 millones en ingresos anualizados por tasa de ejecución y un crecimiento de uso empresarial superior a diez veces desde principios de 2026. Esas cifras son reportadas por la propia compañía y Cognition no ha adjuntado estados financieros auditados al anuncio.

A esa escala, Cognition está vendiendo un modelo operativo para organizaciones de ingeniería, no un generador de código ingenioso. La migración de Astro a Next.js ofrece a clientes potenciales una versión compacta de ese argumento: asignar un proyecto de producción existente, dejar que el agente haga los cambios y recibir evidencia inspeccionable junto con el código.

El hilo de Palmer no llega a establecer una migración sin intervención ni a medir si Devin superó a un ingeniero experimentado en tiempo, costo o calidad. Muestra, en cambio, dónde Wu, Hao y Yan están concentrando el trabajo de producto de Cognition. La generación de código ya es abundante. Cognition apuesta a que la planificación, la ejecución, las pruebas y la prueba verificable puedan hacer el trabajo autónomo lo bastante fiable como para fusionarlo.

Reader comments

Conversation for this story loads after sign-in.