Imbue liberó Catalyst de código abierto para mantener a los agentes de investigación de IA explorando hipótesis rivales

La herramienta AGPL de Kanjun Qiu y Josh Albrecht superó a un agente lineal en nanochat, aunque sus costos de cómputo y límites de investigación siguen siendo sustanciales.

By · Published

Primary source: Imbue on X

Why it matters

Catalyst turns verification and competing hypotheses into first-class parts of an AI research workflow. If the approach generalizes beyond nanochat, small research groups could run broader computational searches without surrendering control to a closed agent platform, though token and experiment costs remain a practical constraint.

Illustration of Imbue's open-source Catalyst as a central computing module with diverging thought paths, representing researchers Kanjun Qiu and Josh Albrecht exploring competing hypotheses.

Imbue open-sourced Catalyst on July 20, giving researchers an open-source system that preserves competing hypotheses while agents run experiments, evaluate results and search for better solutions. Imbue resurfaced the work in an August 7 thread that pointed back to the July release instead of announcing a new version.

Imbue en X

Catalyst addresses a problem central to Josh Albrecht and Kanjun Qiu: an AI agent can produce useful work while remaining difficult for its user to inspect, redirect or trust. Qiu studied computer science at MIT, worked at the MIT Media Lab and became Dropbox's chief of staff before founding the Y Combinator-backed recruiting software maker Sourceress. Albrecht was an early Addepar engineer, founded an acquired 3D injection-molding software business and built Sourceress with Qiu. They founded Imbue in 2021 around the idea that AI tools should remain open, modifiable and under their users' control.

That origin matters for Catalyst. The system does not ask researchers to trust a single agent's chain of reasoning. It maintains a population of interpretations, runs candidate experiments, branches into alternative explanations and gives more resources to the approaches that score well. The code is available under the AGPL-3.0 license, so researchers can inspect and modify the machinery orchestrating the agents.

Evolución como escape de la visión de túnel de los agentes

En el lanzamiento de la investigación, Daniel Mewes (@danielmewes) describió un modo recurrente de falla en agentes de investigación lineales. Una vez que un agente decide que sus ideas principales están agotadas, puede probar repetidamente pequeñas variaciones en lugar de reconsiderar la premisa que lo llevó al callejón sin salida. Imbue llama a ese comportamiento resultante "colapso de hipótesis".

Catalyst intenta prevenir ese colapso mediante "hilos de interpretación". Cada hilo contiene la explicación de trabajo de un agente sobre la evidencia y una hoja de ruta de experimentos que considera prometedores. Catalyst muestrea entre esos hilos, pide a los agentes que propongan experimentos y ejecuta las propuestas que se juzgan más propensas a avanzar la investigación.

Periódicamente, Catalyst consolida las observaciones en teorías actualizadas. Algunas teorías se bifurcan hacia interpretaciones deliberadamente diferentes. Los hilos candidatos luego reciben puntuaciones basadas en el desempeño de las soluciones que generan y la novedad de las rutas de investigación que proponen. Agentes de revisión separados buscan hacking de recompensas, violaciones de especificaciones y evidencia de que un resultado propuesto falla ante su verificador.

El enfoque usa agentes basados en modelos de lenguaje familiares como componentes. La contribución de Catalyst es el proceso de búsqueda y evaluación que los rodea. Su repositorio soporta Claude Code, Gemini CLI, Antigravity CLI y Codex CLI, con los usuarios proporcionando su propio acceso a modelos y pagando a los proveedores directamente.

El resultado de nanochat viene con un alcance limitado

Imbue demostró Catalyst en nanochat, el proyecto pequeño de entrenamiento de transformadores usado por AutoResearch de Andrej Karpathy. Karpathy, que se unió a Anthropic a principios de 2026, diseñó AutoResearch alrededor de un agente de codificación que cambia repetidamente una configuración de entrenamiento y conserva las modificaciones que mejoran el resultado medido.

La prueba dio a cada experimento cinco minutos en una GPU H100. Los agentes podían modificar la arquitectura de nanochat, la receta de entrenamiento y los hiperparámetros, mientras un verificador medía el desempeño de validación en bits por byte. Imbue dice que el flujo de trabajo evolutivo de Catalyst alcanzó una puntuación val_bpb de 0.9361 después de 340 experimentos y no se había estancado cuando se detuvo la ejecución.

Imbue describe la mejora como tres veces mayor que la de un agente AutoResearch regular. Esa cifra proviene de una sola configuración de optimización de nanochat, en lugar de un benchmark que abarque diferentes modelos o problemas de investigación. Imbue también comparó Catalyst con el trabajo de Recursive Superintelligence, aunque la comparación requirió estimar el número de experimentos de Recursive a partir del tiempo de reloj. Recursive cambió de una H100 a una B200 durante su ejecución, y Imbue usó solo la porción con H100. Imbue reconoce que Recursive pudo haber alcanzado puntuaciones comparables de manera más eficiente.

Esas salvedades limitan la afirmación a algo útil y defendible: la búsqueda evolutiva siguió encontrando mejoras después de que los agentes lineales probados se estancaron. El resultado no establece que Catalyst supere a otros sistemas de investigación en todos los dominios científicos.

El código abierto deja una factura de cómputo sustancial

Catalyst es más adecuado para preguntas cuyas respuestas pueden probarse mediante código. Su repositorio recomienda objetivos de optimización estrechos, fenómenos computacionales reproducibles y scripts de verificación explícitos. Imbue dice que la implementación actual es poco adecuada para experimentos físicos, objetivos poco especificados, proyectos de ingeniería general y problemas más allá de las capacidades del modelo subyacente.

El repositorio de Catalyst establece un límite predeterminado de 30 minutos para un solo experimento, aunque los usuarios pueden cambiarlo, y dice que los flujos de trabajo evolutivos frecuentemente invocan más de 100 subagentes. Su tabla de costos estima que una ejecución de evolución Develop Theory cuesta alrededor de $200 con Gemini 3.5 Flash o $1,000 con Claude Opus 4.8. Estima una ejecución de evolución Solve Verifiable Goal en aproximadamente $500 con Claude Opus 4.8. Imbue también dice que la revisión y la puntuación consumen aproximadamente el 65% de los tokens en un flujo de trabajo típico de Develop Theory. Estas estimaciones de API excluyen el cómputo usado para ejecutar los experimentos.

Esa asignación muestra dónde Qiu y Albrecht están apostando. Mejores agentes de investigación requerirán gastar gran parte del presupuesto desafiando, clasificando y revisando ideas en lugar de generar una sola respuesta pulida. La verificación se convierte en parte del flujo de trabajo central en lugar de una comprobación final realizada después de que el agente termina.

El flujo de trabajo teórico más ambicioso de Catalyst sigue el mismo principio. En un experimento acompañante, Imbue usó poblaciones de explicaciones candidatas, revisores adversariales e intentos de falsificación para estudiar un fenómeno de entrenamiento de redes neuronales. Imbue advierte que la alucinación, la falsificación de datos, las citas faltantes y el hacking de recompensas siguen sin resolverse. Los investigadores humanos aún tienen que supervisar el trabajo y verificar sus conclusiones.

Catalyst sigue el reinicio de Imbue en 2026

Catalyst también refleja un cambio organizacional dentro de Imbue. En un relato del reinicio del 30 de enero, Albrecht escribió que él y Qiu se habían desilusionado después de empujar a Imbue a través de una carrera intensa para lanzar Sculptor, su entorno de codificación paralelo. Dijo que querían que Imbue se orientara hacia proyectos más pequeños construidos en abierto, con propietarios individuales de proyecto que tuvieran amplio control sobre lo que entregaban.

Catalyst concreta ese plan. Es un proyecto de investigación inspeccionable con colaboradores nombrados, experimentos reproducibles y una invitación para que investigadores externos contribuyan plantillas. El repositorio de Catalyst nombra a Daniel Mewes, Catherine Kim y Evan Ryan Gunter como colaboradores.

Imbue cuenta con la financiación para perseguir ese modelo sin convertir cada lanzamiento inmediatamente en un producto de pago. En 2023, Imbue anunció una Serie B de $200 millones con una valoración superior a $1,000 millones, con participación de Astera Institute, Nvidia, el cofundador de Cruise Kyle Vogt, el cofundador de Notion Simon Last y otros inversionistas. Imbue más tarde añadió $12 millones del Alexa Fund de Amazon y de Eric Schmidt.

Catalyst es un lanzamiento técnicamente estrecho en relación con esa base de capital. Su importancia radica en el modelo operativo que Qiu y Albrecht están probando: software de investigación abierto que permite a los humanos especificar el objetivo, inspeccionar el proceso de búsqueda y desafiar las conclusiones del agente. El resultado de nanochat da a esa tesis un punto de dato inicial. Un uso de investigación más amplio determinará si las hipótesis competidoras pueden ayudar a los agentes a producir descubrimientos que sobrevivan al escrutinio fuera de una tarea de optimización controlada.

Reader comments

Conversation for this story loads after sign-in.