Ornith AI lanza modelos abiertos que escriben su propio plan de entrenamiento

La familia de tres modelos extiende el autoandamiaje a la generación de tareas; sus comparaciones en pruebas de referencia provienen de las propias ejecuciones de evaluación de Ornith AI.

By · Published

Primary source: Ornith AI

Why it matters

Ornith AI is betting that models can expand their own training curriculum, reducing dependence on hand-built tasks while making reward design even more consequential.

Exploded technical diagram of Ornith AI's three interconnected self-training models with callout labels and a human figure for scale.

Ornith AI lanzó Ornith-1.5 el 19 de agosto de 2026, llevando su familia de modelos abiertos más allá de generar respuestas y andamiajes hacia generar las propias tareas de entrenamiento. En un anuncio, Ornith AI describe un bucle de aprendizaje por refuerzo que propone problemas más difíciles, construye el arnés utilizado para resolverlos y evaluarlos, y produce las trayectorias de solución que se convierten en sus próximas experiencias de aprendizaje.

El lanzamiento proviene de un grupo de investigación que ha aplicado aprendizaje por refuerzo a problemas con recompensas duras y verificables por máquina. Xiaoya Li, Guoyin Wang, Songqiao Su, Chris Shum y Jiwei Li aparecieron juntos en el artículo GrandCode, que construyó un sistema multiagente para programación competitiva. Varios de los mismos investigadores trabajaron en CUDA-L2, un esfuerzo para optimizar kernels de multiplicación de matrices usando la velocidad de ejecución como recompensa. El grupo de NLP de Stanford lista a Jiwei Li con una afiliación a DeepReinforce.ai.

Esa historia explica la apuesta central detrás de Ornith-1.5. Ornith AI intenta convertir el aprendizaje por refuerzo de un proceso construido alrededor de un conjunto fijo de pruebas en uno que fabrica sus propias pruebas útiles. La senda pública de investigación abarca trabajos con la marca DeepReinforce y repositorios de modelos con la marca Ornith, incluyendo el DeepReinforce Ornith repository. El lanzamiento es publicado por el Ornith Team y promovido a través de @deep_reinforce.

El modelo escribe la tarea

Ornith-1.0, lanzado en junio, aprendió a generar el andamiaje alrededor de una tarea de codificación: las instrucciones, las herramientas, la descomposición y la orquestación que guían a un modelo a través de un trabajo más largo. Ornith-1.5 añade la generación de tareas a ese proceso.

Cada ciclo de entrenamiento comienza con un entorno o base de código, instrucciones generales sobre el tipo de problema deseado y un historial de lo que el modelo ya ha resuelto. Ornith-1.5 propone una tarea más difícil, crea o revisa el arnés específico de la tarea y luego intenta una solución. La recompensa fluye por las tres etapas, dando al modelo retroalimentación sobre la calidad de la pregunta, la configuración de evaluación y la respuesta.

Ornith AI puntúa las tareas generadas según validez, dificultad y novedad. Una tarea propuesta debe ser ejecutable y verificable, situarse cerca de la frontera de capacidad actual del modelo y diferir lo suficiente del trabajo previo para añadir una señal de entrenamiento útil. Ornith AI fija la tasa objetivo de éxito de la solución en 0.2, favoreciendo tareas que el modelo normalmente falla mientras conserva suficientes ejecuciones exitosas para el aprendizaje por refuerzo.

El arnés recibe su propia recompensa por hacer que coincida con la asignación, medir la calidad de la solución con precisión y resistir el hacking de recompensas. Esta es la parte difícil del diseño. Un sistema que escribe tanto el examen como el script de calificación puede crear puntos fáciles para sí mismo mediante pruebas malformadas, atajos ocultos o criterios que recompensan el comportamiento equivocado. El repositorio Ornith-1.0 oficial documenta arneses de benchmark, filtros anti-hacking y configuraciones de recursos, sin fundamentar un protocolo de evaluación más específico que implique eliminación del historial de Git o bloqueo de red.

La etiqueta de auto-mejora describe el procedimiento de entrenamiento. El modelo descargado no se reentrena continuamente en el teléfono o estación de trabajo del usuario. Ornith AI ejecuta el bucle durante el desarrollo del modelo y luego publica los pesos resultantes.

Tres tamaños, tres apuestas de despliegue distintas

Ornith-1.5 llega en una colección de Hugging Face con un modelo mixture-of-experts de 397 mil millones de parámetros, un modelo MoE de 35B que activa 3B de parámetros por token y un modelo denso de 9B. Ornith AI también describe una versión móvil cuantizada del modelo de 9B para despliegue en iPhone y Android.

El lanzamiento de 397B es la apuesta de Ornith AI por la frontera abierta. El modelo de 35B está dirigido a desarrolladores que pueden mantener en memoria un modelo MoE más grande mientras asumen el costo de inferencia de un recuento de parámetros activos menor. El modelo de 9B es el más accesible de los tres: Ornith AI documenta el despliegue local y publica una construcción MLX para hardware Apple.

La estrategia de lanzamiento móvil y local da a los desarrolladores una forma de probar el sistema sin depender de una demostración alojada. Las compensaciones prácticas aún dependen de la cuantización, la memoria disponible, el soporte en tiempo de ejecución y la duración del trabajo.

Para la generación previa, la documentación oficial Ornith-1.0 de Ornith AI enumera puntos de control bf16, FP8 y GGUF bajo la licencia MIT. La ficha del modelo Ornith-1.0-9B indica una huella de aproximadamente 19 GB en bf16 y una ventana de contexto nativa de 262,144 tokens. La documentación oficial de Ornith AI no reclama una extensión RoPE o YaRN de aproximadamente 1 millón de tokens.

Los benchmarks incorporan un arnés

Ornith AI informa que Ornith-1.5-397B obtuvo 86.1 en Terminal-Bench 2.1 usando Terminus-2 y 56.0 en DeepSWE. Ornith AI compara esos resultados con 85.0 y 59.0 para Claude Opus 4.8, 82.7 y 54.4 para DeepSeek-V4-Flash-0731 y 81.0 y 46.2 para GLM-5.2.

En 35B, Ornith AI reporta 68.5 en una corrida de Terminal-Bench 2.1 usando Claude Code y 79.0 en SWE-bench Verified. El modelo de 9B se reporta en 47.0 y 70.6 en las mismas dos evaluaciones.

Esos detalles limitan lo que prueban las cifras principales. Las puntuaciones de codificación agentiva miden un par modelo-arnés, y cambiar el andamiaje puede cambiar materialmente el resultado. Las comparaciones de Ornith AI deben leerse como evaluaciones divulgadas y realizadas por la compañía hasta que los modelos y las configuraciones de arnés sean reproducidos por evaluadores externos.

El repositorio Ornith-1.0 informa varios resultados de benchmark anteriores como promedios de cinco ejecuciones y publica ajustes de muestreo, ventanas de contexto, tiempos de espera, asignaciones de cómputo y arneses de agente. Esas divulgaciones aplican a Ornith-1.0 y no deben tratarse como documentación para las puntuaciones de Ornith-1.5.

El lanzamiento aún ofrece a los desarrolladores algo concreto para probar. Ornith AI publicó los pesos del modelo, instrucciones de servicio y formatos cuantizados en lugar de limitar el acceso a una demo alojada. El repositorio Ornith-1.0 anterior da a los nuevos puntos de control un punto de partida de código abierto ya existente.

La apuesta más grande de Ornith AI

Ornith AI se está construyendo alrededor de una limitación que se ha vuelto más importante a medida que las tareas de entrenamiento escritas por humanos se vuelven caras y los benchmarks familiares pierden poder discriminatorio. Un modelo que pueda identificar sus propias brechas de capacidad y construir ejercicios válidos alrededor de ellas podría producir un currículo que avance tan rápido como el propio modelo.

El punto débil es igualmente claro: las tareas generadas son útiles solo cuando sus entornos de calificación se mantienen fieles, difíciles y resistentes a la explotación. Ornith AI ha convertido esa capa de evaluación en parte del sistema aprendido, imponiendo más responsabilidad en el diseño de las recompensas.

Ornith-1.5 convierte esa tesis de investigación en tres tamaños de modelos descargables. Los pesos abiertos permiten a los desarrolladores inspeccionar el resultado práctico, ejecutar las recetas publicadas y probar si el currículo autogenerado de Ornith AI se transfiere de entornos de referencia a bases de código reales. Esa es la prueba que importa después de que el modelo termina de evaluarse a sí mismo.

Reader comments

Conversation for this story loads after sign-in.