Gradio nombra tres aplicaciones de modelos pequeños como ganadoras del premio OpenAI Codex

Tiny Narrator se llevó $5,000, seguido por Blood Test Explainer y Uta Sensei en un hackatón con un tope de 32 mil millones de parámetros.

By · Published

Primary source: Gradio on X

Why it matters

The winners show coding agents and local models converging into a practical build stack: small teams can ship private, inspectable AI tools without relying on a large hosted model for every user request.

Gradio names three small-model apps as OpenAI Codex prize winners — Tiny Narrator took $5,000, followed by Blood Test Explainer and Uta Sensei in a hackathon capped at 32 billion parameters.

Gradio nombró tres aplicaciones basadas en modelos pequeños como ganadoras del premio Codex de $10,000 de OpenAI en su hackathon Build Small, encabezadas por una herramienta de accesibilidad que usa modelos compactos de visión, lenguaje y voz para narrar contenido web.

El framework propiedad de Hugging Face anunció los resultados en un hilo de cinco publicaciones en X el 3 de agosto. Gradio otorgó $5,000 a Tiny Narrator, $3,000 a Blood Test Explainer y $2,000 a Uta Sensei.

Gradio surgió a partir de un problema que el cofundador Abubakar Abid encontró cuando era estudiante de doctorado en ingeniería eléctrica en Stanford. Abid quería que un médico que colaboraba en un proyecto de visión por computadora médica pudiera probar un modelo sin instalar Python, lo que lo llevó a construir una interfaz de navegador para demostraciones de machine learning. Reclutó a Ali Abdalla, Ali Abid y Dawood Khan para lanzar Gradio en 2019. Hugging Face adquirió Gradio en diciembre de 2021, después de que los usuarios hubieran creado más de 300,000 demostraciones con el framework, según el anuncio de Abid en ese momento.

Tres aplicaciones construidas alrededor de modelos más pequeños

Tiny Narrator, enviado por el usuario de GitHub cvpfus, ganó el primer lugar con un prototipo de lector de pantalla que combina componentes de lenguaje, visión y texto a voz. Su repositorio público identifica un modelo Nemotron de 3.97 mil millones de parámetros como su principal "cerebro lector", MiniCPM-V 4.6 para descripciones de imágenes y el modelo Kokoro de 82 millones de parámetros para voz.

La interfaz construye una cola de lectura a partir de encabezados de artículos, párrafos e imágenes. Los usuarios pueden navegar con comandos de teclado, solicitar resúmenes y revisar una transcripción de la narración generada. El código también incluye descripciones de respaldo determinísticas diseñadas para mantener el lector usable cuando un endpoint del modelo no está disponible. El repositorio de Tiny Narrator tenía una estrella en GitHub y sin forks cuando se revisó el 3 de agosto, lo que indica que el premio refleja el juicio del hackathon más que una adopción establecida.

El segundo lugar, Blood Test Explainer, fue construido por Roman Dolgopolyi y Dimitris Kalligaridis, investigadores asociados con el Deree AI Lab del American College of Greece. Los usuarios suben un PDF o imagen de un examen de sangre, que la aplicación procesa con MiniCPM-V 4.6 antes de convertir los marcadores extraídos y los rangos de referencia en JSON estructurado. Una base de conocimientos curada suministra luego explicaciones en lenguaje llano.

Los creadores dicen que el repositorio de Blood Test Explainer no contiene llamadas de inferencia externas en la ruta del producto, manteniendo los datos de salud subidos dentro del Space o en la máquina local que ejecuta el modelo. Su propia evaluación también expuso los límites del fine-tuning estrecho: una corrida de entrenamiento temprana enfocada en el esquema hizo que el F1 a nivel de campo bajara de 0.655 a 0.078. Un fine-tune posterior usando 100 ejemplos de razonamiento médico alcanzó 0.746, según los resultados publicados por los desarrolladores. El repositorio advierte que la aplicación es educativa, puede interpretar mal escaneos ruidosos y no debe sustituir a un clínico.

Uta Sensei, construido por un desarrollador que publica como @odincode, recibió el tercer lugar. El repositorio de Uta Sensei describe un tutor de idioma japonés que convierte letras de canciones en lecciones que contienen furigana, vocabulario, notas de gramática y sesiones de preguntas y respuestas fundamentadas. Los usuarios pueden exportar los resultados como archivos de lección, Markdown o barajas de vocabulario para Anki.

Uta Sensei ejecuta el modelo Tiny Aya Global de 3.35 mil millones de parámetros mediante llama.cpp, con la versión pública alojada en una instancia CPU básica. El desarrollador probó un adaptador fine-tuned durante el hackathon y luego lanzó el modelo estándar después de que funcionara mejor en un benchmark de lecciones fijo.

Codex fue evaluado como parte del proceso de desarrollo

La Guía de campo de Build Small exigía que cada modelo participante se mantuviera por debajo de 32 mil millones de parámetros y que cada envío se entregara como una app de Gradio. La competencia publicitó un bote de $48,000 en efectivo, 29 categorías de premios, 20,000 créditos de Modal y dos GPUs Nvidia RTX 5080.

La categoría de OpenAI requería commits atribuidos a Codex en un repositorio de GitHub conectado o en un Hugging Face Space. Las reglas indicaban que los jueces valorarían más el uso extensivo de Codex en tareas como fine-tuning de modelos y desarrollo de agentes que la asistencia de codificación más ligera. Los creadores de Blood Test Explainer dijeron que usaron Codex para gestionar commits y pull requests mientras cambiaban la arquitectura del modelo. El autor de Uta Sensei acreditó a Codex en la implementación, pruebas, desarrollo del frontend, evaluación y depuración.

Los pagos finales de Gradio también resolvieron una inconsistencia en la tabla de premios publicada. La guía de campo lista $5,000 para el primer lugar, $3,000 para el segundo y $1,000 para el tercero, aunque describe el fondo de Codex como un total de $10,000. El anuncio de Gradio del 3 de agosto asignó $2,000 a Uta Sensei, llevando los tres premios al total indicado.

Las aplicaciones ganadoras comparten una elección técnica común: cada una coloca un modelo pequeño cerca del usuario y mantiene las funciones centrales inspeccionables mediante código público. Codex se sitúa una capa antes en esa pila, ayudando a desarrolladores individuales a producir y revisar el software alrededor de esos modelos bajo un plazo.

Reader comments

Conversation for this story loads after sign-in.