El reto de agente de Eigen Labs acelera Poolside's Laguna en Macs en un 138.7%.

MLX.fast convierte cada mejora verificada de inferencia en la siguiente línea base, extendiendo el sistema de investigación abierta de Eigen más allá de la criptografía cuántica.

By · Published

Primary source: X

Why it matters

MLX.fast turns AI optimization into a public, cumulative process. If the model holds, open-weight developers can recruit outside agents to improve inference after release instead of carrying that work alone.

Eigen Labs' agent challenge speeds Poolside's Laguna by 138.7% on Macs — MLX.fast turns each verified inference improvement into the next baseline, extending Eigen's open research system beyond quantum cryptography.

Gajesh Naik (@gajesh), el ingeniero de investigación principal de Eigen Labs, dijo en un hilo en X el 1 de agosto que una red pública de desarrolladores y agentes de IA había hecho que la inferencia de Laguna XS 2.1 de Poolside fuera 138.7% más rápida en Apple Silicon, cuatro días después de que se abriera el desafío.

El desafío MLX.fast permite a los participantes apuntar agentes al código de inferencia del modelo, enviar optimizaciones y probar cada resultado contra un benchmark compartido. Las mejoras verificadas se convierten en la referencia que los participantes posteriores intentan superar. Una captura de pantalla del leaderboard adjunta a la publicación de Naik mostró 122 envíos promovidos de 30 solucionadores, con la entrada líder alcanzando 184.4 decode tokens por segundo y 5,076.4 prefill tokens por segundo.

MLX.fast leaderboard showing a 138.7% speed improvement for Laguna XS 2.1

El sitio personal de Naik enumera trabajos de ingeniería anteriores en Solana Labs, LayerZero y Telegram Wallet, junto con dos proyectos de startups que construyó cuando era adolescente. Se unió a Eigen Labs en 2023 y ahora trabaja en estrategia e ingeniería para proyectos especiales. Para MLX.fast, está aplicando un sistema que él y otros investigadores de Eigen probaron por primera vez en un problema de computación cuántica estrechamente definido.

De circuitos cuánticos a IA local

En junio, Naik y Gautham Anant (@bbuddha_xyz) usaron agentes de IA y un leaderboard abierto para optimizar circuitos cuánticos destinados a atacar la criptografía de curva elíptica de 256 bits con el algoritmo de Shor. El resultado, el desafío ECDSA.fail, permitió que participantes externos enviaran circuitos que pudieran verificarse por su corrección y clasificarse según sus requisitos de qubits y compuertas.

El fundador de Eigen Labs, Sreeram Kannan (@sreeramkannan), escribió el 2 de junio que el esfuerzo inicial interno utilizó un benchmark de software adaptado del verificador de Google. El benchmark dio a los agentes un objetivo estrecho, retroalimentación inmediata y una forma de descartar cambios que no pasaran la validación.

Esa estructura produjo un resultado que pudo medirse de forma independiente. IEEE Spectrum informó que el esfuerzo público igualó el resultado de circuito retenido por Google en ocho horas y lo superó en aproximadamente 72 horas. Para finales de junio, el mejor circuito enviado era 47.5% más eficiente que el resultado de Google según la métrica producto qubit-Toffoli del desafío.

El experimento siguió a un documento de Google del 30 de marzo que estimaba que el algoritmo de Shor podría romper la criptografía de curva elíptica usada por muchos sistemas de activos digitales con menos recursos cuánticos de los calculados anteriormente. Google divulgó una prueba de conocimiento cero de sus circuitos en lugar de publicar la construcción subyacente, citando preocupaciones de seguridad. Actualmente no existe una computadora cuántica capaz de ejecutar el ataque.

MLX.fast lleva el mismo mecanismo de coordinación a un mercado de ingeniería más inmediato. La velocidad de inferencia determina si un modelo abierto es práctico en el hardware que los desarrolladores ya poseen. Afecta la latencia, el tiempo de ejecución de los agentes y el costo de invocar repetidamente un modelo durante tareas de desarrollo de software.

Poolside abre el ciclo de optimización

Poolside describe Laguna XS 2.1 como un modelo Mixture-of-Experts de 33 mil millones de parámetros que activa 3 mil millones de parámetros por token. El modelo está diseñado para codificación y tareas de agentes de larga ejecución, y Poolside dice que puede correr en un Mac con 36 GB de memoria. Sus pesos están disponibles bajo la licencia OpenMDW-1.1 de Poolside.

El desafío se dirige a la implementación MLX usada para ejecutar Laguna XS 2.1 en Apple Silicon. Eigen Labs dijo que sus agentes internos ya habían producido una mejora de velocidad del 36.8% en las 24 horas previas al lanzamiento público el 28 de julio. El leaderboard mostrado por Naik cuatro días después situó la mejora en 138.7%, equivalente a aproximadamente 2.39 veces el rendimiento original según el benchmark del desafío.

Esa cifra mide una implementación y carga de trabajo de inferencia específicas. No indica que los pesos del modelo de Laguna se hayan vuelto más capaces, ni que cada implementación en Mac observará la misma ganancia. El resultado muestra lo rápido que un objetivo compartido, verificable por máquina, puede convertir trabajo de optimización disperso en progreso acumulativo.

Los cofundadores de Poolside, Eiso Kant y Jason Warner, ya han construido sistemas internos alrededor de la experimentación automatizada. En su lanzamiento de Laguna S 2.1, Poolside describió un ciclo automatizado en el que su modelo optimizó su propio arnés de agentes, reduciendo el tiempo en reloj de pared en 5.2% y las asignaciones de memoria en alrededor de 70%. MLX.fast expone un ciclo similar a ingenieros externos y sus agentes.

Eigen Labs ahora describe su trabajo como la construcción de tecnología de coordinación para humanos y agentes de IA. MLX.fast da a esa estrategia una prueba comercial: si una red abierta puede mejorar la pila de servicio de un modelo abierto más rápido que el desarrollador del modelo o un proveedor de hardware trabajando por su cuenta.

El leaderboard inicial establece que los participantes pueden encontrar ganancias sustanciales en un benchmark acotado. La prueba más difícil llega después de la primera ola de optimizaciones obvias, cuando las mejoras se vuelven más pequeñas y requieren cambios más profundos en kernels, uso de memoria y ejecución del modelo. El valor de la plataforma dependerá de si continúa acumulando mejoras después de que se agoten esas ganancias fáciles.

Reader comments

Conversation for this story loads after sign-in.