Pipe Network publica una compilación Kimi K3 de 350 GB para Mac Studios de 512 GB

El modelo MLX podado cabe en la memoria unificada, pero Pipe informa 0.20 tokens por segundo y advierte que la calidad se degrada.

By · Published

Primary source: Pipe Network on X

Why it matters

Pipe made a 1.56TB frontier model loadable on one high-memory Mac, exposing the harder constraint behind open weights: usable local inference still demands severe compromises.

A pruned AI model struggling to fit into limited unified memory, with degraded performance and quality. (Embroidered textile patch — visible thread stitches, layered felt panels, slightly puffy dimensional fabric with raw edges.)

David Rhodus (@DavidRhodus) and Pipe Network han publicado un port de Apple MLX que reduce el K3 de Moonshot AI de 2.8 billones de parámetros Kimi de aproximadamente 1.56TB en disco a tan solo 350GB, permitiendo que una versión fuertemente podada del modelo se cargue en un Mac Studio con 512GB de memoria unificada.

Pipe anunció el lanzamiento en un hilo en X el 28 de julio, un día después de que Moonshot publicara los pesos y el informe técnico de Kimi K3. El repositorio de GitHub incluye una implementación MLX, un convertidor de puntos de control por streaming, herramientas de calibración y scripts para podar la arquitectura mixture-of-experts de K3. Pipe también subió tres puntos de control convertidos a Hugging Face.

El lanzamiento es un proyecto de ingeniería de sistemas más que un chatbot local práctico. La compilación publicada más rápida de Pipe genera alrededor de 0.20 tokens por segundo, o un token cada cinco segundos. Sus variantes más grandes funcionan entre 0.14 y 0.16 tokens por segundo. Pipe describe las tres como no interactivas y dice que la poda causa degradación visible, incluyendo salidas repetitivas y respuestas que se alejan del prompt.

Reduciendo 896 expertos a 179

Kimi K3 es un modelo mixture-of-experts con 2.8 billones de parámetros en total y 104 mil millones de parámetros activos. La arquitectura de Moonshot contiene 896 expertos enrutados, seleccionando 16 para cada token, junto con dos expertos compartidos. También combina soporte de imagen nativo con una ventana de contexto de aproximadamente 1 millón de tokens, según el informe técnico de Moonshot.

El punto de control más pequeño de Pipe conserva 179 de esos 896 expertos enrutados, una reducción del 80%. La compilación resultante REAP80 ocupa 350GB. Una versión de 451GB retiene 242 expertos, mientras que un segundo punto de control de 451GB usa un conjunto de calibración ponderado hacia contenido en chino y código de programación.

El convertidor procesa K3 de forma incremental porque cargar el punto de control completo durante la conversión excedería la memoria disponible en un Mac. Pipe dice que la representación BF16 sin comprimir ocuparía alrededor de 5.6TB. Los expertos enrutados de K3 ya usan la codificación MXFP4 de Moonshot, que MLX puede preservar sin otra pasada de cuantización con pérdida. Por lo tanto, la mayor parte de la reducción de tamaño proviene de eliminar expertos más que de comprimir los que sobreviven.

Ese compromiso es sustancial. La ficha del modelo de 451GB indica que el punto de control se cargó en un M3 Ultra de 512 GiB en 66 segundos y produjo muestras de código, en inglés y en chino a aproximadamente 0.16 tokens por segundo. Pipe advierte que la poda puede generar continuaciones similares a listas, repeticiones y un rendimiento general del lenguaje más débil, incluso cuando la finalización de código sigue siendo estructuralmente coherente.

La documentación de Pipe también se contradice a sí misma. Las tarjetas individuales de Hugging Face reportan generación exitosa y velocidades medidas en un M3 Ultra de 512 GiB. Una sección separada titulada "Reality check" en el README de GitHub dice que ningún nivel publicado corre en una sola máquina Apple Silicon y que los artefactos nunca han producido un token. En otra parte del mismo README, Pipe vuelve a listar las compilaciones de 350GB y 451GB con rendimiento medido. Las tarjetas de Hugging Face contienen la configuración de prueba y las muestras de salida más específicas, pero la contradicción hace que la reproducción independiente sea esencial.

Rhodus dirige una empresa CDN hacia la infraestructura de IA

Rhodus construyó Pipe a través de Permissionless Labs, que ahora se describe como un laboratorio de infraestructura de IA que ofrece inferencia, almacenamiento y ajuste fino. Esa posición representa una expansión notable respecto al planteamiento original de Pipe como una red de entrega de contenido descentralizada que usa nodos operados de forma independiente para acercar los datos a los usuarios.

Rhodus pasó aproximadamente dos décadas en streaming e infraestructura de datos antes de fundar Pipe. Fue CTO de Volar Video y empleado temprano en Elemental Technologies, el proveedor de infraestructura de video adquirido por Amazon Web Services. Más tarde trabajó en ConsenSys, según el relato de Multicoin Capital sobre su inversión.

En septiembre de 2024, Permissionless Labs recaudó una Serie A de 10 millones de dólares liderada por Multicoin, con la participación de Robot Ventures, Solana Ventures, el cofundador de Solana Anatoly Yakovenko y Meltem Demirors. En ese momento, la financiación se presentó como capital para expandir la red CDN de Pipe, reclutar ingenieros y lanzar su testnet.

El port de Kimi muestra a Rhodus aplicando la misma apuesta subyacente a la IA: los modelos grandes se están volviendo descargables, mientras que mover, almacenar y servir sus pesos sigue siendo un problema de infraestructura. Reducir K3 para que quepa dentro de la configuración de memoria unificada más grande de Apple cruza un umbral técnico. A 0.20 tokens por segundo y con la mayoría de los expertos enrutados removidos, sigue siendo un experimento para desarrolladores dispuestos a sacrificar velocidad y calidad del modelo a cambio de control sobre la máquina que lo ejecuta.

Reader comments

Conversation for this story loads after sign-in.