Fermion Research publica 3.88 GB Neutrino-1 8B para inferencia local

El modelo derivado de Qwen3 empaqueta 8,19 mil millones de parámetros en un contenedor de 3,88 GB utilizando el formato de pesos empaquetados de la familia ternaria de Fermion.

By · Published

Primary source: Fermion Research

Why it matters

Fermion is testing whether model-runtime co-design can make 8B inference routine on commodity laptops and 8 GB GPUs.

Illustration of Fermion Research's Neutrino-1 8B shown as a compact integrated system representing its 3.88 GB container for local inference on consumer hardware.

Fermion Research ha publicado Neutrino-1 8B, empaquetando un modelo de lenguaje de 8.19 mil millones de parámetros en un archivo de 3.88 GB. Hugging Face's model card lista el artefacto como FermionResearch/Neutrino-8B; el listado disponible no establece una fecha de lanzamiento específica. Fermion afirma que el modelo cabe junto con su caché de atención en una GPU de 8 GB o en una laptop de 16 GB, ofreciendo a los desarrolladores un solo artefacto en lugar de exportaciones separadas para cada clase de hardware. (fermionresearch.com)

El lanzamiento es la apuesta de Fermion a que la IA local se ganará mediante el codiseño de modelo y runtime. Los pesos de Neutrino permanecen empaquetados mientras se almacenan y se decodifican dentro de los kernels de matriz, reduciendo la cantidad de datos que el hardware debe mover por cada token generado. Fermion construyó un motor de inferencia, kernels personalizados para Metal y una bifurcación pública de llama.cpp en torno a ese formato en vez de tratar el despliegue como un trabajo de empaquetado posterior. (fermionresearch.com)

Los bytes son el producto

Neutrino-1 8B utiliza un formato propietario de la familia ternaria para las 252 proyecciones lineales a lo largo de sus 36 capas transformer. Esos 6.95 mil millones de pesos de proyección codificados representan 2.60 GB, o el 67.2%, del archivo. Dos tablas de embeddings int8 no ligadas consumen otros 1.24 GB, lo que significa que casi un tercio de la huella de Neutrino proviene de su vocabulario de 151,936 tokens en lugar de los bloques transformer. (fermionresearch.com)

Fermion informa que el 62.63% de los pesos codificados son cero, con el resto dividido casi por igual entre estados positivos y negativos. Según Fermion, el formato usa una octava parte del almacenamiento de fp16 para los pesos lineales. Su descarga de 2.56 GB se expande sin pérdida al contenedor de 3,875,404,812 bytes ejecutado por cada runtime. (fermionresearch.com)

Esa distinción importa porque la generación para un solo usuario con frecuencia choca con los límites de ancho de banda de memoria. Cada nuevo token requiere que el procesador mueva gran parte del modelo a través de la memoria. Reducir los bytes movidos puede aumentar la velocidad de decodificación sin cambiar el sistema de memoria subyacente.

El contexto aún acarrea un costo creciente. La atención de consultas agrupadas de Neutrino usa un caché KV en fp16 de 144 KiB por token, sumando aproximadamente 0.60 GB a 4,096 tokens y 4.83 GB a 32,768 tokens. La ventana completa de 40,960 tokens eleva la residencia del modelo y la caché a poco menos de 10 GB. (fermionresearch.com)

Qwen3 es el punto de partida

Neutrino-1 8B se deriva de Qwen3-8B de Alibaba, en lugar de ser un modelo base preentrenado desde cero por Fermion. Qwen3 aporta la arquitectura de 36 capas, el estado oculto de ancho 4,096, la atención de consultas agrupadas y el tokenizador. Alibaba lanzó Qwen3-8B bajo Apache 2.0. (huggingface.co)

El artefacto resultante combina la arquitectura derivada de Qwen3 con el formato de almacenamiento empaquetado de Fermion y los runtimes específicos de la plataforma. Los materiales públicos de Fermion documentan el contenedor distribuido y sus rutas de ejecución. (fermionresearch.com)

Un modelo, varias rutas de ejecución

Fermion enumera tres vías de distribución para Neutrino. Su Python package descarga el modelo y un binario nativo para macOS arm64 o Linux x86-64. Un build GGUF se ejecuta mediante la bifurcación de llama.cpp de Fermion con soporte CUDA. Un paquete MLX usa kernels personalizados de Metal en Apple silicon. Fermion dice que los tres ejecutan pesos derivados del mismo contenedor. (fermionresearch.com)

Fermion reporta 396 tokens por segundo para decodificación codiciosa de flujo único simple en una Nvidia H100, 30.7 tokens por segundo en una Nvidia L4, 33.7 tokens por segundo mediante MLX en una MacBook base M5 y 24.9 tokens por segundo usando nueve hilos de CPU en una Apple M5. La configuración L4 usó 4.68 GiB de memoria con una longitud de contexto de 4,096 tokens. Estas son las mediciones de Fermion sobre el artefacto distribuido. (fermionresearch.com)

Una carrera concurrida por los modelos de bajo bit

Fermion entra en un esfuerzo activo por hacer prácticos los modelos ternarios. Microsoft Research's BitNet b1.58 2B4T demostró un modelo ternario entrenado de forma nativa de aproximadamente 2 mil millones de parámetros, emparejado con el runtime de código abierto bitnet.cpp. Microsoft describe los pesos de despliegue como de 1.58-bit, con activaciones de 8 bits. (huggingface.co)

PrismML's Ternary Bonsai incluye en su familia un modelo de 8 mil millones de parámetros y apunta a dispositivos Apple a través de MLX. PrismML dice que Ternary Bonsai 8B tiene alrededor de 1.75 GB y alcanza 82 tokens por segundo en una M4 Pro, aunque las diferencias en hardware, runtime, arquitectura y protocolo de benchmark impiden una comparación directa con los resultados de Fermion en M5. (prismml.com)

El diferenciador de Fermion es el sistema de entrega alrededor de Neutrino: un modelo 8B derivado de Qwen3, múltiples backends de kernel y un contenedor pensado para viajar entre ellos. Pruebas independientes determinarán si las mediciones de calidad y rendimiento de Fermion se mantienen en cargas de trabajo ordinarias.

Reader comments

Conversation for this story loads after sign-in.