Fermion Research 发布了用于本地推理的 3.88 GB Neutrino-1 8B
该基于 Qwen3 的模型使用 Fermion 的打包三值族权重格式,将 81.9 亿个参数打包在一个 3.88 GB 的容器中。
By Ryan Merket · Published
Primary source: Fermion Research
Why it matters
Fermion is testing whether model-runtime co-design can make 8B inference routine on commodity laptops and 8 GB GPUs.

Fermion Research 已发布 Neutrino-1 8B,将一个 81.9 亿参数的语言模型打包为一个 3.88 GB 的文件。Hugging Face 的模型卡 将该制品列为 FermionResearch/Neutrino-8B;可用清单未确定具体的发布日期。Fermion 表示该模型连同其注意力缓存可在 8 GB GPU 或 16 GB 笔记本上共同驻留,为开发者提供一个制品,而不是为每类硬件分别导出。 (fermionresearch.com)
该发布是 Fermion 对“通过模型与运行时协同设计赢得本地 AI”这一判断的下注。Neutrino 的权重在存储时保持打包状态,并在矩阵内核中解码,从而减少硬件为每个生成的 token 必须移动的数据量。Fermion 围绕该格式构建了推理引擎、自定义 Metal 内核和一个 公开的 llama.cpp 分支,而不是将部署视为下游的打包工作。 (fermionresearch.com)
字节就是产品
Neutrino-1 8B 在其 36 层 transformer 中的全部 252 个线性投影上使用了一种专有的三值族格式。这 69.5 亿个编码投影权重占用了 2.60 GB,即文件的 67.2%。两个未绑定的 int8 嵌入表又占用了 1.24 GB,这意味着 Neutrino 的近三分之一占用来自其 151,936 词元的词表,而不是 transformer 模块。 (fermionresearch.com)
Fermion 报告称 62.63% 的编码权重为零,其余则在正负状态之间几乎平均分布。Fermion 表示,该格式在线性权重的存储上只需 fp16 的八分之一。其 2.56 GB 的下载包可无损展开为每个运行时执行的 3,875,404,812 字节容器。 (fermionresearch.com)
这一差别很重要,因为单用户生成经常遇到内存带宽限制。生成每个新 token 都需要处理器在内存中移动模型的大量数据。减少移动的字节数可以在不改变底层内存系统的情况下提高解码速度。
上下文仍然带来增长的成本。Neutrino 的分组查询注意力使用每个 token 144 KiB 的 fp16 KV 缓存,在 4,096 token 时大约增加 0.60 GB,在 32,768 token 时增加 4.83 GB。完整的 40,960 token 窗口会使模型与缓存的驻留总量接近但不到 10 GB。 (fermionresearch.com)
Qwen3 是起点
Neutrino-1 8B 源自 Alibaba 的 Qwen3-8B,而非 Fermion 从零预训练的基础模型。Qwen3 提供了 36 层的架构、宽度为 4,096 的隐藏状态、分组查询注意力和分词器。Alibaba 以 Apache 2.0 许可证发布了 Qwen3-8B。 (huggingface.co)
最终的制品将源自 Qwen3 的架构与 Fermion 的打包存储格式和平台特定运行时结合在一起。Fermion 的公开资料记录了随附容器及其执行路径。 (fermionresearch.com)
一个模型,多个执行路径
Fermion 列出了 Neutrino 的三种分发途径。其 Python package 会下载模型和适用于 macOS arm64 或 Linux x86-64 的本地二进制文件。一个 GGUF 构建通过 Fermion 的 llama.cpp 分支在具有 CUDA 支持的情况下运行。一个 MLX 包在 Apple silicon 上使用自定义 Metal 内核。Fermion 表示这三者都执行来自同一容器派生的权重。 (fermionresearch.com)
Fermion 报告称,在 Nvidia H100 上进行纯单流贪心解码时为 396 token/s,在 Nvidia L4 上为 30.7 token/s,通过 MLX 在一台基础款 M5 MacBook 上为 33.7 token/s,使用九个 CPU 线程在 Apple M5 上为 24.9 token/s。L4 配置在 4,096 token 的上下文长度下使用了 4.68 GiB 的内存。这些是 Fermion 在出货制品上的测量结果。 (fermionresearch.com)
拥挤的低比特竞赛
Fermion 加入了一项使三值模型实用化的积极努力。Microsoft Research 的 BitNet b1.58 2B4T 展示了一个参数量约为 20 亿的原生训练三值模型,并配套开源的 bitnet.cpp 运行时。Microsoft 将部署权重描述为 1.58 位,激活为 8 位。 (huggingface.co)
PrismML 的 Ternary Bonsai 系列包含一个 80 亿参数的模型,并通过 MLX 面向 Apple 设备。PrismML 表示 Ternary Bonsai 8B 大约是 1.75 GB,在 M4 Pro 上达到 82 token/s,尽管硬件、运行时、架构和基准协议的差异使其无法与 Fermion 的 M5 结果直接比较。 (prismml.com)
Fermion 的差异化在于围绕 Neutrino 的交付系统:一个源自 Qwen3 的 8B 模型、多个内核后端以及一个旨在它们之间通行的容器。独立测试将决定 Fermion 报告的质量和吞吐量测量是否能在普通工作负载中成立。