Fermion Researchがローカル推論用の3.88 GBのNeutrino-1 8Bを公開
Qwen3-derivedモデルは、Fermionのpacked ternary-family weight formatを使用して、8.19 billionのパラメータを3.88 GBのコンテナにパッケージしています。
By Ryan Merket · Published
Primary source: Fermion Research
Why it matters
Fermion is testing whether model-runtime co-design can make 8B inference routine on commodity laptops and 8 GB GPUs.

Fermion ResearchはNeutrino-1 8Bを公開し、約81億9,000万パラメータの言語モデルを3.88 GBのファイルにパッケージ化した。Hugging Faceのモデルカードには成果物がFermionResearch/Neutrino-8Bとして記載されているが、公開時期は明示されていない。Fermionによれば、このモデルはattentionキャッシュと合わせて8 GBのGPUまたは16 GBのラップトップ上に収まり、ハードウェアごとに別個にエクスポートするのではなく、開発者に一つの成果物を提供するという。 (fermionresearch.com)
このリリースは、ローカルAIの勝敗はモデルとランタイムの共同設計で決まるというFermionの賭けだ。Neutrinoの重みは保存時にパックされたままで、行列カーネル内でデコードされるため、生成される各トークンごとにハードウェアが移動させるデータ量を削減する。Fermionは展開を下流のパッケージ作業として扱うのではなく、そのフォーマットの周りに推論エンジン、カスタムMetalカーネル、およびpublic llama.cpp forkを構築した。 (fermionresearch.com)
バイトそのものが製品
Neutrino-1 8Bは、36層のトランスフォーマーレイヤー全体にわたる252の線形射影すべてに対して、独自の三値系フォーマットを使用している。これら6.95十億の符号化された射影重みはファイルの2.60 GB、すなわち67.2%を占める。結合されていない2つのint8埋め込みテーブルがさらに1.24 GBを消費しており、これはNeutrinoのフットプリントのほぼ3分の1がトランスフォーマーブロックではなく151,936トークンの語彙から来ていることを意味する。 (fermionresearch.com)
Fermionは、符号化された重みの62.63%がゼロであり、残りはほぼ等分に正と負の状態に分かれていると報告している。Fermionによればこのフォーマットは線形重みでfp16の保管量の8分の1を使用するという。ダウンロードサイズ2.56 GBはロスレスで展開され、各ランタイムが実行する3,875,404,812バイトのコンテナになる。 (fermionresearch.com)
この区別は重要だ。なぜなら単一ユーザーの生成はしばしばメモリ帯域幅の限界に直面するからだ。新しいトークンごとにプロセッサはモデルの大部分をメモリを通して移動させる必要がある。移動するバイト数を削減することで、基礎となるメモリシステムを変えずにデコード速度を向上させることができる。
ただしコンテキストのコストは依然として増大する。Neutrinoのgrouped-query attentionはトークンあたり144 KiBのfp16 KVキャッシュを使用し、4,096トークンで約0.60 GB、32,768トークンで4.83 GBを追加する。フルの40,960トークン窓ではモデルとキャッシュの常駐でほぼ10 GBに達する。 (fermionresearch.com)
Qwen3が出発点
Neutrino-1 8BはFermion自身がスクラッチから事前学習した基盤モデルではなく、AlibabaのQwen3-8Bに由来している。Qwen3は36層のアーキテクチャ、4,096幅の隠れ状態、grouped-query attention、およびトークナイザを提供する。AlibabaはQwen3-8BをApache 2.0で公開した。 (huggingface.co)
結果として得られた成果物は、Qwen3由来のアーキテクチャとFermionのパック済みストレージフォーマットおよびプラットフォーム固有のランタイムを組み合わせたものだ。Fermionの公開資料は出荷されるコンテナとその実行経路を文書化している。 (fermionresearch.com)
1つのモデル、複数の実行経路
FermionはNeutrinoの配布経路を3つ挙げている。彼らのPythonパッケージはモデルとmacOS arm64またはLinux x86-64向けのネイティブバイナリをダウンロードする。GGUFビルドはCUDAサポート付きのFermionのllama.cppフォークを通して実行される。MLXパッケージはApple silicon上でカスタムMetalカーネルを使用する。Fermionによれば、これら3つはいずれも同じコンテナから派生した重みを実行するという。 (fermionresearch.com)
Fermionは、Nvidia H100での単純な単一ストリーム貪欲デコーディングで396トークン/秒、Nvidia L4で30.7トークン/秒、ベースのM5 MacBook上のMLXで33.7トークン/秒、Apple M5上の9スレッドCPUで24.9トークン/秒を報告している。L4構成は4,096トークンのコンテキスト長で4.68 GiBのメモリを使用した。これらは出荷中の成果物に対するFermionの計測値である。 (fermionresearch.com)
混戦する低ビット競争
Fermionは三値モデルを実用化しようとする活発な取り組みに参入している。Microsoft ResearchのBitNet b1.58 2B4Tは約20億パラメータのネイティブ訓練された三値モデルを示し、オープンソースのbitnet.cppランタイムと組み合わせられている。Microsoftは展開重みを1.58ビット、活性化を8ビットと説明している。 (huggingface.co)
PrismMLのTernary Bonsaiファミリーには8十億パラメータのモデルが含まれ、MLXを通じてAppleデバイスをターゲットにしている。PrismMLはTernary Bonsai 8Bが約1.75 GBで、M4 Proで82トークン/秒に達すると述べているが、ハードウェア、ランタイム、アーキテクチャ、ベンチマークプロトコルの違いによりFermionのM5結果と直接比較することはできない。 (prismml.com)
Fermionの差別化要因はNeutrinoの周りのデリバリシステムだ:Qwen3由来の8Bモデル、複数のカーネルバックエンド、そしてそれらの間を移動することを想定した一つのコンテナ。独立したテストが、Fermionの品質とスループットの計測が一般的なワークロードで維持されるかを判断するだろう。