Unslothは、Dynamic 3.0のクオンツが同規模でライバルを10%上回ったと述べている
Daniel and Michael Hanのポストトレーニング・クオンツはローカルAIユーザーをターゲットにしており、その注目すべき向上はUnsloth自身のテストで測定された。
By RuntimeWire Staff · Published
Primary source: Unsloth
Why it matters
The Han brothers are turning quantization into a distribution business: every quality gain at a fixed file size expands the hardware that can run open models locally.

Daniel Han と Michael Han は、兄弟の圧縮手法を Qwen3.8-27B 向けに更新した Unsloth Dynamic 3.0 をリリースしており、ローカルハードウェア向けのサイズで元のモデルの振る舞いをより多く保持するよう設計された GGUF ファイルを提供している。
このリリースは、Hans が 2023 年に Unsloth を創業して以来追求してきた技術的な仮説を拡張するものだ:モデル最適化はオープンAIの配布レイヤーになり得る。メモリとストレージ要件を一段と削減するごとに、別の階層の消費者向けマシンでモデルが扱えるようになり、開発者は実行のたびに推論プロバイダに支払う代わりの選択肢を得る。
Daniel Han は以前 Nvidia に在籍し、t-SNE アルゴリズムを 2,000 倍高速化し、Llama、Gemma、Mistral、Phi を含むオープンモデルで 20 件以上のバグを修正したと述べている。Michael Han はプロダクト、デザイン、エンジニアリングを担当する。兄弟は Unsloth を Y Combinator's Summer 2024 batch に参加させ、YC は現在サンフランシスコ拠点のチームを 8 人と記載している。Lightspeed は Daniel を CEO、Michael を共同創業者としていると識別している。
小さいファイルより大きな主張
Unsloth は Dynamic 3.0 の Qwen3.8-27B 量子化ファイルが、同じディスクサイズで競合ファイルより top-1 精度が 10% 以上優れていると主張している。この数値は Unsloth 自身のベンチマークに基づくもので、独立して再現されたわけではない。
基盤となる手法は事後トレーニング量子化だ。Unsloth はキャリブレーションデータで Qwen3.8 を再学習させたり、量子化対応トレーニングや量子化対応蒸留を用いたりしていないと述べている。代わりに Dynamic 3.0 は、ベースモデルの訓練後により高品質の重要度マトリックス、改訂されたレイヤー選択、および追加の量子化手法を適用する。
Unsloth はキャリブレーション素材をコーディングエージェント、チャット、多言語タスクの周辺にまとめた。この選択は重要だ。どの重みをより高い精度に保つかを決めるために用いるデータは、圧縮モデルがどの領域で持ちこたえ、どこで劣化するかを左右し得る。コーディング向けプロンプトで調整された量子化は、集計された精度の数値が高く見えても、他のワークロードでは挙動が異なる可能性がある。
Unsloth はまた、見出しとなっている top-1 測定値に限界があることを認めている。その測定は、量子化モデルが BF16 参照と同じ最も確率の高い次トークンを選ぶかどうかを記録するもので、それ以外の生成経路は測定されない。
したがって Dynamic 3.0 は、同社が設計したテスト「Divergence-300 @32」を追加している。Unsloth は Terminal-Bench 2.1、DeepSWE、Harbor、MathArena 2025-26、および非ラテン文字や長文タスクのコレクションから抽出した 300 のプロンプトを使用した。各量子化モデルについて貪欲デコーディングで 32 トークンを BF16 モデルと比較し、さらに出力分布が高精度参照からどれだけ動くかを測る KL ダイバージェンスも報告している。
これらの追加により、単一の次トークンスコアよりも評価が有用になっている。ただし幅広い性能主張は依然として Unsloth が選んだプロンプト、キャリブレーションの選択、比較設定に依存している。既存の量子化ファイルを置き換えるか判断する開発者は、特にコーディング、チャット、キャリブレーションセットに含まれる言語以外の用途で、自身のアプリケーションに対してファイルをテストする必要がある。
Unsloth は重要度マトリックスを公開しており、コミュニティがテストやバリエーションを行えるようにしている。これにより外部の開発者は手法を検査し、ファインチューンを作成し、Unsloth のベンチマークスイートを超えた評価を実行する道が開かれる。
ハードウェアのトレードオフ
最も攻めたファイルは 6.2GB の UD-IQ1_S 1ビット量子化ファイルだ。Unsloth によれば参照より 89% 小さく、top-1 精度を約 72% 保っているという。この縮小により 270 億パラメータのモデルが、フル精度版では手が届かなかったマシンのストレージおよびメモリ範囲に収まり得るが、相当な品質のトレードオフが伴う。
9.83GB の UD-Q2_K_XL は、より緩い妥協を提供する。Unsloth はこれが top-1 精度で次善の比較対象を約 8% 上回り、ドキュメントに示された例では JavaScript のバグがあるものの動作する HTML プログラムを生成できると報告している。
UD-Q2_K_XL 未満の量子化ファイルでは、Unsloth はモデルのマルチトークン予測モジュールを約 500MB 節約するために除去した。その機能を望むユーザーは別途 Q4_0 MTP モジュールをロードできる。この判断により、ストレージは明示的なオプションとなり、投機的デコードコンポーネントをすべての小さなファイルに同梱する必要がなくなる。
Qwen3.8-27B GGUF files は llama.cpp や Unsloth Desktop を含むエンジンで動作する。Unsloth によれば Qwen3.8 のリポジトリは 5 日間で 510 万件のダウンロードを記録したという。その指標はユニークユーザーではなくファイルリクエストを表している:Hugging Face のカウント規則 は GGUF ファイルのリクエストをカウントし、リポジトリのクローン中に複数ファイルが取得された場合にそれらを数えることがある。
この需要がタイミングを説明している。オープンモデルのリリースは、開発者が既に所有するマシン向けにウェイトをパッケージ化するツールメーカー間の二次的な競争を生み出している。Hans 兄弟はファイル形式、量子化の質、発売日の即時可用性がどのウェイトが検証・採用されるかを決める地点として、モデルラボとローカルランタイムの間に Unsloth を位置づけている。
RuntimeWire は 6月に報告 したとおり、Unsloth は同じ配布戦略を Z.ai の GLM-5.2 に適用し、GGUF 圧縮と Unsloth Desktop を用いてフロンティア規模のオープンモデルをデータセンター外でもよりアクセスしやすくしていた。Dynamic 3.0 はその繰り返されるリリース作業を、Unsloth がモデルファミリー全体に適用できる名称付きの方法論に変える。
このアプローチにより、兄弟はオープンモデルのサプライチェーンで有用な立ち位置を得る。ラボはますます高能力なウェイトを公開できる一方で、ハードウェアの制約が誰がそれらを実行できるかを決め続ける。Unsloth の信頼性は、開発者が Unsloth のテストスイート外でファイルを計測し始めたときに、Dynamic 3.0 の利得がモデルやワークロード全体でどれだけ広く持続するかに依存するだろう。