MetaがMuse GlimmerエージェントモデルをApache 2.0ライセンスの下でオープンソース化

MetaはMuse Glimmerの重みをApache 2.0でダウンロード可能な形で公開し、開発者が24 GBまたは32 GBのメモリ環境内で動作するマルチモーダルなエージェントモデルを制御できるようにしている。

By · Published

Primary source: AI at Meta

Why it matters

Muse Glimmer gives engineering teams an Apache 2.0 agent model they can run and modify locally. Meta documents full-precision memory use above 55 GB, quantized weights below 20 GB, 24 GB and 32 GB deployment options, and RTX 5090 throughput reaching 233.4 tokens per second with speculative decoding.

Deconstructed AI model architecture and local hardware integration (exploded-view technical diagram — clean isolated parts on white, callout labels with leader lines)

Metaは8月10日にMuse Glimmerを、マルチモーダルエージェントとコーディング作業向けのダウンロード可能なApache 2.0モデルとしてリリースした。約296億パラメータのモデルの重みを公開することで、Metaは開発者にホストされたMuse Sparkモデルの代替手段を提供し、自分たちのインフラで評価、改変、実行できるようにしている。

重みはHugging Faceのモデルカードを通じて入手でき、展開を扱う別の開発者向けリソースがある。Metaはリリースを技術記事で詳述し、AI at Metaを通じてダウンロードを発表した。

Apache 2.0の重みが開発者に制御をもたらす

GlimmerのApache 2.0ライセンスは、チームがライセンスの条件の下でダウンロード可能なモデルを検査・改変することを許可する。その配布モデルは展開、性能、インフラの責任をオペレーターに移すが、ホストされたサービスを通じてのみアクセスするのではなく、自前のハードウェアでモデルを評価できる利点もある。

Glimmerは別途資金提供された会社ではなくMetaの社内プロジェクトである。リリース資料には個別の創設者やモデル作成者の記載がなく、Glimmer固有の資金、顧客、使用数や価格の開示も行っていない。

Metaによれば、GlimmerはMuse Sparkから蒸留されており、より大きなティーチャーモデルの振る舞いをローカル展開を目的としたパッケージに移したという。Muse Spark 1.1Meta Superintelligence Labsによって7月9日にリリースされ、Meta AIおよびMeta Model APIのパブリックプレビューを通じてThinking modeで利用可能なホスト型マルチモーダル推論モデルとして残っている。

Spark 1.1はコーディング、ツール呼び出し、コンピュータ操作、マルチモーダル理解をサポートする。Metaは、これが新しいネイティブツール、Model Context Protocolサーバー、カスタムスキルに一般化でき、作業を計画して並列サブエージェントに実行を委譲できると述べている。Glimmerは関連するエージェントの振る舞いを、オペレーター管理のインフラストラクチャと固定のローカルメモリ要件を備えたApacheライセンスのパッケージに取り込んだ。

量子化バージョンは24 GBおよび32 GBシステムを想定

Muse-Glimmer-30Bという名称はその30Bモデルクラスを示す。公式モデルカードは、1.8 billionパラメータのperception encoderを含む合計で約296億パラメータと報告している。Glimmerは52層、隠れ状態が6,656次元、クエリ注意ヘッドが32個、キー・バリュー注意ヘッドが2個の密な因果Transformerアーキテクチャを使用する。

関連するMuse-Glimmer-30B-GGUFリポジトリは、同じ30Bクラスのベースモデルから派生した量子化された重みをパッケージ化している。フルプレシジョンの推論は55 GB超のメモリを必要とし、モデルカードは64 GBのVRAMを展開ターゲットとして示している。

Metaの約4ビット版は言語モデルの重みを20 GB未満に削減する。文書化されたハードウェア要件は、K-Quant-Dynamicで32 GBのVRAM、K-Quant-17GBバリアントで24 GBのVRAMとなっている。これらの構成は、キー・バリューキャッシュ、画像処理、perception encoder、および別個の投機的デコーディングモデルのための容量を確保しているとMetaの技術資料は述べている。

Glimmerには、メインモデルが検証するために16トークンのブロックを提案するDFlash drafterが同梱されている。MetaのNvidia RTX 5090テストでは、DFlashによりK-Quant-17GBの生成速度が74.9トークン/秒から233.4トークン/秒に増加し、3.1倍の改善となった。モデルカードはまた、Apple M4 Maxで23.7から37.8トークン/秒に、M5 Maxで26.6から50.2に増加したと報告している。これらはMetaによる測定値であり、プロンプト、ランタイム設定、利用可能なメモリによって変動する可能性がある。

Hugging Faceは、llama.cpp、vLLM、SGLang、Ollama、Unsloth Studio、OpenClaw、Hermes Agentを通じたローカル展開パスをリストアップしている。ローンチ時にMetaは、最適化されたllama.cpp、MLX、ExecuTorchの統合が数日中に予定されていると述べた。チームは自分たちのワークロードに対してレイテンシ、ツール呼び出しの信頼性、メモリ消費、持続的スループットを引き続きテストする必要がある。

オープンモデルはマルチモーダルエージェント作業をサポートする

Glimmerはテキストと画像を受け取り、テキストを生成する。Metaはコンテキストウィンドウが少なくとも131,072トークンであり、知識のカットオフが2026年1月4日であると文書化している。モデルカードによれば、開示されたトレーニングソースには公開されているマルチモーダルデータ、サードパーティデータ、Metaの製品とサービス、外部ベンダーおよびMeta担当者によってキュレーションまたは強化された素材が含まれている。

Metaはこのモデルを、マルチステップの計画、スキーマベースの関数呼び出し、長期にわたるタスク実行が可能であると説明している。失敗したツール呼び出しを診断して再試行し、コードの作成とデバッグを行い、スクリーンショット、チャート、ドキュメントを解釈できるという。会社はまた、制御可能な推論強度、OpenClawや類似のエージェント足場との互換性、100以上の言語サポートをリリース記事で文書化している。

MetaのGlimmerモデルカードは、MCP Atlasで75.5、DeepSearch QAで74.6、SWE-Bench Proで51.2、SWE-Bench Verifiedで76.0、TerminalBench 2.1で51.7、Beam128Kで65.1のスコアを報告している。これらの結果はツール使用、ソフトウェアエンジニアリング、ターミナル操作、長コンテキスト動作を網羅する。これらは独立した評価ではなく、企業が報告した数値である。

エンジニアリングチームにとって中心的なトレードオフは、制御と運用負担である。GlimmerのApacheライセンスの重みによりモデルはローカルで評価・改変可能になる一方で、そのメモリ要求、サービングスタック、ツール呼び出しの信頼性はオペレーターの責任として残る。

Reader comments

Conversation for this story loads after sign-in.