Metaは、Muse Spark 1.2がツールを与えられた際に12.2ポイント向上すると述べている。
Alexandr WangのMSLは、そのモデルがツールなしでは前モデルに劣るが、Metaのランタイムと組み合わせると上回ると報告している。
By RuntimeWire Staff · Published
Primary source: AI at Meta
Why it matters
Meta's chart shows Muse Spark 1.2 trailing version 1.1 without tools and moving ahead once tools are enabled. For teams buying or building agents, that shifts scrutiny toward the whole model-runtime configuration, including its containment controls, rather than the model checkpoint alone.

Alexandr Wang's Meta Superintelligence Labs, Meta's internal AI organization, reported on August 20 that Muse Spark 1.2 scored 72.0 across 10 multimodal evaluations when it could use tools, up from 59.8 without them. The newly published comparison puts a number on MSL's effort to train the model alongside the runtime in which it works. (research.meta.ai)
そのアプローチはWangの経歴に合致する。彼は19歳でScale AIを共同設立し、より良いデータと評価インフラがAIシステムの改善速度を決定するとする仮説のもとに事業を進めた。Metaは2025年に同社に約Scaleへの$14.3 billionの投資を行い、取引で約49%の出資比率を取得してScaleの評価額を約290億ドルとした。Wangは現在Metaのchief AI officerを務め、MSLを率いてMetaのモデルスタックを再構築し、4月に最初のMuse Sparkを公開した。 (about.fb.com)
Muse Spark 1.2は8月5日に、Metaの端末型コーディングエージェントであるMuse Codeの背後にあるモデルとして登場した。8月20日のtechnical postは、モデルが視覚素材を検査し、その観察を後の推論やツール呼び出しに持ち込める場合の性能を報告している。この評価がここでの新しい要素であり、Metaは月初に基礎モデルとコーディングエージェントを既に紹介していた。
ツールが入ると改善が現れる
Metaの比較は異例に示唆的な細部を含んでいる。Muse Spark 1.2はツールなしで59.8を記録し、Muse Spark 1.1の60.2をやや下回った。ツールを有効にすると、1.2は72.0に上昇し、1.1は69.1に達した。
これによりバージョン1.2はツール有効時に12.2ポイントの増加を示し、前作は8.9ポイントの増加だった。新しいモデルはツール使用時に1.1を2.9ポイント上回り、ツールなしでは0.4ポイント下回っている。Metaの数値は、報告された改善がモデルとその作業環境との相互作用にあることを示している。 (research.meta.ai)
集計はSimpleVQA、WorldVQA、CharXiv Reasoning、ChartMuseum、ERQA、ChartQA-Pro、OmniSpatial、ZeroBench、BabyVision、およびPerceptionBenchをカバーする。Metaの公開チャートは平均スコアを示しているが、ベンチマークごとの結果は示していない。また、外部の評価者がこの増分を再現できることを確立しているわけでもない。Artificial Analysisによれば、12.2ポイントの増加は8月20日時点で独立に再現されていなかった。 (Artificial Analysis)
Metaは結果とともにマルチモーダル評価手法を公開している。注目の数値はMetaが実施した合成指標のままであるため、有用な比較は狭義のものになる:ツールアクセスの有無でMetaのフレームワーク下で測定された、Metaのモデルの2世代比較だ。
Wangの研究所はモデルとその職場を共同訓練している
Muse Spark 1.2はMuse Codeと共に共同訓練され、実使用時にモデルが遭遇するハーネス(実行環境)での経験を与えた。Metaによれば、訓練にはサンプル化されたハーネストラジェクトリ、ゴール、コンテキスト圧縮、サブエージェント、およびMuse Codeツールセットが組み込まれているという。
Muse Codeは、各タスクごとに新しい専門エージェントを作成するのではなく、セッション全体で専門のバックグラウンドエージェントを維持する。また、モデル呼び出し、ツール実行、承認、編集をローカルのイベントログに追記し、中断された作業を記録された状態から再開できるようにする。これらのランタイム上の選択は、コーディングエージェントに残る持続的な弱点を狙ったものだ:有能なモデルであっても同じコンテキストを二度収集してしまったり、以前の決定を失ったり、周辺ソフトウェアが正常に回復できないために長いタスク中に失敗したりすることがある。
ツール使用スコアは、そのモデルとランタイムの組み合わせに対するMetaの測定可能な結果を与える。どの程度の利得がモデルそのもの、利用可能なツール、オーケストレーション層、またはそれらの組み合わせの設定から来ているかは示していない。Metaは、どの視覚的推論スキルが増加を説明するかを示すベンチマークごとのスコアを開示していない。
ツール使用は封じ込めのリスクを高める
この評価は、誤設定されたサードパーティのテスト環境により、リリース前のMuse Spark 1.1がオープンなインターネットに到達してしまったとMetaが公表してから6日後に発表された。モデルは架空のターゲットの代わりに実在のウェブサイトの名前を与えられ、脆弱性を見つけ、情報にアクセスし、サイトのデータベースを変更した。
Metaはこのインシデントが単発で、以前の1.1モデルが関与しており、サンドボックスの脱出ではなく評価者の設定に起因するものだと述べた。この出来事は、ツール使用による利得の背後にある運用上のリスクの具体例を提供する。より長い自律ワークフローやより良いツール選択は、エージェントの権限、ターゲット、ネットワークアクセスに対するより厳格な制御を要求する。 (research.meta.ai)
MetaはMuse Spark 1.2がMuse CodeとMeta Model APIを通じて利用可能であると述べている。マルチモーダルの投稿はまた、結果がオープンウェイトの公開に先行して到着したと説明しているが、日付やライセンスは示していない。Metaは別途、ローカル実行を想定した300億パラメータのモデルであるMuse Glimmerを8月10日にリリースしている。
Wangにとって、1.2の評価は馴染み深いインフラ仮説をモデル戦略へと転換する。直接応答のスコアは世代間でほとんど変わらなかった。Metaは、Muse Spark 1.2を訓練時に使用するよう設計されたツールとランタイムに接続した後で、より大きな利得を報告した。