MicrosoftのMAI-Image-2.6がArena image rankingで初登場2位にランクイン

このモデルはMAI-Image-2.5と比べて8位上昇し、Arenaの3Dカテゴリーで首位に立ち、OpenAIのリードを45ポイントに縮めた。

By · Published

Primary source: Arena on X

Why it matters

Microsoft is turning rapid in-house model iteration into strategic independence: each quality gain can flow directly into Bing, PowerPoint, OneDrive and its developer platform.

Microsoft's MAI-Image-2.6 debuts at No. 2 in Arena image ranking — The model rose eight places from MAI-Image-2.5 and led Arena's 3D category, narrowing OpenAI's lead to 45 points.

Microsoft AI、Mustafa Suleymanが率いるラボは、8月10日のArenaのテキストから画像へのランキングで新しいMAI-Image-2.6モデルを2位に入れ、Microsoftの社内モデルプログラムがOpenAIとの品質差を縮めつつあることを示すこれまでで最も強い公開証拠となった。

MAI-Image-2.6は1,336ポイントを獲得した、とArenaは伝えており、1位のGPT Image 2 Mediumとの差は45ポイントだった。Microsoftのモデルは、Arenaのスナップショットで3位に入ったGrok Imagine Image 2.0 Lowより20ポイント上回った。

この結果は世代的な大幅な向上を示している。同じスナップショットではMAI-Image-2.5が10位だったのに対し、バージョン2.6は2位に上がった。Arenaはまた、新モデルを3Dイメージングとモデリングで1位に位置付け、前モデルの6位からの上昇を示した。カートゥーン、アニメ、ファンタジーでは8位から2位に、プロダクト、ブランディング、商業デザインでは7位から2位に、テキストレンダリングでは8位から2位に、アートでは4位から2位に上昇した。

これらのカテゴリ結果は、一つの視覚スタイルによる狭い向上ではなく、商業デザイン作業全体にわたる改善を示しているため重要だ。プロダクト画像と信頼できるテキスト生成は特に、ラベルの不具合やオブジェクトの不一致があれば説得力のある画像でも使い物にならなくなる広告、プレゼンテーションソフトウェア、その他の制作ワークフローで重要である。

Suleymanの高速反復戦略

このArenaの結果は、DeepMindとInflectionの共同創業者であり2024年にMicrosoftに参加してMicrosoft AIを設立し率いるために入社した、Suleymanの下で進む迅速なリリースサイクルの延長線上にある。

Microsoftは2026年3月にMAI-Image-2を導入し、6月にMAI-Image-2.5を続けて発表した。同社は後者が画像生成と制御された編集(局所的な変更、テキスト置換、編集を通じた顔の保持など)向けに構築されたと説明した。Microsoftはその後、MAI-Image-2.5をBing Image Creatorのデフォルトモデルに設定し、PowerPointやOneDriveにも展開したと7月23日の製品アップデートで報告している。

その製品のフットプリントは、各品質向上を異例に直接的に配布することを可能にする。Microsoftは社内の画像モデルを、サードパーティのプロバイダが価格、リリーススケジュール、製品優先度を調整するのを待つことなく、消費者向けおよび職場向けのアプリケーションに移行できる。

Suleymanはこのモデル構築の取り組みを長期的な自立性への推進だと説明している。6月2日のMicrosoftのMAIプログラムに関する説明では、同ラボがゼロからモデルを訓練し、独自のデータ、訓練、評価システムを構築していると述べた。Microsoftは引き続きOpenAIと協力しているが、MAIプログラムは以前はパートナーの技術に大きく依存していた製品に対して別のモデル供給源を与える。

MAI-Image-2.6がGPT Image 2に45ポイント差をつけられたことは、OpenAIが8月10日のArenaランキングでリードを維持していることを示している。Microsoftの8位上昇は、ギャップが連続するモデルバージョン間で大きく動く可能性があることも示している。

ランキングが測るもの

Arenaのテキストから画像へのリーダーボードは、同じプロンプトに応答した2つの匿名の画像生成器をユーザーが比較し、より好ましい結果に投票するという仕組みに基づいている。Arenaはこれらのペアワイズの選択をBradley-Terryランキングシステムを使ってモデルスコアに変換し、統計的不確実性を示すために信頼区間と順位幅を報告している。

つまり、このリーダーボードはArenaに提出されたプロンプトに対する人間の好みの指標であり、すべての実運用要件を統制したテストというわけではない。高い順位はモデルのレイテンシ、運用コスト、安全性パフォーマンス、大規模時の信頼性、あるいはAPIを通じた利用可能性を確立するものではない。

ランキングはまた、より多くの投票が集まったり競合モデルがプールに加わったりすることで変動する可能性がある。例えば、Arenaの7月10日のリーダーボードスナップショットでは、MAI-Image-2.5が総合で6位、1,257ポイントだった。バージョン2.6を発表する8月10日の投稿時点では、古いMicrosoftモデルは10位と認識されていた。この動きは、正確な順位が永久的な技術判定ではなくライブの市場シグナルであることを思い出させる。

それでも、MAI-Image-2.6のデビューはMicrosoftの画像プログラムの競争的地位を変えた。MAI-Image-2がArenaにトップ層の外で登場してから4か月後、MicrosoftはユーザーがOpenAIの先行構成のみに次いで評価する後継を生み出した。次の試練は、Microsoftがその好まれ度の優位性を自社製品に持ち込みつつ、開発者や製品チームが実際に採用するモデルを決めるコストと速度の要件を満たせるかどうかである。

Reader comments

Conversation for this story loads after sign-in.