Grok 4.5のチェックポイントが4つ、Arenaに出現 — xAIの4.6ウィンドウの近くで

ロスターの記載はマルチモーダルおよびウェブ対応のバリアントを指しているが、ラベルからはそれらがGrok 4.6に基づくことは示されていない。

By · Published

Primary source: X - leo (@synthwavedd)

Why it matters

Multiple checkpoints suggest xAI is using live user preferences to choose its next Grok configuration, but the shared 4.5 label is not proof of a 4.6 launch.

Four Grok 4.5 checkpoints appear in Arena near xAI's 4.6 window — The roster entries point to multimodal and web-enabled variants, but their labels do not establish that Grok 4.6 is behind them.

火曜日にArenaのロスターアラートにGrok 4.5と表示された4つのチェックポイントが現れ、xAIがGrokの次のイテレーションを準備する中でElon Musk (@elonmusk)に新たな実ユーザーテストのプールを提供した。

The four entries were surfaced in a post on X by leo (@synthwavedd), who described them as presumed Grok 4.6 variants running under the existing model name. The attached roster-monitoring screenshot supports the narrower claim: four separate identifiers were added under "grok-4.5." It does not identify them as Grok 4.6. (x.com)

四つのGrok 4.5チェックポイントを一覧するロスターアラート
RAGtrackのアラートはGrok 4.5という名前を持つArenaのロスターエントリを4件リストしている。スクリーンショット: leo on X.

エントリのうち2つはファイル、画像、テキスト入力を受け付け、テキストとWeb出力を返すものとしてマークされている。残りの2つは画像とテキスト入力を受け付けてテキストを返す。各エントリは異なる内部識別子を持っており、重複表示ではなく4つの別個のエンドポイントまたは構成であることを示している。

Muskは7月17日のXでの返信でより大規模なモデル学習の実行をGrok 4.6と特定した。4週間弱ののちに複数のチェックポイントが出現したことは、ラボがリリース候補を選ぶ前にシステムプロンプト、訓練後のレシピ、ツールアクセス、あるいは異なるスナップショットを比較できる最終段階の評価サイクルに合致する。ロスターのデータだけでは、どの変数が4つのエントリを区別しているかを特定することはできない。

Arenaはラボに複数の候補をテストさせる

Arenaの評価ポリシーは、モデル提供者が複数のプレリリースバリアントをテストすることを明確に許可している。未公開モデルには匿名ラベルを付け、十分な投票が集まるまで評価し、Arenaが結果をプロバイダーに非公開で共有した後に削除することができるとされている。Arenaによれば、各匿名候補には固有のラベルが付与され、かつ各バトルには少なくとも1つは既に公開されているモデルが含まれていなければならない。 (arena.ai)

このプロセスによりArenaはフロンティアラボ向けの外部プロダクト選定システムになる。ユーザーは自分のプロンプトを提出し、最初はモデル名を見ずに2つの応答を比較してより良い回答に投票する。投票後に識別が明かされる。Arenaはその比較を集計して評価を作成し、内部ベンチマークスイートでは見逃しがちなライブのコーディングやチャットの実負荷からラボにフィードバックを与える。 (help.arena.ai)

したがって4つのGrokエンドポイントは活発な実験を示しているが、xAIがGrok 4.6を確定し、仕様を決定し、公的なロールアウトを開始したことを証明するものではない。共通のGrok 4.5ラベルは、後継のリリース候補、更新された4.5構成、またはその混在を覆っている可能性がある。

Grok 4.5は7月に基準を設定した

SpaceXAI(xAIの現在のモデルページで使用されているブランディング)は7月16日にGrok 4.5をリリースしたとし、コーディング、エージェンシー的な作業および技術知識を中心に位置付けた。SpaceXAIによればGrok 4.5は数万台のNvidia GB300 GPUにまたがって訓練され、数十万のタスクで強化学習が適用されたという。SpaceXAIはAPIの価格を入力トークン100万あたり$2、出力トークン100万あたり$6に設定した。これらの学習、性能、効率の数値は依然として会社側が提供する主張である。 (x.ai)

Grok 4.5は火曜日のロスターアラートより前から既にArena内に存在していた。Arenaの公開チェンジログは同モデルが7月13日にAgent Arenaに追加されたと記録しており、SpaceXAIの正式なローンチ発表の3日前だった。この流れは、Grokがより広範なリリースに先立って、あるいは同時にArenaに登場する最近の前例を示している。 (arena.ai)

7月下旬のArenaのWebDevリーダーボードでは、公開されているGrok 4.5エンドポイントが総合で10位、スコアは1,550、信頼区間は7位から16位に及んでいた。モデルの4つの新しいチェックポイントは、次の構成がコーディングタスクでその差を埋めつつ、SpaceXAIがローンチ時に強調した速度と価格設定を維持できるかをxAIがテストする手段を提供する。 (arena.ai)

開発者にとって実行可能な詳細はロスターの変更に限られる。これら4つのエントリに付随する検証済みのGrok 4.6のモデルカード、API識別子、価格、または公開エンドポイントは存在しない。現れているのは評価段階であり、xAIは次の名称で提供するものを決める前に、一般的なチャット、マルチモーダル入力、ファイル処理、Web対応出力にわたっていくつかのGrok構成をテストしているように見える。

Reader comments

Conversation for this story loads after sign-in.