ARC PrizeがDeepSeek V4 Flashを61.4%で、1タスクあたり$0.04という条件で検証
ARC Prizeの外部評価は、Liang WenfengのオープンウェイトモデルがMaxの努力で61.4%からLowの努力で46.0%へと低下すること、またMaxでは1タスクあたり$0.04のコストがかかることを文書化している。
By Ryan Merket · Published
Primary source: ARC Prize
Why it matters
ARC Prize's outside evaluation gives developers a checkpoint-specific measurement of DeepSeek V4 Flash's ARC-AGI-2 performance, reasoning-effort curve and benchmark cost.

ARC Prize は、DeepSeek V4 Flash 0731 を ARC-AGI-2 の Semi-Private 評価における最大推論努力で 61.4% と検証し、タスクあたり $0.04 の費用を報告しました。この結果は7月31日のチェックポイントに結び付けられており、3つの努力レベルを含みます:Max で 61.4%、High で 56.0%、Low で 46.0% です。
ARC Prize はその検証プログラムを通じて指名されたチェックポイントを評価し、タスクの性能とコストの両方を報告しました。その外部評価がここでの焦点です。チェックポイントは DeepSeek に由来し、同社は杭州の AI 企業で、Liang Wenfeng が創業しました。
ARC Prize results page は結果を検証済みと示し、Max、High、Low の reasoning variants を特定しています。同ページはまた、ARC-AGI-1 Semi-Private における最大努力で 89.0% を報告しており、タスクあたり $0.02 と記載しています。
ARC Prize created its verified program の背景には、プロンプトやデータセットの選定、テスト方法によって結果が変動しうるという事情があります。同社の方法論は資源効率を測定の一部として扱っており、結果ページがタスク完了率と並んでコストを報告する理由でもあります。
この $0.04 という数字は、この評価における最大努力の ARC-AGI-2 タスクごとに適用されるものです。コーディングエージェントのジョブ、研究ラン、その他のワークロードに対する一般的な価格というわけではありません。
Three effort levels expose the ARC-AGI-2 cost trade
ARC Prize は Semi-Private ベンチマーク上で Max、High、Low の reasoning variants をテストしました。V4 Flash は Max で 61.4%、High で 56.0%、Low で 46.0% を記録しました。
この 15.4 ポイントの開きは、ARC-AGI-2 の結果が推論努力にどれだけ強く依存するかを示しています。モデルの最高スコアは、オペレーターがそのスコアを生み出すためにどれだけの計算を要したかを把握できない限り、実運用計画には限定的な指針しか与えません。DeepSeek は reasoning effort as a parameter を公開しています、これにより開発者はワークロードのレイテンシーや支出制限に合わせて熟慮の度合いを調整できます。
ARC Prize の $0.04 という数字は最大努力の ARC-AGI-2 評価に特有のものにとどまります。繰り返しのツール呼び出し、長いコンテキストウィンドウ、大きな出力は、アプリケーションのコストを単一ベンチマークタスクの費用をはるかに超えて押し上げる可能性があります。
DeepSeek の現在の API pricing は、V4 Flash を非キャッシュ入力トークン 100 万あたり $0.14、キャッシュ入力トークン 100 万あたり $0.0028、出力トークン 100 万あたり $0.28 としています。これらのトークン単価が、DeepSeek が通常の API 利用をどのように課金するかを説明しており、普遍的なタスク単価を確定するものではありません。
Liang's efficiency discipline came from quantitative trading
Liang は、機械学習を応用した自動取引を行うクオンツヘッジファンド High-Flyer を立ち上げた後、2023 年に DeepSeek を創業しました。彼は浙江大学で電子情報工学の学士号と情報通信工学の修士号を取得したと Fortune は伝えています。
その経歴は、モデルの能力と計算資源の関係に対する DeepSeek の注力を説明する助けになります。クオンツトレーディングはコスト計算を通過する改善を評価します。DeepSeek はモデルアーキテクチャ、API 価格設定、オープンリリースを通じてその規律を適用しています。
V4 Flash は合計 2,840 億パラメータを含み、トークンごとに約 130 億パラメータを活性化すると DeepSeek の技術論文 は述べています。同モデルの mixture-of-experts 設計は、各トークンをモデルのサブセットに通すことで、すべてのリクエストに対してすべてのパラメータを使う代わりに処理します。
V4 論文は Liang を 300 名超の著者の一人として列挙し、compressed sparse attention、heavily compressed attention、manifold-constrained hyper-connections、Muon optimizer を記述しています。アーキテクチャは 100 万トークンのコンテキストウィンドウをサポートし、DeepSeek の API ドキュメントは最大出力を 384,000 トークンとしています。
DeepSeek はその広範な V4 ファミリーを 4 月 24 日にリリースしたと transparency center は伝えています。ARC Prize は V4 Flash 0731 チェックポイントの結果を 7 月 31 日に日付付けしています とともに Max、High、Low のバリアントを特定しています。チェックポイントに名前を付けることは、検証済みスコアを特定のモデルバージョンに結び付けます。
Open weights widen the checkpoint's distribution
DeepSeek は V4 Flash 0731 のウェイトを Hugging Face 上で公開 し、MIT ライセンスの下で配布しています。モデルカードは Transformers、vLLM、SGLang、Docker のデプロイ経路と、ローカル推論のための手順を提供しています。
このリリースは、DeepSeek に採用のための二つの経路を与えます。開発者はホストされた API を利用でき、インフラ担当チームはチェックポイントを自ら運用し周辺の推論スタックを改変することができます。ダウンロード可能なウェイトと寛容なライセンスは、DeepSeek のサーバー外でモデルを動かすユーザーにもモデルを届けることを可能にします。
ARC-AGI には限界があります。これは生産エージェントに要求される信頼性、セキュリティ、コーディングやツール使用の振る舞い全般ではなく、未知の視覚的推論タスクへの適応を評価します。ARC Prize は V4 Flash 0731 の ARC-AGI-3 スコアをリストしていません。このベンチマークは、エージェントが情報を収集し時間をかけて行動する必要がある対話的環境へと近づいていきます。
検証済みの結果は、文書化された条件下での狭い問いに答えます:DeepSeek V4 Flash 0731 は最大努力で ARC-AGI-2 Semi-Private タスクの 61.4% を解決し、報告されたコストはタスクあたり $0.04 でした。High と Low の努力での低いスコアは、モデルが推論に費やす計算を減らしたときにその結果がどれほど変わるかを示しています。