DeepSeekはV4-Flashをベンチマークタスクあたり3セントで出荷する
Artificial AnalysisはLiang Wenfengのモデルを知能の面でGemini 3.6 Flashに近いと評価し、ベンチマークテストのコストではClaude Fable 5より約105倍安いとした。
By Ryan Merket · Published
Primary source: Reuters
Why it matters
Liang Wenfeng is forcing model buyers to measure intelligence per dollar alongside benchmark rank. If V4-Flash holds up in production, high-volume agent products gain room to lower prices or widen margins.

Liang Wenfeng's DeepSeek released V4-Flash on July 31st with the lowest average cost per task among the well-known AI models tested by Artificial Analysis, according to benchmark results reported by Reuters on August 3rd. The research firm calculated an average cost of $0.03 per test, compared with $0.86 for Moonshot AI's Kimi K3, $1.86 for OpenAI's GPT-5.6 Sol and $3.15 for Anthropic's Claude Fable 5.
DeepSeekの創業者であるLiang Wenfengは、DeepSeekが存在する以前からこの戦略を練っていた。彼は浙江大学で情報通信工学を学び、その後機械学習を定量的投資に応用してHigh-Flyerヘッジファンドを共同設立した。2025年のReutersによるプロフィールで、Liangは中国のAI開発者はアメリカの研究室の追従者に留まるのではなく、独自の研究を追求する必要があると主張していた。DeepSeekはそれ以来、攻撃的なAPI価格設定とオープンなモデル公開を用いて、その研究上の主張を流通戦略に変えてきた。
V4-Flashはこれまでにその戦略を最も明確に表現したモデルだ。ベンチマークのリーダーに比べて生の知能では劣るが、繰り返し発生する低コストで開発者に競争力のある推論モデルを提供し、数千〜数百万回のモデル呼び出しを行う製品の経済性を実質的に変える価格を提示している。
ベンチマークはコストの物語
Artificial AnalysisはV4-Flashに対してIntelligence Indexで50点を与えた。この指数はコーディング、推論、職場向けのタスクをカバーする9つの評価を組み合わせたものだ。ReutersはそのスコアがGoogleのGemini 3.6 Flashと一致し、MoonshotのKimi K3に7ポイント差で遅れ、比較対象の中でOpenAIとAnthropicの主要モデルには少なくとも9ポイント劣っていたと報じた。
その性能差がDeepSeekの提示するトレードオフを明確にする。V4-Flashは、最高のベンチマークスコアよりも、低い継続コストで堅実な回答を出せることがより価値を生むワークロードを狙っている。
DeepSeekはV4-Flashをキャッシュされていない入力トークン100万あたり$0.14、出力トークン100万あたり$0.28で掲載している。キャッシュされた入力は100万トークンあたり$0.0028だ。モデルは100万トークンのコンテキストウィンドウ、思考モードと非思考モード、ツール呼び出し、JSON出力、および最大384,000出力トークンをサポートする。
Artificial Analysisのタスク当たりコスト計算が重要なのは、トークン単価だけでは購入者を誤解させる可能性があるからだ。推論モデルは長い内部トレースを生成したり、ジョブを完了するために追加のステップを踏むことがある。Artificial Analysisは各評価を完了する際に消費されたトークンを含めており、ベンチマーク条件下で開発者が完成タスクに対して支払う金額のより現実的な近似を示している。
得られた差は相当大きい。Claude Fable 5の平均テストコスト$3.15はV4-Flashの$0.03のおよそ105倍だった。Kimi K3は高いインテリジェンススコアを示したが、その平均タスクコストはほぼ29倍高かった。
これらの数値はベンチマーク測定値にとどまる。プロンプトの長さ、キャッシュの挙動、ツール実行、リトライ回数は本番コストを大きく動かし得る。
Liangのコスト規律がAIエージェントに波及
DeepSeekはV4ファミリーを4月24日に導入した。その公式リリース文書はV4-Flashを総パラメータ数2840億、アクティブパラメータ130億のmixture-of-expertsモデルとして説明している。各トークンごとにモデルのより小さな部分だけを活性化することは、リクエストごとにすべてのパラメータを動かす推論コストを払うことなく強力な推論を提供しようとするDeepSeekの取り組みの核心だ。
7月31日のリリースはエージェントワークロード向けにV4-Flashを鋭化した。DeepSeekによればV4-Flashのパブリックベータはエージェント能力を大幅に強化し、V4-Proは変更されなかった。その焦点があるため、コストベンチマークが従来のチャットボットの価格比較よりも重要性を持つ理由が説明される。
エージェントは1件の顧客要求をモデル呼び出しの連鎖に変えることができる:ジョブの計画、ファイル検索、ツールの呼び出し、中間作業の確認、エラー修復。各ステップがトークンを消費する。単位コストの小さな違いが急速に累積し、特に常時バックグラウンドで動作するコーディング製品やエンタープライズの自動化サービスでは顕著だ。
DeepSeekは、プレミアムな最先端モデルと、より小さくリトライが多くなる可能性のあるシステムの間で、それらの開発者にもう一つの選択肢を与えている。プロダクトチームは最も難しい要求を高スコアのモデルにルーティングし、日常的な計画、抽出、ツール呼び出しの作業をV4-Flashに送ることができる。OpenAIおよびAnthropic互換のAPIフォーマットをサポートしていることは、その配置をテストするために必要なエンジニアリング作業を軽減する。
Liangのアプローチはまた、モデル提供者に対して完成した作業の中で測定可能な改善でプレミアム価格を正当化するよう圧力をかける。9ポイントのインテリジェンス優位は困難な研究やコーディングタスクでは価値があるかもしれないが、より安価なモデルが確実に成功する反復的な呼び出しで構成されるワークロードでは、その正当化は難しくなる。
価格はDeepSeekのコンテスト復帰の道筋
DeepSeekのR1リリース(2025年1月)は、競争力のある推論システムにどれだけの資本と計算力が必要かについての前提に挑戦したことで、Liangを最も注目されるAI創業者の一人にした。それ以降、Moonshot AI、MiniMax、Z.AI、Alibaba、ByteDanceが自社のリリースを加速させ、中国の開発者にはOpenAI、Anthropic、Google、Metaと並ぶ混雑した国内市場が生まれている。
V4-Flashはその競争に対するDeepSeekの直接的な回答を与える。全体のベンチマークでトップを主張する代わりに、Liangはモデル性能が製品コストになるレイヤーを狙って競っている。そのレイヤーの買い手はAPIを運用し、エージェントや自動化ワークフローをコーディングする開発者であり、追加の推論ステップのたびに請求が発生する。
その戦略はLiangの経歴に合っている。定量投資は、低い限界コストで受け入れられる結果を繰り返し生み出すシステムを評価する。V4-Flashは推論に同様の規律を適用している:DeepSeekは幅広いタスクを処理できる十分な能力を提供し、高ボリューム展開を正当化しやすくするために価格を利用している。
残る試験はベンチマークスイートの外で行われるだろう。開発者は自分たちのワークロードでV4-Flashの信頼性、ツール利用の挙動、キャッシュ性能、リトライ率を測定する必要がある。エージェントが繰り返し試行や人的レビューを必要とするならば、3セントのテストは魅力を失う。モデルが本番業務を一貫して完了できれば、LiangはAIプロダクト企業が価格を下げ、マージンを拡大し、以前は自動化するには高すぎたワークフローを稼働させる余地を作ったことになる。