DeepSeekがV4 Flashを出荷 — 高いエージェントスコアと低価格のAPI

DeepSeekのオープンウェイトモデルはAPIの価格で競合他社を下回り、サードパーティのテストではそのmax-reasoningバージョンが同クラスの上位近くに位置付けられている。

By · Published

Primary source: Simon Willison's Weblog

Why it matters

Agent products can burn through tokens on reasoning and tool calls. DeepSeek is cutting that variable cost while keeping the weights available for independent deployment.

Illustration of DeepSeek V4 Flash depicted as a robotic hand manipulating symbols of data and value.

DeepSeek、創業者はLiang Wenfeng、は7月31日にDeepSeek-V4-Flash-0731をリリースしました。MITライセンスのモデルと、コーディングエージェントやその他トークン消費の大きいソフトウェアのコスト前提を変えうるほど低いAPI価格を組み合わせたものです。

DeepSeekはこのリリースをV4 Flashの公式版と説明しており、プレビュー用チェックポイントを「大幅に強化されたエージェント能力」に置き換えたとしています。初期の独立評価はその主張の一部を支持しています。Artificial Analysisはモデルの最大推論設定に対してIntelligence Indexスコア50を付け、比較クラス内の101の大規模オープンウェイトモデルの中で3位にランクしました。

この順位が重要なのは、DeepSeekが現在のAPI価格ページによれば、キャッシュミスとなった入力トークン100万トークンあたり$0.14、出力トークン100万トークンあたり$0.28を課金しているためです。キャッシュ済み入力は100万トークンあたり$0.0028に下がります。モデルは100万トークンのコンテキストウィンドウと最大384,000トークンの出力をサポートしており、開発者は長いコーディング、リサーチ、ツール使用のセッションを、すぐにプレミアムなプロプライエタリモデルの経済性を引き受けることなく実行する余地を得ます。

このリリースは、Liangが2023年にDeepSeekを立ち上げて以来追求してきた戦略を拡張するものです:有能なウェイトを公開し、ホスト推論に対して積極的に課金し、外部の開発者に基礎研究を製品化させる。Liangはモデル開発に定量的金融(quantitative finance)を通じてたどり着きました。彼は浙江大学で情報通信工学を学び、その後High-Flyerを共同設立しました。

その経歴は効率性への注力を説明する助けになります。定量トレーディングはスループット、レイテンシ、コストの大規模改善に報いるからです。DeepSeekのモデル作業は同じ規律を推論に適用しており、トークン価格のわずかな違いがエージェントがデモに留まるか実用的な製品になるかを左右し得ます。

ベンチマークのケースは強力だが注意点もある

独立開発者のSimon Willisonはモデルの価格対性能の位置付けを、7月31日の投稿で強調しました。彼はArtificial AnalysisがV4 FlashをMiniMax M3より上位にランク付けした点を指摘し、測定された知能単位あたりの価値で有力な候補であると述べました。

Willisonはまた、推論設定が開発者に実際に返される出力に影響するという有益な注意喚起も行いました。V4 FlashをOpenRouterでデフォルトの推論レベルで実行すると、自転車に乗るペリカンの破綻したイラストが生成されました。reasoning_efforthighに上げると、鳥が認識可能な自転車に座っている一貫した画像が生成されました。

この実験は逸話的ですが、集計されたリーダーボードが隠しがちな運用上のトレードオフを露呈しています。DeepSeekの最も強力なサードパーティ結果は最大推論設定から得られており、より多くの出力トークンと時間を消費する可能性があります。DeepSeekの低いトークン価格は追加計算に対する金銭的ペナルティを低くしますが、開発者は自分たちのワークフロー内でレイテンシと信頼性をテストする必要があります。

DeepSeekのモデルカードも注意深く読む必要があります。モデルカードにはV4 FlashがTerminal-Bench 2.1で82.7、DeepSWEで54.4、Toolathlon-Verifiedで70.3を記録したとあります。DeepSeekはモデルカードによれば後で公開されるDeepSeek Harnessの最小バージョンを用いて公開コーディングエージェント評価を実行しました。報告された他の2つの結果、DSBench-FullStackとDSBench-Hardは内部のDeepSeekテストセットを使用しています。これらの数値は外部で完全に再現可能な検証というより、DeepSeek自身の評価セットアップを記述するものです。

サイズの数値も情報源によって異なります。Hugging Face のリポジトリは3040億パラメータと報告していますが、Artificial Analysisは総パラメータ2840億、トークンごとに13億のアクティブパラメータと記載しています。DeepSeekは公式チェックポイントが以前のFlashモデルと同じ構造を使用し、DSparkのスペキュレイティブ・デコーディングモジュールが付属していると述べています。メモリ要件を比較する構築者は、ソース固有の測定値を分けて考慮すべきです。

オープンウェイトでも依然として本格的なハードウェアが必要

MITライセンスは開発者にV4 Flashの検査、改変、サーブする広範な自由を与えます。とはいえ、デプロイは依然としてインフラのプロジェクトです。Hugging Faceのファイルはおおよそ167GBを占めます。より小さな量子化はアクセスを広げる可能性がありますが、公式チェックポイントはコンパクトなコーディングモデルを魅力的にした単純なラップトップワークフローからははるかに外れています。

この区別はモデルを自分で動かそうと考えている開発者にとって重要です。DeepSeekは別のレイヤーを狙っています:大規模なmixture-of-expertsモデルを管理する代わりに、より強力なエージェント性能とデプロイの制御を得たい開発者やインフラ提供者です。

セルフホスティングはまた、米国企業にとってDeepSeekのホストサービスにプロンプトを送信せずにウェイトを評価するルートを提供します。その分離は、データの居住性、調達、セキュリティ要件が厳しい組織にとって重要になります。オープンウェイトは信頼に関する疑問を残しますが、エンジニアリングチームに自分たちが管理するインフラ内でモデルを検査・運用する手段を与えます。

Liangの価格にかける賭け

DeepSeekの安価なAPIは、モデルベンダーがエージェントによる消費の増加を期待する地点で圧力を生みます。コーディングシステム、リサーチエージェント、自動化された業務プロセスは、長いプロンプト、繰り返し行われるツール呼び出し、大きな推論トレースを生み出す可能性があります。プロプライエタリモデルの価格が高いと、そうしたループは製品が意味のあるスケールに達する前に予測不能な請求を生むことがあります。

Liangは創業者に別の道を提供しています:DeepSeekのホストエンドポイントを使って異常に安価な推論を利用するか、MITライセンスのウェイトを取得して独自に運用するか、です。

DeepSeek-V4-Flash-0731は依然として実際のリポジトリ、長時間稼働するエージェント、プロダクションのツールチェーン全体でのより広範なテストを必要としています。Liangは多くの最先端プロバイダーが課すトークン価格のごく一部で高得点のオープンウェイトモデルを市場に出し、競合他社に対して各エージェントアクションに付随するプレミアムを正当化するよう迫っています。

Reader comments

Conversation for this story loads after sign-in.