DeepSeek V4 Flashアップデート:パラメータ削減でコード能力向上

2026-08-20
DeepSeek V4 Flash 0731 is now in public beta. Code and agent benchmarks jumped across the board, surpassing V4 Pro Preview with one-sixth the parameters.
DeepSeekが7月31日にV4-Flash正式版(0731)のAPI公開テストを開始した。今回のDeepSeek V4アップデートでは、モデル構造も総パラメータ数も変わらない。変わったのは後訓練だけだ。それでも9つのAgentベンチマークで前回のV4-Pro Previewを全面的に上回った。284B総パラメータ、13B活性化パラメータの軽量モデルが、1.6Tパラメータの旗艦プレビュー版を0から逆転した。DeepSeek V4 コード能力の向上は、パラメータ拡大ではなく後訓練の改善で実現した。
DeepSeek V4 Flash 0731の核心変更:後訓練でAgent能力を強化
V4-Flash-0731はモデルアーキテクチャもサイズもPreview版と完全に一致している。2840億総パラメータ、130億活性化パラメータのMoE構造、100万トークンコンテキスト、384K最大出力。何も変わっていない。変更されたのは後訓練のやり直しだけである。
DeepSeekは公式モデルカードで、今回の性能向上がモデル規模の拡大ではなく、後訓練データの質と訓練戦略の改善によるものだと明記している。GRPOアルゴリズムと二段階強化学習を通じ、モデルにタスク分解、ツール呼び出し、コード実行を模擬Agent環境で学ばせた。訓練の重心が「知識記憶」から「タスク実行」へ移った。
これが意味するのは、パラメータを増やさなくても、後訓練の設計次第でAgent能力が大幅に向上するということだ。モデルの「体」はそのままに、「脳」だけを入れ替えた結果となる。
ベンチマーク一覧:V4 Flash正式版がV4 Pro Previewを全面超越
以下の表はDeepSeek V4 Flash 0731の9項目ベンチマークスコアを、Preview版、V4-Pro Preview、GLM-5.2、Claude Opus 4.8と比較したものだ。公式モデルカードおよびDeepSeek公式発表に基づく。
| ベンチマーク | V4 Flash 0731 | V4 Flash Preview | V4-Pro Preview | GLM-5.2 | Opus 4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| CyberGym | 76.7 | 38.7 | 52.7 | 83.1 | |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench | 25.1 | 10.8 | 13.5 | 12.9 | 27.2 |
| DSBench-FullStack | 68.7 | 37.0 | 61.8 | 71.6 | |
| DSBench-Hard | 59.6 | 25.8 | 54.5 | 71.7 |
各ベンチマークが測る能力を簡単に解説する。Terminal Bench 2.1はモデルに実際のLinuxターミナルを与え、ソフトウェア設定やシステム管理、スクリプト作成などを自律的に実行させるテストだ。DeepSWEはGitHub Issueの修正を通じて、コードリポジトリ理解と多段階修正能力を測る。NL2Repoは自然言語からコードリポジトリを生成する能力、CyberGymはネットワークセキュリティの攻防シミュレーション、Toolathlon Verifiedは複数ツールのオーケストレーション能力を評価する。
DeepSeek V4 コード能力:なぜ13B活性化で49Bを超えられたか
DeepSWEのスコアが7.3から54.4へ跳ね上がったのは、今回の更新で最も目を引く数字だ。Preview版では事実上「使えない」レベルだった長程ソフトウェアエンジニアリングタスクが、正式版では実用域に達した。41.6点差はV4 Flash PreviewとV4-Pro Previewの差(5.5点)と比較にならない。
これだけの跳躍が後訓練だけで実現した理由は二つある。第一に、DeepSeekが今回初めて自研のAgentフレームワーク「DeepSeek Harness」の極簡モードをベンチマークに投入した。モデル層とAgent実行環境の深層連携优化で、タスクの分解とツール呼び出しの精度が向上した。Harnessのコードは今後オープンソース化される予定だ。第二に、後訓練データの質である。Agentタスクのシミュレーション環境でモデルに実際のタスクを実行させ、その軌跡から学習させる手法が強化学習の効果を最大化した。
Agents' Last Exam(ALE)では25.2点を記録し、Claude Opus 4.8の25.7点とわずか0.5点差になった。総合Agent能力でトップクラスのクローズドモデルとほぼ同点である。ただしNL2Repoでは15.5点差、DSBench-Hardでは12.1点差が残っており、コードリポジトリ理解と高難度の長鎖タスクではOpus 4.8に分がある。
V4 Flash正式版 vs V4 Pro Preview:6分の1のパラメータで逆転
V4-Pro Previewは1.6T総パラメータ、49B活性化パラメータの旗艦モデルだ。V4-Flashは284B総パラメータ、13B活性化パラメータ。総パラメータで約6分の1、活性化パラメータで約4分の1にあたる。
それでも9項目すべてでV4-Pro Previewを上回った。Terminal Bench 2.1で82.7対72.1(10.6点差)、DeepSWEで54.4対12.8(41.6点差)、CyberGymで76.7対52.7(24点差)。Agent能力において、パラメータ規模の優位性が後訓練の質によって覆された形だ。
V4-Pro Previewは4月24日に公開された際、Agentic Coding評価でオープンソースモデル最高成績を記録した。HuggingFaceでMITライセンスで公開され、100万トークンコンテキストをサポートする。しかしPreview版はあくまでプレビューであり、正式版のV4-Proはまだ公開されていない。DeepSeekは「近く公開する」と述べているが、具体的な時期は未定だ。
DeepSeek APIの価格とCodex対応
V4-Flash 0731のAPI価格はPreview版から変わっていない。入力100万トークン0.14ドル、出力0.28ドル。キャッシュ命中時は入力0.02ドルまで下がる。Claude Opus 4.8の出力価格が100万トークン25ドルだから、出力単価で約90分の1だ。
DeepSeekのキャッシュ命中率は約98%に達する。業界平均の90%と比較しても高く、これが実際の利用コストをさらに押し下げている。Artificial Analysisの計算では、V4-Flashのタスクあたり平均コストは3セント。Claude Opus 4.8の同テストで3752ドルかかったものが、V4-Flashでは72ドルで完了する。
今回のもう一つの重要な変更は、Responses APIのネイティブサポートだ。従来のChat Completions形式に加え、OpenAIのResponses API形式に直接対応した。これにより、Codex CLI、VS Code拡張、ChatGPTデスクトップ版などのOpenAIエコシステムのツールにDeepSeek V4 Flashを直接接続できる。以前はCC SwitchやMoon Bridgeなどの変換レイヤーが必要だったが、それが不要になった。
V4-ProのResponses API対応は2026年8月初頭に予定されている。現在Responses APIを使えるのはV4-Flash正式版のみだ。
今回のDeepSeek V4 変更点:AppとWeb版は未更新
今回のDeepSeek アップデートはAPI層のみに適用される。DeepSeek App、Web版(chat.deepseek.com)で使用されているモデルは変更されていない。Appユーザーが今回の向上を体験するには、API経由で利用するか、Codexなどの開発ツール経由で使う必要がある。
これは多くの一般ユーザーには見えない変更だ。DeepSeek Appの「エキスパートモード」と「クイックモード」はそれぞれV4-ProとV4-Flashに対応しているが、今回更新されたのはAPI版のV4-Flashのみ。App版のモデル切り替え時期は公式からアナウンスされていない。
DeepSeek V4 APIを使いたい開発者は、既存のbase_urlをそのまま使用し、モデル名をdeepseek-v4-flashに指定するだけで0731版にアクセスできる。Codexへの接続は公式設定スクリプトが提供されており、macOSとLinuxではワンコマンドで完了する。DeepSeek APIの価格がここまで低く維持される理由は何か。答えはキャッシュ命中率にある。
DeepSeek V4 Pro正式版への期待
V4-Flash正式版がここまでの性能を見せたことで、V4-Pro正式版に対する期待が高まっている。Flash版の13B活性化パラメータでこれだけのAgent能力を出せるなら、49B活性化パラメータを持つPro正式版はどこまで到達するのか。
一方で、V4-Flash正式版の性能向上にはトレードオフもある。 Terminal BenchやAgent系タスクではOpus 4.8に迫る一方、NL2RepoやDSBench-Hardのような複雑なコード理解と長鎖推論を要するタスクではまだ明確な差がある。Pro Previewは世界知識と高難度AgentタスクでPro本来の厚みを示していた分、Flash正式版はAgent特化型としての性格をより強めた。
DeepSeekの戦略は明確だ。FlashでAgent特化と極端なコスト優位を先に確立し、Pro正式版で汎用能力の天井を押し上げる。V4-Pro Previewが4月時点でAgentic Codingでオープンソース最高水準だったことを考えると、Pro正式版の到達点は見逃せない。
DeepSeek V4 benchmark全体を見ると、Flash正式版はAgent系タスクでトップクラスに肉薄している。DeepSeek 新バージョンの意味するところは大きい。パラメータ規模ではなく、後訓練の質がAgent能力を決めるという実証だ。
DeepSeek V4 Flash 0731のAPI公開テストは現在進行中だ。APKPureからDeepSeekアプリをダウンロードすれば、V4-Flashの非思考モードとV4-Proの思考モードをアプリ上で体験できる。API経由のCodex連携やカスタムAgent構築を試したい開発者は、DeepSeek PlatformでAPIキーを取得してすぐに始められる。
- Android 用の『イカゲーム:地獄のデスマッチ』APK 0.0.7575 の最新バージョンをダウンロードする方法
- Android 用の最新バージョンの 「グッドコーヒー、グレートコーヒー」APK 0.1.2 をダウンロードする方法
- Android で PVZ Fusion APK をダウンロードする方法