Our website uses necessary cookies to enable basic functions and optional cookies to help us to enhance your user experience. Learn more about our cookie policy by clicking "Learn More".
Accept All Only Necessary Cookies
NEWSREVIEWSHOWTO

DeepSeek V4 Flashアップデート:パラメータ削減でコード能力向上

Mani Naghshbandi

DeepSeek V4 Flash 0731 is now in public beta. Code and agent benchmarks jumped across the board, surpassing V4 Pro Preview with one-sixth the parameters.

カタログ

    DeepSeekが7月31日にV4-Flash正式版(0731)のAPI公開テストを開始した。今回のDeepSeek V4アップデートでは、モデル構造も総パラメータ数も変わらない。変わったのは後訓練だけだ。それでも9つのAgentベンチマークで前回のV4-Pro Previewを全面的に上回った。284B総パラメータ、13B活性化パラメータの軽量モデルが、1.6Tパラメータの旗艦プレビュー版を0から逆転した。DeepSeek V4 コード能力の向上は、パラメータ拡大ではなく後訓練の改善で実現した。

    DeepSeek V4 Flash 0731の核心変更:後訓練でAgent能力を強化

    V4-Flash-0731はモデルアーキテクチャもサイズもPreview版と完全に一致している。2840億総パラメータ、130億活性化パラメータのMoE構造、100万トークンコンテキスト、384K最大出力。何も変わっていない。変更されたのは後訓練のやり直しだけである。

    DeepSeekは公式モデルカードで、今回の性能向上がモデル規模の拡大ではなく、後訓練データの質と訓練戦略の改善によるものだと明記している。GRPOアルゴリズムと二段階強化学習を通じ、モデルにタスク分解、ツール呼び出し、コード実行を模擬Agent環境で学ばせた。訓練の重心が「知識記憶」から「タスク実行」へ移った。

    これが意味するのは、パラメータを増やさなくても、後訓練の設計次第でAgent能力が大幅に向上するということだ。モデルの「体」はそのままに、「脳」だけを入れ替えた結果となる。

    ベンチマーク一覧:V4 Flash正式版がV4 Pro Previewを全面超越

    以下の表はDeepSeek V4 Flash 0731の9項目ベンチマークスコアを、Preview版、V4-Pro Preview、GLM-5.2、Claude Opus 4.8と比較したものだ。公式モデルカードおよびDeepSeek公式発表に基づく。

    ベンチマークV4 Flash 0731V4 Flash PreviewV4-Pro PreviewGLM-5.2Opus 4.8
    Terminal Bench 2.182.761.872.181.085.0
    NL2Repo54.239.438.548.969.7
    CyberGym76.738.752.783.1
    DeepSWE54.47.312.846.258.0
    Toolathlon Verified70.349.755.959.976.2
    Agents' Last Exam25.215.816.523.825.7
    AutomationBench25.110.813.512.927.2
    DSBench-FullStack68.737.061.871.6
    DSBench-Hard59.625.854.571.7

    各ベンチマークが測る能力を簡単に解説する。Terminal Bench 2.1はモデルに実際のLinuxターミナルを与え、ソフトウェア設定やシステム管理、スクリプト作成などを自律的に実行させるテストだ。DeepSWEはGitHub Issueの修正を通じて、コードリポジトリ理解と多段階修正能力を測る。NL2Repoは自然言語からコードリポジトリを生成する能力、CyberGymはネットワークセキュリティの攻防シミュレーション、Toolathlon Verifiedは複数ツールのオーケストレーション能力を評価する。

    DeepSeek V4 コード能力:なぜ13B活性化で49Bを超えられたか

    DeepSWEのスコアが7.3から54.4へ跳ね上がったのは、今回の更新で最も目を引く数字だ。Preview版では事実上「使えない」レベルだった長程ソフトウェアエンジニアリングタスクが、正式版では実用域に達した。41.6点差はV4 Flash PreviewとV4-Pro Previewの差(5.5点)と比較にならない。

    これだけの跳躍が後訓練だけで実現した理由は二つある。第一に、DeepSeekが今回初めて自研のAgentフレームワーク「DeepSeek Harness」の極簡モードをベンチマークに投入した。モデル層とAgent実行環境の深層連携优化で、タスクの分解とツール呼び出しの精度が向上した。Harnessのコードは今後オープンソース化される予定だ。第二に、後訓練データの質である。Agentタスクのシミュレーション環境でモデルに実際のタスクを実行させ、その軌跡から学習させる手法が強化学習の効果を最大化した。

    Agents' Last Exam(ALE)では25.2点を記録し、Claude Opus 4.8の25.7点とわずか0.5点差になった。総合Agent能力でトップクラスのクローズドモデルとほぼ同点である。ただしNL2Repoでは15.5点差、DSBench-Hardでは12.1点差が残っており、コードリポジトリ理解と高難度の長鎖タスクではOpus 4.8に分がある。

    V4 Flash正式版 vs V4 Pro Preview:6分の1のパラメータで逆転

    V4-Pro Previewは1.6T総パラメータ、49B活性化パラメータの旗艦モデルだ。V4-Flashは284B総パラメータ、13B活性化パラメータ。総パラメータで約6分の1、活性化パラメータで約4分の1にあたる。

    それでも9項目すべてでV4-Pro Previewを上回った。Terminal Bench 2.1で82.7対72.1(10.6点差)、DeepSWEで54.4対12.8(41.6点差)、CyberGymで76.7対52.7(24点差)。Agent能力において、パラメータ規模の優位性が後訓練の質によって覆された形だ。

    V4-Pro Previewは4月24日に公開された際、Agentic Coding評価でオープンソースモデル最高成績を記録した。HuggingFaceでMITライセンスで公開され、100万トークンコンテキストをサポートする。しかしPreview版はあくまでプレビューであり、正式版のV4-Proはまだ公開されていない。DeepSeekは「近く公開する」と述べているが、具体的な時期は未定だ。

    DeepSeek APIの価格とCodex対応

    V4-Flash 0731のAPI価格はPreview版から変わっていない。入力100万トークン0.14ドル、出力0.28ドル。キャッシュ命中時は入力0.02ドルまで下がる。Claude Opus 4.8の出力価格が100万トークン25ドルだから、出力単価で約90分の1だ。

    DeepSeekのキャッシュ命中率は約98%に達する。業界平均の90%と比較しても高く、これが実際の利用コストをさらに押し下げている。Artificial Analysisの計算では、V4-Flashのタスクあたり平均コストは3セント。Claude Opus 4.8の同テストで3752ドルかかったものが、V4-Flashでは72ドルで完了する。

    今回のもう一つの重要な変更は、Responses APIのネイティブサポートだ。従来のChat Completions形式に加え、OpenAIのResponses API形式に直接対応した。これにより、Codex CLI、VS Code拡張、ChatGPTデスクトップ版などのOpenAIエコシステムのツールにDeepSeek V4 Flashを直接接続できる。以前はCC SwitchやMoon Bridgeなどの変換レイヤーが必要だったが、それが不要になった。

    V4-ProのResponses API対応は2026年8月初頭に予定されている。現在Responses APIを使えるのはV4-Flash正式版のみだ。

    今回のDeepSeek V4 変更点:AppとWeb版は未更新

    今回のDeepSeek アップデートはAPI層のみに適用される。DeepSeek App、Web版(chat.deepseek.com)で使用されているモデルは変更されていない。Appユーザーが今回の向上を体験するには、API経由で利用するか、Codexなどの開発ツール経由で使う必要がある。

    これは多くの一般ユーザーには見えない変更だ。DeepSeek Appの「エキスパートモード」と「クイックモード」はそれぞれV4-ProとV4-Flashに対応しているが、今回更新されたのはAPI版のV4-Flashのみ。App版のモデル切り替え時期は公式からアナウンスされていない。

    DeepSeek V4 APIを使いたい開発者は、既存のbase_urlをそのまま使用し、モデル名をdeepseek-v4-flashに指定するだけで0731版にアクセスできる。Codexへの接続は公式設定スクリプトが提供されており、macOSとLinuxではワンコマンドで完了する。DeepSeek APIの価格がここまで低く維持される理由は何か。答えはキャッシュ命中率にある。

    DeepSeek V4 Pro正式版への期待

    V4-Flash正式版がここまでの性能を見せたことで、V4-Pro正式版に対する期待が高まっている。Flash版の13B活性化パラメータでこれだけのAgent能力を出せるなら、49B活性化パラメータを持つPro正式版はどこまで到達するのか。

    一方で、V4-Flash正式版の性能向上にはトレードオフもある。 Terminal BenchやAgent系タスクではOpus 4.8に迫る一方、NL2RepoやDSBench-Hardのような複雑なコード理解と長鎖推論を要するタスクではまだ明確な差がある。Pro Previewは世界知識と高難度AgentタスクでPro本来の厚みを示していた分、Flash正式版はAgent特化型としての性格をより強めた。

    DeepSeekの戦略は明確だ。FlashでAgent特化と極端なコスト優位を先に確立し、Pro正式版で汎用能力の天井を押し上げる。V4-Pro Previewが4月時点でAgentic Codingでオープンソース最高水準だったことを考えると、Pro正式版の到達点は見逃せない。

    DeepSeek V4 benchmark全体を見ると、Flash正式版はAgent系タスクでトップクラスに肉薄している。DeepSeek 新バージョンの意味するところは大きい。パラメータ規模ではなく、後訓練の質がAgent能力を決めるという実証だ。

    DeepSeek V4 Flash 0731のAPI公開テストは現在進行中だ。APKPureからDeepSeekアプリをダウンロードすれば、V4-Flashの非思考モードとV4-Proの思考モードをアプリ上で体験できる。API経由のCodex連携やカスタムAgent構築を試したい開発者は、DeepSeek PlatformでAPIキーを取得してすぐに始められる。

    Back to top

    Featured lists

    NEWSNEWSREVIEWSREVIEWSHOWTOHOWTO
    最新ニュース
    Brawl Stars コード(2026年9月)
    Suno AIの使い方:完全ガイド , 初心者向けプロンプト・歌詞作成・3つのモード解説
    Claude Coworkとは:AIデスクトップエージェントの機能と使い方を解説
    Claude Designとは:AIデザイン機能解説
    トップニュース
    勝利の女神:NIKKEニケ高質HD壁紙ダウンロード
    ハンティゾンビ ロブロックス (Roblox) コード 2025 年 9 月
    Null's Brawl(ヌルブロスタ)アップデート 62.264: 新しいブロウラー、ゲームモード、ダウンロード方法
    マインクラフト「Minecraft」  1.20アップデートに追加されるものを詳細に掲載します。さあ、チェックしてみましょう!
    Minecraft パッチノート 1.21.21 APK
    Null's Brawl ヌルブロスタ 64.226: 新ブロウラー、ゲームモード、ダウンロード方法
    ちいかわぽけっと事前登録開始!特典や登録方法を徹底解説
    Minecraft 1.21.22 アップデート パッチノート
    APKPureをを購読する
    最高のAndroidゲームアプリの最新リリースやニュースやガイドなどの情報にいち早くアクセスすることができます。
    いいえ結構です
    購読
    購読完了!
    APKPureの購読が完了しました。