【DeepSeek-V4-Flash】上位モデルを超える再学習の衝撃!エージェント性能・料金・使い方を徹底解説

DeepSeek-V4-Flash 上位 モデル 超える 再学習 衝撃 エージェント 性能 料金 使い方 徹底 解説
押さえておきたいポイント
  • DeepSeek-V4-Flashは、総パラメータ数2,840億・アクティブ130億のMoEモデルで、100万トークンのコンテキストに対応
  • ポストトレーニングの刷新だけで上位モデルV4-Pro(Preview)を全ベンチマークで上回ったエージェント特化型の正式リリース
  • MITライセンスかつAPI料金は入力0.14ドル/100万トークンと、最先端クラスの性能を破格のコストで利用可能

2026年7月31日、中国のAIスタートアップDeepSeekは、大規模言語モデル「DeepSeek-V4-Flash」を公開しました!

アーキテクチャを一切変更せず、ポストトレーニングだけで上位モデルのV4-Proを超えたという発表は、AI業界に大きなインパクトを与えました。X上でも「DeepSeekショック再来」と話題になるなど、2026年下半期を代表するモデルリリースとして注目を集めています。

とはいえ、「どんな技術が使われているの?」「本当に性能は高いの?」と疑問に感じている方も多いのではないでしょうか。

この記事では、DeepSeek-V4-Flashの概要から仕組み、ベンチマーク性能、料金体系、具体的な使い方まで徹底的に解説します。ぜひ最後までご覧ください!

\生成AIを活用して業務プロセスを自動化/

tamura

監修者田村 洋樹

株式会社WEEL代表取締役 / 累計25社以上のAIアドバイザリーを担当 / 企業向けセミナー・大学講義でのべ10,000人超に登壇 / 日本HP・インテルなど、大手企業主催カンファレンスへの登壇実績多数。AI導入支援・生成AIを活用した業務改革のプロとして、アドバイザリー・PM・講演者など多面的な立場から企業を支援中。

目次

DeepSeek-V4-Flashとは?

DeepSeek-V4-Flashとは?
参考:https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731

DeepSeek-V4-Flashは、DeepSeek社が開発したDeepSeek-V4シリーズに属する高効率な大規模言語モデル(LLM)です。

モデルの基本スペックとして、総パラメータ数は2,840億、推論時に活性化されるのはわずか130億パラメータというMixture-of-Experts(MoE)アーキテクチャを採用しています。巨大なモデル容量を持ちながら、トークンあたりの計算コストを大幅に抑える設計になっているのが特徴です。コンテキスト長は100万トークンに対応しており、数百ページの技術文書や大規模なコードリポジトリもファイル分割なしで一括処理できます。

DeepSeek-V4-Flashの仕組み
参考:https://arxiv.org/pdf/2606.19348

2026年4月のプレビュー版公開を経て、7月31日にリリースされた正式版が「DeepSeek-V4-Flash-0731」というビルド名で提供されています。このアップデートの最大のポイントは、アーキテクチャもパラメータ数もまったく変えず、ポストトレーニング(事後学習)の刷新だけで劇的な性能向上を実現したことにあります。

具体的には、コーディング・AIエージェント・推論・ツール使用の各領域に特化した再学習パイプラインが導入されました。その結果、同社の上位モデルであるV4-Pro(Preview)を全9項目のエージェントベンチマークで上回るという快挙を達成しています。V4-Proのアクティブパラメータ数は490億なので、約4分の1のパラメータ数で上位モデルを超えたことになるわけです。

API上ではモデル名deepseek-v4-flashを指定するだけで自動的に0731版が呼び出される仕組みになっており、既存のアプリケーションもコード変更なしでアップグレードの恩恵を受けられます。なお、V4-Proの正式リリースは「近日公開予定」とアナウンスされています。

DeepSeek-V4-Flashの仕組み

DeepSeek-V4-Flashは、DeepSeek-V4シリーズ共通のMoE型Transformerアーキテクチャを基盤としたモデルです。

DeepSeek-V4-Flashの仕組み
参考:https://arxiv.org/pdf/2606.19348

アーキテクチャ面での注目点は、大きく3つに整理できます。

ハイブリッドアテンション機構

まず1つめが、ハイブリッドアテンション機構です。Compressed Sparse Attention(CSA)とHeavily Compressed Attention(HCA)を組み合わせることで、100万トークン規模の長文処理を効率よくさばけるようになっています。

技術論文によると、100万トークンのコンテキスト設定下で、前世代のDeepSeek-V3.2と比較して推論FLOPsを約73%削減し、KVキャッシュ使用量は約90%も削減できるとのことです。

Manifold-Constrained Hyper-Connections(mHC)

2つめは、Manifold-Constrained Hyper-Connections(mHC)と呼ばれる、従来の残差結合を強化した新しい接続方式です。学習の安定性と表現力の両立を目指した設計となっています。

Muonオプティマイザー

3つめは、学習にMuonオプティマイザーを採用した点でしょう。1.6兆パラメータ規模のモデル学習における収束速度と安定性の改善に大きく貢献しています。

さらに、0731版にはDSpark投機的デコーディングモジュールが同梱されているのも見逃せません。ドラフトモデルを別途読み込むことなく、1つのフラグ追加だけで投機的デコーディングを有効化できる仕組みで、ユーザーあたりの生成速度が60〜85%向上するとの報告もあるほどです。

DeepSeek-V4-Flashの特徴

DeepSeek-V4-Flashの性能面を見ていきましょう。まず目を引くのが、エージェント系ベンチマークにおけるプレビュー版からの驚異的なスコア向上です。

DeepSeek-V4-Flashの特徴
参考:https://arxiv.org/pdf/2606.19348
スクロールできます
ベンチマークV4-Flash-0731V4-Flash (Preview)V4-Pro (Preview)GLM-5.2Opus 4.8
Terminal Bench 2.182.761.872.181.085.0
NL2Repo54.239.438.548.969.7
Cybergym76.738.752.783.1
DeepSWE54.47.312.846.258.0
Toolathlon-Verified70.349.755.959.976.2
Agents’ Last Exam25.215.816.523.825.7
AutomationBench Public25.110.812.812.927.2
DSBench-FullStack †68.737.041.861.871.6
DSBench-Hard †59.625.831.154.571.7
DeepSeek-V4-Flash-0731のベンチマーク比較(†は内部テストセット)

注目すべきは、全9項目でV4-Pro(Preview)を上回っている点でしょう。特にDeepSWEでは7.3から54.4へと約7.5倍のスコア向上を果たしており、ターミナル操作を伴うコーディングタスクや複数ツールの連携で飛躍的な伸びが確認できます。

独立系ベンチマーク組織のArtificial Analysisによる評価でも、Intelligence Indexのスコアが前世代の40から50へと10ポイント上昇し、GPT-5.6 Luna(max、51点)にわずか1ポイント差まで迫ったと報告されています。ハルシネーション率も11ポイント低下しているため、出力の信頼性が同時に高まっている点も見逃せません。

X上で話題:ローカル実行・量子化モデルの盛り上がり

DeepSeek-V4-Flash-0731のリリース直後から、X上ではローカル実行に挑戦するユーザーの投稿が急速に拡散しているのが印象的です。

今回解説する事例において、弊社がX(旧Twitter)で発見した参考となるツイートを紹介させていただいております。取り下げなどのご連絡は、contact@weel.co.jp からご連絡ください。

量子化ツールを開発するUnsloth AIは、公開当日のうちに4-bit(168GB RAM)や3-bit(110GB RAM)、さらには1-bit(96GB RAM)の量子化モデルをリリースしました。

この投稿をきっかけに、MacBook ProやNVIDIA DGX Sparkなどの個人向けハードウェアでV4-Flash-0731を動かす検証報告がX上で相次いでいます。日本語圏でも「M5 Max・128GBのMacBook Proで量子化モデルを実行し、生成速度35〜39トークン/秒を達成した」という報告が話題になりました。

DeepSeek-V4-Flashの安全性・制約

DeepSeek-V4-Flash-0731のベンチマーク結果は目覚ましいものがありますが、いくつかの重要な制約も理解しておく必要があります。

まず、公開されているエージェント系ベンチマークは全てDeepSeek自身が測定した自社発表値であり、使用されたDeepSeek Harnessというテストフレームワークも2026年8月時点では未公開です。独立系の第三者検証は一部(Artificial Analysisなど)にとどまっており、実運用環境での再現性については十分に確認されていない段階にあります。

また、V4-Flash-0731のAPIステータスは「パブリックベータ」です。同時リクエスト数は2,500件が上限とされており、大規模な本番運用ではスケーラビリティの事前検証が必須です。

DeepSeek-V4-Flashの料金

DeepSeek-V4-Flash-0731は、DeepSeek APIの低コストティアとして提供されています。プレビュー版から料金は据え置きで、正式版への移行後も同じ価格で利用可能です。

スクロールできます
項目V4-FlashV4-Pro
入力(キャッシュミス)0.14ドル / 100万トークン0.435ドル / 100万トークン
入力(キャッシュヒット)0.0028ドル / 100万トークン0.003625ドル / 100万トークン
出力0.28ドル / 100万トークン0.87ドル / 100万トークン
コンテキスト長100万トークン100万トークン
ステータスパブリックベータ(正式版)プレビュー
DeepSeek V4シリーズのAPI料金比較

Artificial Analysisの分析によると、DeepSeek V4-Flash-0731のタスクあたりコストはGPT-5.6 Luna(max)と比較して約60%低いと報告されています。月額サブスクリプションや座席課金は存在せず、純粋な従量課金制です。chat.deepseek.comの無料チャットでも利用可能なので、まずは無料で試してみるのもよいでしょう。

DeepSeek-V4-Flashのライセンス

DeepSeek-V4-Flash-0731はMITライセンスで公開されています。これはオープンソースライセンスの中でも最も制約の少ない部類に入るもので、商用利用・改変・再配布が非常に柔軟に認められています。

スクロールできます
利用用途可否
商用利用⭕️
改変⭕️
再配布⭕️
特許使用⭕️
私的利用⭕️
DeepSeek-V4-Flash-0731のライセンス整理

このライセンス体系は、企業がオンプレミス環境にモデルをデプロイする場合にも大きなメリットとなります。実際、リリース直後からUnslothやvLLMなどのサードパーティが量子化版やサービング設定を公開しており、データ主権を維持したローカル運用のエコシステムが急速に形成されています。クラウドAPIに依存しない運用を検討している企業にとって、MITライセンスのオープンウェイトモデルは有力な選択肢となるでしょう。

DeepSeek-V4-Flashの使い方

DeepSeek-V4-Flash-0731にはいくつかのアクセス方法があります。今回は代表的な3つの方法をステップ・バイ・ステップで紹介します。

DeepSeek APIから利用する

最もシンプルにDeepSeek-V4-Flashを試せる方法です。OpenAI互換のAPIフォーマットに対応しているため、既存のOpenAIクライアントライブラリをそのまま流用できます。

STEP
APIキー取得

まず、DeepSeekの開発者プラットフォームにアクセスし、アカウントを作成してAPIキーを取得します。新規登録時には500万トークン相当の無料クレジットが付与されるので、まずは無料で試すことが可能です。

DeepSeek-V4-Flashの使い方
STEP
モデル呼び出し

次に、取得したAPIキーを環境変数に設定し、以下のPythonコードでリクエストを送信します。

from openai import OpenAI

client = OpenAI(
    base_url="https://api.deepseek.com",
    api_key="YOUR_API_KEY"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "user", "content": "Pythonでフィボナッチ数列を生成する関数を書いてください"}
    ],
    temperature=1.0,
    top_p=0.95
)

print(response.choices[0].message.content)

エージェント用途で利用する場合は、temperature=1.0top_p=0.95が公式の推奨設定です。推論の深さを制御したい場合は、リクエストパラメータでreasoning_effortlowhighmaxのいずれかを指定してください。

vLLMでセルフホストする

自社サーバーやクラウドGPUインスタンス上でモデルをホストしたい場合は、vLLMが推奨される推論フレームワークです。DSpark投機的デコーディングもフラグ1つで有効化できる点が魅力でしょう。

STEP
vLLMをインストール

まず、vLLMのインストールから始めます。

pip install vllm
STEP
モデルをサーブ

続いて、以下のコマンドでモデルをサーブします。4×GB300ノード構成の場合の設定例です。

vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
  --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \
  --data-parallel-size 4 --enable-expert-parallel \
  --moe-backend deep_gemm_mega_moe \
  --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

--speculative-configの部分がDSpark投機的デコーディングを有効にするフラグです。ドラフトモデルの別途読み込みは不要で、チェックポイント内にドラフトモジュールが同梱されています。

サーブが開始されたら、OpenAI互換のエンドポイントが立ち上がるので、curlやPythonクライアントからリクエストを送れます。

SGLangでセルフホストする

もう1つの推論フレームワークとしてSGLangも利用可能です。DSparkはこちらでもサポートされています。

pip install sglang

python3 -m sglang.launch_server \
  --trust-remote-code \
  --model-path deepseek-ai/DeepSeek-V4-Flash-0731 \
  --tp 4 \
  --moe-runner-backend flashinfer_mxfp4 \
  --speculative-algorithm DSPARK \
  --mem-fraction-static 0.90 \
  --chunked-prefill-size 4096

SGLangの場合は--speculative-algorithm DSPARKがDSparkの有効化オプションとなります。サーブ後はポート30000でOpenAI互換APIが利用可能です。

【業界別】DeepSeek-V4-Flashの活用シーン

DeepSeek-V4-Flashはエージェント性能の高さを活かして、さまざまな業界での導入が期待されます。ここからは業界ごとにどのような活用が適しているかを見ていきましょう。

ソフトウェア開発・IT

Terminal Bench 2.1で82.7点、DeepSWEで54.4点というスコアが示すとおり、DeepSeek-V4-Flash-0731はターミナル操作を伴うコーディングタスクに非常に強いモデルです。バグの検出・修正、リポジトリ全体を理解したうえでのコード生成、複数モジュールにまたがるリファクタリングなど、実務レベルのソフトウェア開発を強力にサポートできるでしょう。

Codexへの適応も施されているため、AIコーディングエージェントのバックエンドとしての利用にも適しています。

生成AIを搭載したSaaSについて、詳しく知りたい方は以下の記事も参考にしてみてください。

金融・コンサルティング

100万トークンのコンテキストウィンドウを活かし、膨大な財務レポートや規制文書を一括して読み込んだ上で分析・要約できます。API料金がキャッシュヒット時に0.0028ドル/100万トークンという超低コストのため、大量のドキュメント処理を日常的に回すユースケースでもコストを抑えやすいのがメリットです。

金融業界における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。

研究・学術

Agents’ Last Examで25.2点と、高度な専門知識を要するタスクにも一定の水準で対応します。論文の要約・分析や仮説検証の補助、大規模データセットを対象とした探索的な質問応答など、研究プロセスのさまざまな段階でアシスタントとして活用できるでしょう。

教育業界における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。

【課題別】DeepSeek-V4-Flashが解決できること

続いては、DeepSeek-V4-Flash-0731がどのような課題の解決に向いているかを整理しておきましょう。

高品質なAIエージェントの低コスト運用

エージェント型のAIアプリケーションは、1つのタスクを完了するまでに何度もAPIを呼び出すため、コストがかさみやすいのが課題です。

DeepSeek-V4-Flash-0731は出力トークンが0.28ドル/100万トークンと極めて安価でありながら、エージェントベンチマークで最先端クラスの性能を発揮します。コストと性能のトレードオフに悩んでいた方にとって、有力な解決策となるでしょう。

長大ドキュメントの一括処理

100万トークンのコンテキストに対応しているため、数百ページ規模の契約書、技術文書、議事録などを分割せずにそのまま入力できます。ドキュメントの分割・結合にかかる前処理の手間が不要になり、ワークフロー全体の効率化につながります。

データ主権を維持したAI活用

MITライセンスかつオープンウェイトのため、機密データを外部クラウドに送信せずオンプレミスで運用できます。量子化モデルを使えば、110GB程度のRAMで動作するため、NVIDIA DGX Sparkのような個人向けワークステーションでもデプロイ可能です。

DeepSeek-V4-Flashを使ってみた

それでは、実際にDeepSeek-V4-Flash-0731をAPI経由で試してみましょう。ここでは、本モデルの強みであるエージェント的な思考能力を検証するため、複数の要件を含む複雑なコード生成タスクを投げてみました。

検証:複数ステップのCLIツール生成

「使い方」セクションで紹介したDeepSeek APIのPythonコードを使い、messagesのプロンプト部分を以下の内容に差し替えて実行します。reasoning_effortlowを指定しました。

コードはこちら
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.deepseek.com",
    api_key=os.environ["DEEPSEEK_API_KEY"]
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": "あなたは優秀なPythonエンジニアです。必ず日本語で回答してください。"},
        {"role": "user", "content": """以下の仕様を満たすPythonのCLIツールを設計・実装してください。
- CSVファイルを読み込み、指定カラムの統計情報(平均・中央値・標準偏差・最大・最小)を計算する
- 結果をMarkdownテーブル形式で標準出力に表示する
- argparseでファイルパス、対象カラム名、出力形式(markdown/json)を受け取る
- エラーハンドリング(ファイル不在、カラム不在、非数値データ)も実装する"""}
    ],
    temperature=1.0,
    top_p=0.95,
    extra_body={"reasoning_effort": "low"}
)

print(response.choices[0].message.content)
DeepSeek-V4-Flashを使ってみた

出力結果(一部抜粋)はこちら

上記のコードをターミナルで実行すると、約10秒程度でargparseの引数解析からCSV読み込み、統計計算、Markdownテーブル出力、JSONオプション対応、エラーハンドリングまで含んだ150行程度の完動するPythonスクリプトが返ってきました。

DeepSeek-V4-Flashを使ってみた

出力されたコードをそのままtest.pyファイルとして保存して実行してみたところ、テスト用のCSVファイルに対して正常に統計値が計算され、Markdown形式で見やすく出力されました。エラーハンドリングも適切に動作し、存在しないカラムを指定した場合には明確なエラーメッセージが表示されるのも好印象です。

また、今回の検証によるコストは0.01ドル以下でした。

よくある質問

最後に、DeepSeek-V4-Flashに関して、多くの方が疑問に感じるポイントをQ&A形式でまとめました。

DeepSeek-V4-FlashとDeepSeek-V4-Pro(Preview)はどちらが優秀ですか?

2026年7月31日時点のベンチマーク結果では、エージェント系の9項目全てでV4-Flash-0731がV4-Pro(Preview)を上回っています。ただし、V4-Proはまだプレビュー版の段階で、エージェント特化のポストトレーニングを受けていません。

V4-Proの正式版がリリースされた段階で、あらためて比較する必要があるでしょう。

無料で使えますか?

はい、chat.deepseek.comの無料チャットで利用できます。API経由でも新規アカウント登録時に500万トークン相当の無料クレジットが付与されるため、まずは無料枠で試すことが可能です。

無料枠を超えた場合は、入力0.14ドル・出力0.28ドル/100万トークンの従量課金となります。

ローカル環境で動かせますか?

はい、MITライセンスでモデルウェイトが公開されているため、ローカル実行が可能です。Unslothの量子化モデルを使えば、4-bitで168GB RAM、3-bitで110GB RAM、1-bitで96GB RAMが目安です。

vLLMやSGLangなどの推論フレームワークを使ったセルフホストにも対応しています。

DeepSeek-V4-Flashでエージェント開発の新時代を体感しよう!

DeepSeek-V4-Flash-0731は、アーキテクチャを一切変更せずにポストトレーニングだけで上位モデルを超えるという、AI開発における新たなアプローチを示したモデルです。130億パラメータの活性化で最先端クラスのエージェント性能を実現しながら、API料金は入力0.14ドル/100万トークンという破格のコスト設定になっています。

MITライセンスによるオープンウェイト公開も大きな強みで、クラウドAPIからの利用はもちろん、オンプレミス環境でのセルフホストまで柔軟に選択できます。エージェント型AIアプリケーションの開発や、大規模ドキュメント処理の効率化を検討している方は、ぜひ一度DeepSeek-V4-Flashを試してみてはいかがでしょうか。

最後に

いかがだったでしょうか?

弊社では、AI導入を検討中の企業向けに、業務効率化や新しい価値創出を支援する情報提供・導入支援を行っています。最新のAIを活用し、効率的な業務改善や高度な分析が可能です。

「生成AIで新しいプロダクトを作りたい」「もっと本格的に生成AIを業務に組み込みたい」とお考えの方は、ぜひ株式会社WEELにご相談ください。

開発実績として、

・新規事業室での「リサーチ」「分析」「事業計画検討」を70%自動化するAIエージェント
・社内お問い合わせの1次回答を自動化するRAG型のチャットボット
・過去事例や最新情報を加味して、10秒で記事のたたき台を作成できるAIプロダクト
・お客様からのメール対応の工数を80%削減したAIメール
・サーバーやAI PCを活用したオンプレでの生成AI活用
・生徒の感情や学習状況を踏まえ、勉強をアシストするAIアシスタント

などの開発実績がございます。

生成AIを活用したプロダクト開発の支援内容は、以下のページでも詳しくご覧いただけます。
➡︎株式会社WEELのサービスを詳しく見る。

アイデア段階でも構いません。まずは無料相談でお気軽にご相談ください。
➡︎生成AIを活用したプロダクト開発・業務効率化について相談する

大規模言語モデル(LLM)比較レポート
LLM比較レポート

「生成AIを社内で活用したい」「生成AIの事業をやっていきたい」という方に向けて、生成AI社内セミナー・勉強会をさせていただいております。

セミナー内容や料金については、ご相談ください。

また、大規模言語モデル(LLM)を対象に、言語理解能力、生成能力、応答速度の各側面について比較・検証した資料も配布しております。この機会にぜひご活用ください。

  • URLをコピーしました!
  • URLをコピーしました!
目次