AI総合研究所

SHARE

X(twiiter)にポストFacebookに投稿はてなブックマークに登録URLをコピー

DeepSeek V4-Flashとは?0731ビルドの性能や料金、ローカル運用まで徹底解説

この記事のポイント

  • 2026年7月31日公開の0731ビルドは、アーキテクチャそのままの再事後学習で9つの公式ベンチ全てで自社上位のV4-Proプレビューを上回った
  • API単価は入力$0.14/出力$0.28(100万トークンあたり)とV4-Proの1/3水準、キャッシュヒットは$0.0028まで下がる
  • 公式Responses APIをネイティブサポートし、DeepSeek公式のCodex統合スクリプト(models.json+config.toml配置)で既存Codex CLI環境から乗り換え可能
  • 0731ビルドの重みもMITライセンスでHugging Face公式に公開済み、Preview版と同じMoE 284B・アクティブ13B構造を継承。Unslothの0731専用GGUF(UD-Q4_K_XL 約155GB〜UD-IQ1_S 約82.5GB)も8月1日に整備済み
  • 公式ベンチはDeepSeek自社ハーネスによる計測で、第三者検証はArtificial Analysis Intelligence Index 50点まで
坂本 将磨

監修者プロフィール

坂本 将磨

XでフォローフォローするMicrosoftMVP

Microsoft MVP・AIパートナー。LinkX Japan株式会社 代表取締役。東京工業大学大学院にて自然言語処理・金融工学を研究。NHK放送技術研究所でAI・ブロックチェーンの研究開発に従事し、国際学会・ジャーナルでの発表多数。経営情報学会 優秀賞受賞。シンガポールでWeb3企業を創業後、現在は企業向けAI導入・DX推進を支援。

DeepSeek V4-Flash(ディープシーク・ブイフォー・フラッシュ)は、DeepSeekが2026年4月にMITライセンスで公開した、総パラメータ284B・アクティブ13BのMoE(Mixture-of-Experts)型オープンウェイトLLMです。

2026年7月31日には再事後学習を施した「0731ビルド」がAPI公開ベータで解禁され、DeepSeekが公開した9つのエージェント・コーディング系ベンチマークで自社上位のV4-Proプレビューを上回りました。

本記事では、0731ビルドで何が変わったか、公式9ベンチと第三者評価の位置づけ、API料金と時間帯別課金の現状、公式Responses APIとローカル運用の手順、V4-ProやQwen 3.6・Claude Opus 5との使い分けまで、2026年8月時点の最新情報で解説します。

目次

DeepSeek V4-Flashとは?V4-Proより軽く安価なMoE型オープンウェイトLLM

V4-Flashのオープンウェイトエコシステムでの位置づけ

V4-Flashアップデート版の主な変更点

アーキテクチャは同一・事後学習だけを再設計

Responses APIとCodexへのネイティブ対応

9ベンチで自社上位モデルを上回った「逆転」

公式ベンチマークと第三者評価——数字の読み解き方

DeepSeek公式9ベンチのスコア一覧

第三者ベンチ——Artificial Analysis Intelligence Index 50

公式ベンチを実務でどう扱うか

DeepSeek V4-FlashのAPI料金と時間帯別課金の現状

V4-Flash・V4-Proの標準単価表

プロンプトキャッシュ98%割引という設計

時間帯別課金(ピーク/オフピーク)は施行日未確定

DeepSeek V4-Flash APIの使い方

前提条件——DeepSeek APIキーの取得

OpenAI互換Chat Completions APIでの基本呼び出し

Codex CLIへのDeepSeek統合設定

DeepSeek V4-Flashをローカルで動かす方法

提供されている量子化バリアント

ローカル推論に必要なハードウェア要件

対応推論エンジン——vLLM・SGLang・llama.cpp・Ollama

0731ビルドの公式配布状況

V4-Proや他のオープンウェイトLLMとの使い分け

主要オープンウェイトLLM・商用モデルとの比較表

ケース別の使い分け——実務での判断軸

V4-Flash導入で見落としやすい3つの観点

データ主権・データ保護の観点

ベンダー自社ベンチへの過度な依存

ローカル運用に必要なハードウェア投資が大きい

V4-Flashを含む複数LLMを業務プロセスに定着させるなら

まとめ

DeepSeek V4-Flashとは?V4-Proより軽く安価なMoE型オープンウェイトLLM

DeepSeek V4-Flash(ディープシーク・ブイフォー・フラッシュ)とは、中国のAIスタートアップDeepSeekが2026年4月24日にMITライセンスで公開した、総パラメータ284B・アクティブ13BのMoE(Mixture-of-Experts)型オープンウェイトLLMです。

同シリーズにはフラッグシップのDeepSeek V4-Pro(総1.6T・アクティブ49B)が並列で用意されており、V4-FlashはPro比で1/3以下の単価・軽い推論負荷を担う「高スループット・低コスト」ラインです。

2026年7月31日には再事後学習を施したV4-Flashのアップデート版が公開され、DeepSeek公表の9ベンチで上位モデルのV4-Proプレビューを上回るという逆転現象が話題を呼びました。Responses APIとCodex互換のインタフェースもネイティブ対応しています。

DeepSeek V4-Flashとは?V4-Proより軽く安価なMoE型オープンウェイトLLM

V4-Flashのオープンウェイトエコシステムでの位置づけ

V4-Flashのオープンウェイトエコシステムでの位置づけ

V4-FlashのMIT公開は、DeepSeekがV3・R1系列から一貫して取ってきたオープンウェイト戦略の延長線上にあります。

Alibaba Qwen 3.6(Apache 2.0)・Meta Llama 4系・Mistral系と並び、商用利用可能なオープンウェイトMoE市場の主要プレイヤーの1角を担うシリーズです。

パラメータ規模で見ると、V4-Flashの284B総/13BアクティブはMoE中規模帯にあたり、V4-Pro(1.6T/49B active)と組み合わせて「Flash=軽量高スループット層・Pro=重量高精度層」の二段構成をとる設計です。

エージェント・コーディング用途で使える現実的なオープンウェイト候補として選定リストに載り始めたのは、この二段構成とMITライセンスの合わせ技によるものです。

AI Agent Hub1


V4-Flashアップデート版の主な変更点

2026年7月31日、DeepSeekはV4-Flashのアップデート版をAPI公開ベータで解禁しました。
DeepSeek公式および中国語・日本語メディアは「V4-Flash正式版」と呼び、公式のモデル識別子は「DeepSeek-V4-Flash-0731」です(本記事では以降「0731ビルド」と呼びます)。

アップデートの中身は、モデルアーキテクチャ・パラメータ規模を4月Preview版から据え置いたまま、事後学習(post-training)だけを再設計したものです。

それだけで9つのエージェント・コーディングベンチマークで自社上位のV4-Proプレビューを上回るという逆転が起きました。

アーキテクチャは同一・事後学習だけを再設計

アーキテクチャは同一・事後学習だけを再設計

0731ビルドは、4月24日公開のPreviewビルドと同じMoE構造(総284B・アクティブ13B)、同じハイブリッド注意機構(CSA+HCA)、同じ1Mトークンコンテキストのまま、事後学習パイプラインだけを差し替えて訓練されました。

DeepSeek自身が公式アナウンスで「ネイティブにResponses API形式をサポートし、Codex向けに特化」と説明しているとおり、コーディング・エージェント用途に軸足を寄せた事後学習が施されています。


推論コスト・メモリフットプリントは基本的にPreviewビルドと同等ですが、量子化バリアントは0731向けに再構築が進んでおり、Preview向けにチューニング済みのローカル推論スタックがそのまま動くかは個別に実測確認する必要があります。

再事後学習だけで9ベンチ全てで自社上位モデルを抜くという結果は、DeepSeekの学習パイプラインの完成度が一段上がったことを示していますが、具体的にどの学習手法が寄与したかは公式には公表されていません。

Responses APIとCodexへのネイティブ対応

Responses APIとCodexへのネイティブ対応

0731ビルドが従来のPreviewと最も大きく違うのは、OpenAI互換のChat Completions APIだけでなく、Responses APIとCodex系ツール連携をネイティブに扱えるようになった点です。

Responses APIはOpenAIが2025年3月に投入したエージェント構築向けAPIで、ツール呼び出し・思考ステップ・アーティファクト出力を1つのイベントストリームで扱えます。V4-Flash 0731は同APIの仕様に沿った出力構造を学習済みで、DeepSeek公式のCodex統合手順が用意されています。


エージェント用途では、ツール呼び出しループを回すたびに「モデル出力→構造化パース→次の呼び出し」の3工程を挟むため、Responses API仕様への直接対応はオーケストレーションの実装負荷を下げやすくなります。

既存のCodex CLI環境からV4-Flash 0731を試すには、公式セットアップスクリプトを実行するか、手動で設定ファイルを配置する必要があります(詳細は後述の「APIでの使い方」セクション参照)。

9ベンチで自社上位モデルを上回った「逆転」

9ベンチで自社上位モデルを上回った「逆転」

0731ビルドのリリースで最も注目されたのは、DeepSeekが公表した9つのベンチマークすべてで、フラッグシップのV4-Proプレビューを上回ったという事実です。

以下の表で、代表的な3ベンチにおけるV4-Flash 0731・V4-Flash Preview・V4-Pro Previewのスコアを比較しました。

ベンチ V4-Flash 0731 V4-Flash Preview V4-Pro Preview
Terminal Bench 2.1 82.7 61.8 72.1
DeepSWE 54.4
DSBench-FullStack 68.7


Terminal Bench 2.1では0731ビルドが82.7点を記録し、Previewビルド比で+20.9ポイント、V4-Proプレビュー比で+10.6ポイントの差を付けました。

DeepSWE(113件の独自長期開発タスク)・DSBench-FullStack(フルスタック開発の内製テスト)でも同様の順位逆転が確認されています。

ただし、これらの数字はいずれもDeepSeek自社ハーネスによる計測で、7月31日時点で第三者による再現・独立検証は成立していません。

次のセクションで扱いますが、公式値をそのまま「V4-Flashが上回った」と読むのではなく、独立指標との突き合わせで扱うのが実務的です。


公式ベンチマークと第三者評価——数字の読み解き方

公式ベンチマークと第三者評価——数字の読み解き方

V4-Flash 0731の性能を評価する際は、DeepSeek自身が公表する数字と、第三者機関による独立指標の両方を突き合わせて見る必要があります。本セクションでは、公式9ベンチと第三者評価それぞれの位置づけを整理します。

DeepSeek公式9ベンチのスコア一覧

DeepSeek公式9ベンチのスコア一覧

DeepSeekが0731ビルド公開時に開示した主要ベンチマークは、エージェント動作・コーディング・脆弱性検証・レポジトリ操作といった実務的なタスクに寄せた構成です。

以下の表で、7月31日時点で公開されている9ベンチの数値をまとめました。

ベンチマーク スコア 測定領域
Terminal Bench 2.1 82.7 ターミナル操作エージェント
DeepSWE 54.4 113件の長期ソフトウェア開発タスクの独立ベンチ
DSBench-FullStack 68.7 フルスタック開発(内製)
DSBench-Hard 59.6 高難度コーディングエージェント
Toolathlon (verified) 70.3 ツール呼び出し多段推論
Cybergym 76.7 セキュリティ・脆弱性検証
NL2Repo 54.2 自然言語からのリポジトリ生成
Agent Last Exam 25.2 エージェント総合評価
Automation Bench (Public) 25.1 業務自動化タスク


Terminal Bench 2.1の82.7とCybergymの76.7は、オープンウェイトのMoEモデルとしては極めて高い水準です。

ただし、DSBench-FullStack・DSBench-HardはDeepSeek内製ベンチで、外部研究者による標準ハーネスとは異なります。DeepSWEも研究チームが公開した113件のオリジナル長期開発タスクからなる別ベンチで、SWE-benchとは別物です。

「同じ問題を、同じ採点基準で、他モデルとも比較する」ためには第三者ベンチとの照合が必要です。

第三者ベンチ——Artificial Analysis Intelligence Index 50

第三者ベンチ——Artificial Analysis Intelligence Index 50

現時点で最も信頼できる第三者評価は、Artificial Analysisが公開したIntelligence Indexです。V4-Flash 0731はIntelligence Indexで50点を記録し、Previewビルドの40点から+10ポイントの改善を示しました。

Artificial AnalysisのV4-Flash 0731分析ページ
Artificial AnalysisによるV4 Flash 0731のインテリジェンス・価格分析。Intelligence Index 50点、入力$0.14、キャッシュヒット時-98%割引がひと目で確認できる(出典:Artificial Analysis

Artificial Analysisは複数モデルを共通ハーネスで採点する独立指標で、モデル間の相対位置を比較する際の基準としてよく引用されます。


この50点という水準は、Gemini 3.6 Flash(50点)と同等、GPT-5.6 Luna(51点)・GLM-5.2(51点)・Muse Spark 1.1(51点)に1ポイント差で肉薄する位置です。

DeepSeek自身の言い分(V4-Proを超えた)を第三者ベンチで完全に裏取れるわけではありませんが、少なくとも「同世代Flash級モデルの上位グループに入った」ことは独立指標でも確認できます。

コスト対性能で見ると、Artificial Analysisの価格・性能チャートでも高いコスト効率を示しており、Intelligence Index単位当たりの推論単価は同スコア帯の商用API群を下回っています。
実務目線ではこの評価が最も重い意味を持ちます。

公式ベンチを実務でどう扱うか

エージェント・コーディング用途でV4-Flashの採用を検討する際は、以下の3段階で数字を扱うのが安全です。

  • 段階1: 公式9ベンチを性能の上限見立てとして参照
    DeepSeek公表値は自社ハーネスによる最良ケースの数字。V4-Flashが「潜在的に到達できる水準」の目安として扱う

  • 段階2: Artificial Analysis等の第三者ベンチで相対位置を確認
    Intelligence Index・SWE-Bench Verified等で他モデルと同じハーネスに乗せた実測値を確認。ここまでで「同世代モデル群のどこに位置するか」が見える

  • 段階3: 自社の実務タスクでPoC計測
    社内リポジトリのバグ修正・PR生成・ドキュメント要約など、実務データでの計測が最終判断軸。ベンダー公表値と自社実測が乖離するケースはよくある


特にコーディング支援用途では、対象言語・リポジトリ規模・テスト自動化の成熟度によって同じモデルでも精度が大きくぶれることがあります。

公式ベンチだけで採用可否を決めず、PoC計測をワークフローに組み込むことが重要です。


DeepSeek V4-FlashのAPI料金と時間帯別課金の現状

DeepSeek V4-FlashのAPI料金と時間帯別課金の現状

V4-FlashのAPI料金は、V4-Proの1/3以下という水準で提供されており、キャッシュヒット時はさらに劇的に下がる設計です。本セクションでは公式pricingページで確認できる料金体系と、時間帯別課金の現在の適用状況を整理します。

V4-Flash・V4-Proの標準単価表

DeepSeek公式のModels & Pricingページで公表されている、2026年8月時点の単価は以下のとおりです。

モデル 入力(キャッシュヒット) 入力(キャッシュミス) 出力
DeepSeek V4-Flash $0.0028 / 1M tokens $0.14 / 1M tokens $0.28 / 1M tokens
DeepSeek V4-Pro $0.003625 / 1M tokens $0.435 / 1M tokens $0.87 / 1M tokens


V4-Flashの入力キャッシュミス単価$0.14は、Anthropic Claude Opus 5の入力$5と比べて約1/36の水準です。

OpenAI GPT-5.6 Lunaの入力$0.20と比べても約70%(約30%安い)で、エージェント用途で入出力トークン量が数百万〜数億に膨らむワークロードでは、この単価差がそのまま月次コストに反映されます。

出力単価$0.28も、V4-Proの$0.87と比べて約1/3。「9ベンチでV4-Proを上回った」というDeepSeek主張を額面通り受け取るなら、Flash側で成立する用途では単価3倍のProを選ぶ理由は薄くなります。

プロンプトキャッシュ98%割引という設計

プロンプトキャッシュ98%割引という設計

V4-Flashの入力キャッシュヒット単価$0.0028は、キャッシュミス単価$0.14の98%割引にあたります。
プロンプトキャッシングがヒットする限り、入力コストは実質「無視できる水準」まで落ちる設計です。

エージェントワークフローでは、システムプロンプト・ツール定義・過去の会話履歴といった「毎回同じ内容が投入される部分」がプロンプトの大半を占めるため、キャッシュ設計が実効コストに大きく効きます。

仮にキャッシュヒット率を80〜95%と想定した場合、V4-Flashの実効入力単価は$0.010〜$0.030/1Mトークン相当まで下がります(80%ヒットで約$0.030、95%ヒットで約$0.010)。


Artificial Analysisの価格・性能チャートでも0731ビルドは高いコスト効率を示しています。

実務でV4-Flashを採用するなら、システムプロンプトの安定化・ツール定義の固定化・会話履歴の再利用など、キャッシュヒット率を最大化する設計を並行で進めるのが単価インパクトの効かせ方として最短です。

時間帯別課金(ピーク/オフピーク)は施行日未確定

時間帯別課金 ピーク・オフピーク は施行日未確定

DeepSeek APIにはピーク/オフピーク料金制度の導入が予告されていますが、公式pricingページの記載を確認すると、2026年8月1日時点では施行日は正式アナウンス予定の状態で、まだ適用されていません。

参考例として示されているピーク時間帯は北京時間(UTC+8)9:00〜12:00と14:00〜18:00の日中帯で、この帯域だけ通常料金の2倍という設計案が公表されています。

オフピーク帯の扱い(割引の有無・割引率)は公式pricingページに明記されておらず、現時点では正式アナウンス待ちです。


「7/15にフルローンチと同時に時間帯別課金開始」と伝えた海外テック系メディアもありますが、DeepSeek公式pricingページ本文を読む限り、8月1日時点では適用開始日は明示されていません。

本文中で「今日からピーク時間帯は2倍」と断定するのはミスリードで、運用計画に組み込むなら公式アナウンスを直接確認するのが安全です。


DeepSeek V4-Flash APIの使い方

DeepSeek V4-Flash APIの使い方——Responses APIとCodex互換

V4-Flash 0731は、公式のResponses API形式とOpenAI互換のChat Completions APIの両方に対応しています。本セクションでは、Python環境からV4-Flashを呼び出す最小構成と、Codex系ツールから乗り換える手順を整理します。

前提条件——DeepSeek APIキーの取得

V4-FlashのAPI利用には、DeepSeek Platformでのアカウント登録とAPIキーの発行が必要です。

  • DeepSeek Platformにサインアップ
  • ダッシュボードの「API Keys」からキーを発行
  • 利用可能な残高がない場合はTop Upページから残高をチャージ
  • 環境変数「DEEPSEEK_API_KEY」にキーを設定


APIキーはアカウントごとに複数発行でき、用途別(開発/本番/実験)に分けて運用するのが実務的です。

OpenAI互換Chat Completions APIでの基本呼び出し

OpenAI互換Chat Completions APIでの基本呼び出し

V4-FlashはOpenAI互換のChat Completions APIをサポートしており、既存のOpenAI SDK・LangChain・LlamaIndexなどのライブラリから接続先・認証情報・モデル名の3項目を差し替えるだけで利用できます。

以下はOpenAI Python SDKでV4-Flashを呼び出す最小構成です。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": "あなたは有能なコーディングアシスタントです。"},
        {"role": "user", "content": "Pythonでフィボナッチ数列を生成する関数を書いてください。"}
    ],
    stream=False
)

print(response.choices[0].message.content)

このコードのポイントは3つあります。

  • 接続先・認証情報・モデル名の3項目差し替えで動作
    既存のOpenAI SDKコードのうち、「api_key」・「base_url」・「model」の3項目を書き換えるだけで移行が成立する

  • モデル名は「deepseek-v4-flash」のみ
    DeepSeek APIでは常に最新版(現時点は0731ビルド)が選択される。0731固定IDは公式には用意されておらず、Hugging Face上の重み識別子「DeepSeek-V4-Flash-0731」とAPIモデル名は別物

  • 「stream=True」でストリーミング応答
    チャット・エージェント用途では応答レイテンシを短縮するためストリーミングを有効化するのが定番


この構成だけで、OpenAI APIを想定した既存アプリケーションの大半はV4-Flashで動作します。移行コストは他のOpenAI互換モデル群と同水準で、実務的にはコスト削減目的での差し替えが第一の使い道です。

Codex CLIへのDeepSeek統合設定

Codex CLIへのDeepSeek統合設定

OpenAI Codex CLIからV4-Flashを呼び出すには、DeepSeek公式が用意しているCodex統合手順に従って設定ファイルを配置します。

単なる環境変数の差し替えでは動きません(Codexは「OPENAI_BASE_URL」ではなく「~/.codex/config.toml」のプロバイダー設定を参照するため)。

もっとも簡単なのは、DeepSeek公式が公開している自動セットアップスクリプトを実行する方法です。

# macOS / Linux
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)

# Windows PowerShell
irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex

スクリプト実行前に、Codex CLIまたはChatGPTデスクトップアプリを一度起動して「~/.codex」ディレクトリを生成しておく必要があります。


手動で設定する場合は、以下2ファイルを配置します。

  • 「~/.codex/models.json」: DeepSeek公式ドキュメントに掲載されている完全なJSONを配置(「deepseek-v4-flash」と「deepseek-v4-pro」両方のメタデータを含む)
  • 「~/.codex/config.toml」: 以下のプロバイダー設定を記述
model = "deepseek-v4-flash"
model_provider = "deepseek"
preferred_auth_method = "apikey"
forced_login_method = "api"
model_reasoning_effort = "high"
model_catalog_json = "~/.codex/models.json"

[model_providers.deepseek]
name = "deepseek"
base_url = "https://api.deepseek.com/"
wire_api = "responses"
experimental_bearer_token = "<APIキーを挿入>"

APIモデル名は「deepseek-v4-flash」のみで、常に最新の0731ビルドが呼び出されます(「deepseek-v4-flash-0731」のような版数固定IDは公式には用意されていない)。V4-Proは2026年8月初旬対応予定です。


Codex CLI側のプロンプトチューニングはOpenAI GPT系モデルの応答傾向に最適化されているため、V4-Flashで同じ精度を出すには対象タスクの再チューニングが必要になるケースがあります。

本番環境に投入する前に、社内リポジトリでのPR自動生成や関数リファクタリング等の実タスクで並行計測しておくのが安全です。

AI研修


DeepSeek V4-Flashをローカルで動かす方法

DeepSeek V4-Flashをローカルで動かす方法

V4-FlashはMITライセンスでモデルウェイトが公開されているため、社内GPU環境や高性能ワークステーション上で完全にローカル運用することが可能です。本セクションでは、必要なハードウェア要件と代表的な推論スタックを整理します。

提供されている量子化バリアント

提供されている量子化バリアント

Hugging Faceで配布されているV4-Flashのウェイトは、MoEのexpertパラメータにFP4、その他の多くにFP8が採用されており、低ビット表現を前提とした構成になっています。

2026年8月1日にUnslothは0731専用GGUFリポジトリ「unsloth/DeepSeek-V4-Flash-0731-GGUF」を公開しました。以下の表は0731版GGUFの主要バリアントです。

Unsloth公開のDeepSeek-V4-Flash-0731-GGUFファイルツリー
Unsloth AIがHugging Faceで公開しているDeepSeek-V4-Flash-0731のGGUFファイルツリー。(出典:Unsloth AI

バリアント 量子化ビット ディスクサイズ 用途
UD-Q4_K_XL 4-bit 約155GB バランス型(推奨)
UD-Q3_K_M 3-bit 約128GB 中程度・実験検証
UD-IQ3_XXS IQ 3-bit 約104GB 軽量寄り
UD-IQ1_S IQ 1-bit 約82.5GB 極小・検証用


0731 GGUFリポジトリには上記以外にも8-bit(UD-Q8_K_XL)・2-bit(UD-Q2_K_XL)・IQ 4-bit(UD-IQ4_XS)など複数バリアントが公開されています。

実務での選定ポイントは、精度を優先するなら4-bit(UD-Q4_K_XL)を第一候補にすることです。3-bit以下は精度劣化が入りやすいため、本番適合性は自社タスクでのPoC計測で最終判断するのが安全です。

ローカル推論に必要なハードウェア要件

ローカル推論に必要なハードウェア要件

V4-Flashをローカルで動かすうえでのハードウェア要件は、Unsloth公式ローカル実行ガイドの目安(4-bit合計162GB、3-bit 110〜135GB、1-bit 92GB)をベースに以下のように整理できます。

  • GPU構成の場合
    4-bit量子化(利用可能メモリ162GB以上が目安)を載せるには、NVIDIA H100 80GB × 3枚以上(合計240GB VRAM)またはH200 141GB × 2枚以上が実務的な最低ライン。vLLM公式のBlackwell推奨例では4×B200/B300構成が挙げられている

  • 統合メモリマシンの場合
    Apple Mac Studio M3 Ultra 256GB統合メモリで4-bit量子化(162GB目安)が動作するライン。128GB統合メモリなら3-bit(UD-IQ3_XXS 約103GB・110GB RAM推奨)や1-bit級(92GB目安)が選択候補になる

  • CPUオンリー構成
    サーバー用EPYC・Xeonクラスで384GB DDR5 RAM構成なら動作するが、推論速度は実務投入には不利になりやすい(実測値は環境依存のため公式ガイドまたは自社ベンチで確認)


個人開発者やSMB規模の検証用途ではMac Studio M3 Ultra 256GB級が候補になり、エンタープライズ本番運用ならH100〜H200 × 複数枚もしくはB200/B300構成のGPUサーバーが必要です。

入コストは構成・地域・調達経路で大きく変わるため、稟議前にベンダー見積りで確定させるのが安全です。

対応推論エンジン——vLLM・SGLang・llama.cpp・Ollama

対応推論エンジン——vLLM・SGLang・llama.cpp・Ollama

V4-Flashは主要なオープンソース推論エンジンでDay-Oneサポートされており、以下4つのスタックから環境に合わせて選べます。

  • vLLM(データセンター向け)
    NVIDIA GPU環境の本番運用向け。vLLMはV4シリーズを公式サポートしており、追加最適化も継続進行中。0731ビルドの起動コマンドは公式モデルカードに記載されている「vllm serve deepseek-ai/DeepSeek-V4-Flash-0731」をベースに、DSpark投機デコード等のオプションを付与

  • SGLang(データセンター向け)
    vLLMと同じくOpenAI互換APIを提供する高速推論エンジン。エージェントワークフローで低レイテンシを求める場合に選択肢に入る

  • llama.cpp / Ollama(個人・小規模向け)
    GGUF形式の量子化バリアントを使えるため、Mac Studio等の統合メモリマシンで動かすならこちら。ローカル実行例は「ollama run hf.co/unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-Q4_K_XL」

  • Docker Model Runner / LM Studio(GUI環境)
    非エンジニアの検証用に、GUIから量子化バリアントを切り替えられる環境。プロトタイプ検証段階で有用


Ollama公式ライブラリには「deepseek-v4-flash:0731-cloud」タグが2026年8月1日時点で追加されており、ローカルダウンロードなしでもクラウド経由で0731ビルドを試せる導線が用意されています。まずクラウド経由で動作確認し、本番運用の目処が立ってから自社インフラに移す段階的な導入が現実的です。

0731ビルドの公式配布状況

0731ビルドのモデル重みは、DeepSeek公式のHugging Faceリポジトリ「deepseek-ai/DeepSeek-V4-Flash-0731」でMITライセンスとして公開されています。基本アーキテクチャは284B・アクティブ13BのMoEをPreview版から継承し、safetensors形式で提供されています(Hugging Face上のリポジトリ表示は付属モジュール込みで304Bとみられます)。

月間15,000ダウンロード以上と実利用も進んでいます。Ollama Cloudの「deepseek-v4-flash:0731-cloud」タグや、Unslothの0731専用GGUF量子化バリアント(「unsloth/DeepSeek-V4-Flash-0731-GGUF」)も並行して整備されており、ローカル運用の導線が完全に揃った状態です。

Hugging Face公式のDeepSeek-V4-Flash-0731モデルカード
Hugging Face公式のDeepSeek-V4-Flash-0731モデルカード。Preview版を置き換える正式リリースであること、DSpark投機デコードモジュールが同梱されること、リポジトリ表示上は304Bとカウントされることが確認できる(出典:Hugging Face

これは4月24日公開のPreviewビルド(「deepseek-ai/DeepSeek-V4-Flash」)を置き換える正式リリースで、Previewビルドの利用者は同じダウンロード手順で0731の重みに切り替えられます。


「MITライセンスで公開されているオープンウェイト」の恩恵をフルに受けたいユースケース(自社データセンターでの完全オフライン運用・監査対応が必要な業務)でも、0731ビルドを直接使える状態になっています。

ただし、後述するようにローカルで動かすためのハードウェア要件は依然として高く、GPUリソースやApple M3 Ultra級の統合メモリマシンが必要な点は変わりません。


V4-Proや他のオープンウェイトLLMとの使い分け

V4-Proや他のオープンウェイトLLMとの使い分け

V4-Flashは「オープンウェイトMoEのエージェント・コーディング用途」というポジションで、V4-Pro・Qwen 3.6・Claude Opus 5などのモデル群と競合します。本セクションでは、選定時に見るべき比較軸を整理します。

主要オープンウェイトLLM・商用モデルとの比較表

以下の表で、V4-Flashと同世代の主要モデル5種類を、単価・ライセンス・コンテキスト・得意領域の観点で比較しました。

モデル ライセンス パラメータ規模 コンテキスト 入力単価(API) 得意領域
DeepSeek V4-Flash 0731 MIT 284B(アクティブ13B) 1M $0.14 / 1M エージェント・コーディング
DeepSeek V4-Pro MIT 1.6T(アクティブ49B) 1M $0.435 / 1M 汎用フロンティア
Qwen 3.6-27B Apache 2.0 27B dense 262K(YaRNで最大1M) Alibaba Cloud要確認 マルチモーダル・エージェンティックコーディング
Claude Opus 5 商用API 非公開 1M $5 / 1M 複雑推論・エージェント
GPT-5.6 Luna 商用API 非公開 約1.05M $0.20 / 1M 大容量・低単価汎用


この表から読み解けるポイントは、次の3つに整理できます。

  • 入力単価の低さで独自ポジションを確立
    V4-Flashは同スコア帯のオープンウェイトの中でフル価格$0.14・キャッシュヒット時$0.0028という単価優位性を持つ。1MコンテキストはClaude Opus 5・GPT-5.6 Lunaと同帯でコンテキスト長単独では突出しないが、単価とMoEアクティブ13Bの推論効率を組み合わせるとコスト面で有利になる

  • Qwen 3.6-27Bとは用途特性で使い分ける
    Qwen 3.6-27Bは27B denseの中規模モデル、V4-Flashは284B MoEでアクティブ13Bという構造で実効パラメータは近いレンジ。Qwenはマルチモーダル・視覚推論、V4-Flashは長コンテキスト+エージェンティックコーディングという用途特性の違いで噛み合わせるのが実務的

  • 複雑推論の本番運用はClaude Opus 5が第一候補
    マルチモデル・マルチステップの複雑ワークフローで安定的に高精度を維持したい場面では、Claude Opus 5レベルの商用フロンティアモデルが現時点で選ばれやすい傾向がある。GPT-5.6 LunaはV4-Flashとコスト帯が近い汎用モデルで、共通ベンチの直接比較は本記事の範囲外なので実務投入前には自社タスクでの並行計測が必須


3点を合わせて言えば、V4-Flashは「大量長コンテキストと単価優位性を活かせるコーディング・エージェント用途」に張り、精度優先の複雑推論はOpus 5、マルチモーダル用途はQwen 3.6を併用するのが、2026年8月時点で最も現実的な組み合わせになります。

ケース別の使い分け——実務での判断軸

ケース別の使い分け——実務での判断軸

支援現場での傾向を踏まえると、V4-Flashを選ぶべきケースと、他モデルを検討したほうがよいケースは以下のように分かれます。

  • V4-Flashが第一候補になるケース
    コーディングエージェント・PR自動生成・リポジトリ横断コードレビューで、月次トークン量が数百万〜数億に達する。日本語主体ではなく英語・多言語コードが中心。オンプレ運用の要件はなく、API経由で使える

  • V4-Proを検討するケース
    V4-Flashで精度が届かない高難度タスク(研究レベルの数学問題・多段推論の複雑計画)。単価3倍を許容できるバッチ用途

  • Qwen 3.6 を検討するケース
    画像・視覚推論を含むマルチモーダルタスクや、Apache 2.0でセルフホスト運用したい要件。27B denseで単一GPU(H100 80GB)に収まる導入容易性も選定材料

  • Claude Opus 5を検討するケース
    複雑なエージェントワークフローで信頼性が最優先。単価差を許容してでも「本番運用で失敗しないモデル」を選ぶ場合の第一候補

  • オンプレ完全運用のケース
    0731ビルドの公式重みをMITライセンスで社内GPUに載せる。ハードウェア要件が厳しい場合はUnsloth 0731 GGUFのIQ1_S級(利用可能メモリ92GB目安)で試験導入、またはQwen 3.6Mistral AIMicrosoft Phiを含めた小規模モデルとの併用を検討


単一モデルで全用途をカバーする戦略よりも、用途別に2〜3モデルを併用する運用の方が現実的なコストパフォーマンスを引き出しやすくなっています。

V4-Flashをコーディング支援層、Qwen 3.6をマルチモーダル層、Claude Opus 5を経営判断支援層に配置する三層構成は、実務でよく検討される構図の1つです。


V4-Flash導入で見落としやすい3つの観点

V4-Flash導入で見落としやすい3つの観点

V4-Flashはコスト優位性が突出しているモデルですが、実務投入前に確認しておくべき論点がいくつかあります。本セクションでは、導入判断で見落としがちな3つの観点を整理します。

データ主権・データ保護の観点

データ主権・データ保護の観点

DeepSeekは中国拠点のAI企業であり、API経由の利用では送信データが中国国内のサーバーで処理される可能性があります。

金融・医療・法務・防衛関連など、データ主権が厳格に求められる業界では、そもそも中国拠点AIサービスの利用が社内規程で禁止されているケースが少なくありません。

一方で、V4-FlashはMITライセンスでモデルウェイトが完全に公開されているため、社内GPU環境・オンプレデータセンター・自社Azureテナントでセルフホスト運用することが可能です。

データ主権要件が厳しい業界でV4-Flashを採用するなら、API利用ではなく必ずセルフホスト(またはSovereign Cloud経由)を選ぶのが実務的な選択になります。完全オフライン運用が必要な場合は、社内GPU・オンプレデータセンター、あるいはAzure Localの切断(Disconnected Operations)構成のような別レイヤーの設計が必要です。


オンプレミス生成AIの運用形態と組み合わせて設計することで、V4-Flashのコスト優位性を活かしつつデータを外に出さない構成が組めます。

ただし、この構成には4-bit量子化(利用可能メモリ162GB以上が目安)を動かせるNVIDIA H100 × 3枚以上もしくはH200 × 2枚以上、あるいはB200/B300クラスのGPUサーバーが必要で、初期投資は稟議前にベンダー見積りで確定させる必要があります。単価削減効果と初期投資のバランス試算は、採用判断の前段で必ず実施すべき工程です。

ベンダー自社ベンチへの過度な依存

ベンダー自社ベンチへの過度な依存

V4-Flash 0731の「9ベンチでV4-Proを上回った」という主張は、いずれもDeepSeek自社ハーネスによる計測で、7月31日時点で第三者による再現・独立検証は成立していません。

過去、多くのオープンウェイトモデルが「公式ベンチではフラッグシップ商用モデルを凌駕」と主張しながら、実運用では期待した性能が出なかった事例がありました。ベンダー公表値と実運用性能の乖離は、AIモデル業界では常態です。


V4-Flashの実務投入前には、以下3ステップの検証を組み込むことを推奨します。

  • Artificial Analysis等の第三者ベンチで相対位置を確認(Intelligence Index 50点はここで確認できる客観指標)
  • 自社リポジトリでのPR自動生成・関数リファクタリング等でPoC計測(対象タスク・言語・リポジトリ規模で精度がどう変わるかを実測)
  • 本番投入後もローリング計測(モデル側のアップデートで精度が変動するため、月次で回帰テストを回す)


公式ベンチだけを根拠に「V4-FlashはV4-Proを超えた」と社内報告するのはリスクが高く、第三者ベンチと自社実測の3階層で判断するのが安全です。

ローカル運用に必要なハードウェア投資が大きい

ローカル運用に必要なハードウェア投資が大きい

V4-Flash 0731の重みはMITライセンスでHugging Face公式リポジトリから直接ダウンロードできますが、ローカル運用に必要な計算資源は依然として高い点は変わりません。284Bパラメータ・アクティブ13BのMoE構造は、Preview版と同じく大型GPUクラスタか大容量統合メモリマシンを前提としています。

現実的な導入コストの目安は以下のとおりです(Unsloth公式ローカル実行ガイドの利用可能メモリ目安ベース)。

  • 本番運用 (4-bit量子化・162GB以上): NVIDIA H100 × 3枚以上もしくはH200 × 2枚以上のGPUサーバー
  • 試験運用 (4-bit量子化): Apple Mac Studio M3 Ultra 256GB統合メモリ級。単一マシンで4-bit精度を動かせるライン
  • 軽量検証 (3-bit UD-IQ3_XXS 約103GB / 1-bit級92GB目安): 128GB統合メモリの高性能ワークステーションで動作。精度劣化を許容できる検証用途に


コストと性能のバランスから、オープンウェイト=すぐ社内で動かせるという単純な図式にはならない点に注意が必要です。

API経由(DeepSeek公式・OpenRouter経由)で試してから、実運用トークン量とハードウェア投資を照らし合わせて判断するのが安全なステップになります。

データ主権要件が絡む案件では、Sovereign Cloud経由や自社Azureテナントでのセルフホスト配置、完全切断が必要ならオンプレまたはAzure Local Disconnected Operations等の別構成も選択肢に入ります。

メルマガ登録


V4-Flashを含む複数LLMを業務プロセスに定着させるなら

DeepSeek V4-Flash 0731のAPI単価$0.14/$0.28とMITライセンスのオープンウェイトは、コーディング・エージェント用途のAIコストを大きく変えます。ただしモデル選定単独では業務は動かず、外部APIとセルフホスト推論を含む複数モデルを業務ワークフローに組み込む実行層が並行して必要です。

このレイヤーを担うのが、自社Azureテナント内で動くエンタープライズAIエージェント基盤です。AI総合研究所のAI Agent Hubは、V4-Flashを含む複数モデルを業務ワークフローに組み込む実行基盤として機能します。

  • オープンウェイトと商用APIを1つのAgent層で使い分け
    コーディング支援はV4-Flash、複雑推論はClaude Opus 5、日本語業務は国産LLM、と用途ごとにモデル選定を切り替えられます。

  • モデル世代交代を吸収する業務組み込み層
    V4-Flash Preview → 0731 → 次期版のように短サイクルで世代交代しても、業務Agent側の設計は不変。特定モデル依存のワークフロー陥落を回避できます。

  • 使い慣れたMicrosoft環境をそのまま活用
    Teams・Excel・Outlookなど既存ツールの延長でAIエージェントが動作。新しいツールの学習コストはゼロです。

  • データは100%自社テナント内に保持
    Azure Managed Applicationsとして自社テナント内で動作が完結。中国拠点APIを避けたい業務でも、セルフホストしたV4-Flashを管理レイヤー経由で組み込めます。



AI総合研究所の専任チームが、オープンウェイトLLMの選定からAIエージェント基盤の本番運用まで一貫して伴走支援します。AI Agent Hubのサービスページで、V4-Flash等のLLMを業務プロセスに定着させる実行基盤の全体像をご確認ください。

オープンウェイトLLMを業務プロセスに定着

AI Agent Hub

オープンウェイトと商用APIをまたぐ複数モデル運用

DeepSeek V4-FlashやQwen 3.6のようなオープンウェイトモデルを業務ワークフローに載せる段階では、モデル性能とは別レイヤーの実行基盤設計が必要です。AI Agent Hubのサービスページで、複数モデルを業務プロセスに繋ぐ実行基盤の全体像をご確認ください。


まとめ

本記事では、DeepSeek V4-Flash 0731ビルドについて、リリース概要・性能ベンチ・API料金・使い方(API/ローカル)・他モデルとの使い分け・導入判断のポイントを、2026年8月時点の最新情報で解説しました。

2026年時点で押さえておくべきポイントは次の3つです。

  • 7/31リリースの0731ビルドはアーキテクチャ据え置きで再事後学習のみを行い、自社公表9ベンチ全てでV4-Proプレビューを上回った
  • API単価はV4-Proの1/3、キャッシュヒット時は98%割引で入力$0.0028まで下がり、Artificial Analysisの価格・性能チャートでも高いコスト効率を示す
  • 0731ビルドの重みはMITライセンスでHugging Face公式から直接ダウンロード可能、Unslothの0731専用GGUFも整備済みで4-bit量子化なら約155GBで自社推論基盤に載せられる(H100×3枚以上等のハードウェアが前提)となる

コーディング・エージェント用途で月次トークン量が数百万〜数億に達する開発チームにとって、V4-Flash 0731は「まず試して単価インパクトを計測する価値のあるモデル」の筆頭候補です。まずはDeepSeek公式APIまたはOpenAI互換Chat Completions APIで既存Codex系ワークフローと並行計測し、コスト削減効果が確認できてからオンプレ展開の投資判断に進むのが、実用的な導入ステップになります。

オープンウェイトLLMの選択肢が急速に広がる2026年、モデル単独ではなく「業務Agent基盤としてどう組み込むか」の設計が競争力を左右する時期に入っています。

監修者
坂本 将磨

坂本 将磨

Microsoft MVP・AIパートナー。LinkX Japan株式会社 代表取締役。東京工業大学大学院にて自然言語処理・金融工学を研究。NHK放送技術研究所でAI・ブロックチェーンの研究開発に従事し、国際学会・ジャーナルでの発表多数。経営情報学会 優秀賞受賞。シンガポールでWeb3企業を創業後、現在は企業向けAI導入・DX推進を支援。

関連記事

AI導入の最初の窓口

お悩み・課題に合わせて活用方法をご案内いたします
お気軽にお問合せください

AI総合研究所 Bottom banner

ご相談
お問い合わせは
こちら!