DeepSeek V4 正式版(GA)公開:
料金体系・アーキテクチャ・GPT-5.6 との性能差

約三か月の待機を経て、DeepSeek V4 正式版(GA・満血版)が 2026 年 7 月 20 日に公開されました。4 月のプレビュー版と比べ、Agent 能力・数学推論・コード生成が強化され、初めてピーク・オフピークの差別料金が導入されました。DeepSeek は「ほぼ無料」から、規律ある商用運用へと舵を切ったと言えます。

本稿は API 選定中の AI 開発者とプロダクトチーム を対象に、技術アーキテクチャ、ベンチマーク、料金戦略、GPT-5.6 / Claude Fable 5 との横比較、そして 7 月 24 日までの API 移行の五つの観点から整理します。読み終える頃には、V4-Pro と V4-Flash の使い分け、コスト試算、移行手順が判断できる状態を目指します。

01 DeepSeek V4 GA 公開:プレビューから満血版までのタイムライン

本番導入前に押さえるべきリスク:

  • 旧モデル名の失効:deepseek-chatdeepseek-reasoner は 7 月 24 日に永久停止します。未移行の本番コードはその時点で応答不能になります。
  • ピーク料金の複雑化:平日 09:00–12:00、14:00–18:00(北京時間)はレートが 2 倍です。24 時間稼働の Agent パイプラインはスケジューリングの見直しが必要です。
  • プレビュー版と GA の性能差:満血版は Agent・数学・コードで重点強化されています。4 月時点のベンチマークだけでは選定判断できません。
  • Pro と Flash の誤ルーティング:1.6T と 284B では品質とコストが大きく異なります。用途に合わない振り分けは予算を無駄にします。
DeepSeek V4 主要タイムライン
日付 イベント
2026-04-24 V4 プレビュー公開+ MIT オープンソース(V4-Pro 1.6T、V4-Flash 284B)
2026-05 V4-Flash / V4-Pro 本番向けチューニング版リリース、API 正式提供
2026-06 V4-Pro 出力単価を 75% 値下げ、$0.87/M tokens に恒久改定
2026-06-29 DeepSeek が全 API ユーザーへメール通知:7 月中旬 GA 予定、ピーク料金を初公開
2026-07-19 複数開発者が GA グレー内測資格を取得、メディアが「満血版は翌日リリース」と報道
2026-07-20 GA 正式版公開(本稿執筆日)
2026-07-24 旧モデル名 deepseek-chat / deepseek-reasoner 永久停止

プレビュー版だけでも十分強力でしたが、満血版は Agent・数学推論・コード生成をさらに底上げし、商用向けの正式な料金体系とセットで提供されています。

02 CSA・HCA・mHC・Muon:100万 token コンテキストの技術基盤

V4-Pro と V4-Flash 仕様対照
項目 V4-Pro V4-Flash
総パラメータ数 1.6 兆(1.6T) 2840 億(284B)
トークンあたり活性パラメータ 490 億(49B) 130 億(13B)
Transformer 層数 61 層 43 層
コンテキストウィンドウ 1,000,000 tokens 1,000,000 tokens
最大出力 384K tokens 384K tokens
精度 FP4(エキスパート重み)+ FP8(その他) FP4 + FP8 混合
事前学習データ量 33T+ tokens 32T+ tokens
ライセンス MIT MIT

DeepSeek V4 は V2/V3 時代の MLA(Multi-head Latent Attention)を廃止し、二種類の新しい注意機構を組み合わせています。

  • CSA(Compressed Sparse Attention):Softmax ゲート付きプーリングで KV 系列を 4 倍に圧縮し、FP4 精度の「ライトニングインデクサー」で top-k スパース選択(Pro は top-1024、Flash は top-512)を行います。直近 128 トークンのスライディングウィンドウも保持します。1M コンテキストでは V3.2 比 27% の推論 FLOPs で済みます。
  • HCA(Heavily Compressed Attention):トークンを 128 倍に圧縮してからグローバル密集注意を実行し、長距離依存を捕捉します。CSA と相補的です。V4-Flash は最初の 2 層が HCA、以降 CSA/HCA が交互に配置され、V4-Pro も同様の構成です。
  • mHC(Manifold-Constrained Hyper-Connections):4 チャネル残差ストリームを導入し、双確率行列制約を満たす混合行列で 61 層の深いネットワークでも信号が安定伝播します。
  • Muon オプティマイザ:学習時は AdamW ではなく Muon を採用し、ニュートン–シュルツ直交化で勾配を処理することで、より速い収束と安定した学習を実現しています。

総合効果として、1M token シナリオでは KV Cache メモリが V3.2 の 10%(V4-Flash は 7% まで低減)に抑えられます。

三つの推論モード
モード 特徴 適用シーン
Non-think 思考チェーンなし、最速応答 単純 Q&A、ルーティング
Think High 明示的推論(thinking タグ) 中程度の複雑タスク、コードデバッグ
Think Max 最大推論強度、384K+ コンテキストが必要 複雑な数学、長鎖 Agent

公式推奨サンプリングパラメータは temperature=1.0, top_p=1.0(全モード共通)です。ローカル推論を検討する場合は、ds4 による Mac 上の V4-Flash 推論も併せて参照してください。

03 ベンチマークと GPT-5.6 / Claude Fable 5 との比較

V4-Pro 主要ベンチマーク
ベンチマーク DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80.6%(オープンソース最高) 96.0% 個別未公開 約 69%
SWE-bench Pro 55.4% 80.3% 78.1% 69.2%
LiveCodeBench (Pass@1) 93.5% 88.1% 87.4% 83.2%
Codeforces Elo 3,206
Terminal-Bench 2.1 83.9% 88.0% 85.1% 82.7%

Artificial Analysis の評価によると、Claude Fable 5 は Strategy & Ops 指数タスクで 1 回あたり $3.48(スコア 50)、DeepSeek V4-Pro は同種タスクで $0.03(スコア 38)です。Fable 5 のコストは V4-Pro の 116 倍、スコア差は約 12 点にとどまります。

三社フラッグシップの位置づけ
観点 DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
オープンソース / 自ホスト MIT、対応 クローズド クローズド
コンテキスト 1M tokens 未公開 1M tokens
API 出力単価(オフピーク) $0.87/M 約 $15/M $50/M
API 出力単価(ピーク) $1.74/M
コード能力 極めて高い(Fable 5 に接近) 極めて高い 最高(SWE-bench Pro 首位)
データプライバシー プライベートデプロイ可 不可 不可

シーン別の選定指針:予算重視・高頻度呼び出し・プライベートデプロイ → V4-Pro または V4-Flash。究極のコード品質でコスト不問 → Claude Fable 5。複雑なアルゴリズムと数学推論 → GPT-5.6 Sol / Ultra。超大規模ログ処理 → V4-Flash(キャッシュヒット入力は $0.0028/M のみ)。

04 ピーク・オフピーク料金の仕組みとコスト最適化

GA 版で最も議論を呼んだのが、DeepSeek 初のピーク・オフピーク差別料金です。電力の時間帯別料金に似た設計で、ピーク帯(北京時間)は平日 09:00–12:00 と 14:00–18:00 にレートが 2 倍になります。

V4-Pro / V4-Flash 完全料金表
モデル 課金項目 オフピーク ピーク
V4-Pro 入力(キャッシュヒット) ¥0.025 / $0.0035 / 1M 2 倍
V4-Pro 入力(キャッシュミス) ¥3.00 / $0.435 / 1M ¥6.00 / $0.87 / 1M
V4-Pro 出力 ¥6.00 / $0.87 / 1M ¥12.00 / $1.74 / 1M
V4-Flash 入力(キャッシュヒット) ¥0.02 / $0.0028 / 1M 2 倍
V4-Flash 入力(キャッシュミス) ¥1.00 / $0.14 / 1M ¥2.00 / $0.28 / 1M
V4-Flash 出力 ¥2.00 / $0.28 / 1M ¥4.00 / $0.56 / 1M

コスト削減の四つの実践:

  • 非リアルタイム処理をオフピークへ:バッチ文書処理、データアノテーション、コードレビューは 18:00 以降または 9:00 前に cron 設定します。
  • キャッシュヒットの活用:繰り返し使う System Prompt で Prompt Cache を構築します。V4-Flash のキャッシュヒットは $0.0028/M です。
  • Flash で前段ルーティング:意図分類や軽量判断は V4-Flash、複雑推論のみ V4-Pro にエスカレーションします。
  • 請求通知の確認:DeepSeek は料金変更の 24 時間前にメール通知を約束しています。

ピーク時でも V4-Pro 出力単価($1.74/M)は Claude Opus 4.8($15/M)や GPT-5.6 Sol(約 $15/M)の 8.6 倍安い水準です。

05 deepseek-chat 廃止と 7 月 24 日までの API 移行

重要:旧モデル名 deepseek-chatdeepseek-reasoner2026 年 7 月 24 日 15:59 UTC(日本時間 7 月 25 日 00:59) に永久停止します。

API 移行マッピング
旧モデル名 新モデル名 備考
deepseek-chat deepseek-v4-flash(Non-think モード) 高速、軽量タスク向け
deepseek-reasoner deepseek-v4-flash(思考モード) または deepseek-v4-pro でより強い推論
deepseek_v4_migration.py
旧写法(7月24日以降は失効)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

新写法
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 は OpenAI ChatCompletions 形式と Anthropic Messages 形式の両方に対応しています。base_url は変更せず、model パラメータのみ更新すれば移行できます。

以下は主要な公式ソースです。発版やページ更新後はリンクを再確認してください。

https://api-docs.deepseek.com

https://arxiv.org/abs/2606.19348

https://huggingface.co/deepseek-ai

六ステップ移行チェックリスト:

  1. 旧モデル名の全庫検索:コードリポジトリ、CI 設定、環境変数から deepseek-chatdeepseek-reasoner を洗い出します。
  2. 置換マッピングの確定:軽量対話は deepseek-v4-flash(Non-think)、推論タスクは Flash 思考モードまたは deepseek-v4-pro に振り分けます。
  3. SDK 呼び出しの更新:OpenAI 互換 API は model のみ変更。Anthropic SDK も base_url=https://api.deepseek.com は据え置きです。
  4. 思考モードの設定:旧 reasoner ユーザーは extra_body で thinking を有効化します。Think Max は 384K+ コンテキストが必要です。
  5. Staging での検証:7 月 24 日前に E2E テストを完了し、ピーク料金が予算に与える影響を確認します。
  6. オフピークへのバッチ移行:文書バッチ処理やコードレビューを 18:00 以降や週末に cron し、Prompt Cache と組み合わせてコストを最小化します。

引用可能な技術データ(EEAT):

  • SWE-bench Verified 80.6%:オープンモデル最高得点、Gemini 3.1 Pro と同率(出典:DeepSeek 公式ドキュメント、2026-07)。
  • KV Cache メモリ 10%:1M token シナリオで V3.2 の 10%、V4-Flash は 7%(出典:arXiv:2606.19348)。
  • コスパ 116 倍:Artificial Analysis Strategy & Ops タスクで V4-Pro $0.03 vs Fable 5 $3.48(出典:Artificial Analysis、2026-07)。

まとめ:DeepSeek V4 GA の価値は、Claude Fable 5 や GPT-5.6 を今すぐ上回ることではなく、クローズドフラッグシップの 1/10 から 1/100 のコストで、オープンモデル中最高クラスの性能を提供することにあります。ピーク料金は試算を複雑にしますが、全体として依然として競争力は極めて高いです。

DeepSeek V4 API を OpenClaw Gateway や Cursor Agent に接続する場合、個人 Mac のスリープは SWE-bench 級の長時間タスクを中断し、ピーク帯の 24 時間パイプラインもノート PC では安定稼働しません。API 単体ではローカル GPU は不要ですが、ローカル Gateway + クラウド推論 + 7×24 オーケストレーションのハイブリッド構成では、常時稼働 Agent の安定性がボトルネックになります。AI プログラミング Agent、OpenClaw マルチモデルルーティング、長時間 Agent ループの 7×24 運用が必要な本番環境では、CALMVPS のベアメタル Mac Mini レンタルが現実的な選択肢です。Apple Silicon 独占、Metal ネイティブ加速、月単位の柔軟契約、約 120 秒でプロビジョニング可能です。詳細は 料金ページをご確認ください。