約三か月の待機を経て、DeepSeek V4 正式版(GA・満血版)が 2026 年 7 月 20 日に公開されました。4 月のプレビュー版と比べ、Agent 能力・数学推論・コード生成が強化され、初めてピーク・オフピークの差別料金が導入されました。DeepSeek は「ほぼ無料」から、規律ある商用運用へと舵を切ったと言えます。
本稿は API 選定中の AI 開発者とプロダクトチーム を対象に、技術アーキテクチャ、ベンチマーク、料金戦略、GPT-5.6 / Claude Fable 5 との横比較、そして 7 月 24 日までの API 移行の五つの観点から整理します。読み終える頃には、V4-Pro と V4-Flash の使い分け、コスト試算、移行手順が判断できる状態を目指します。
01 DeepSeek V4 GA 公開:プレビューから満血版までのタイムライン
本番導入前に押さえるべきリスク:
- 旧モデル名の失効:
deepseek-chatとdeepseek-reasonerは 7 月 24 日に永久停止します。未移行の本番コードはその時点で応答不能になります。 - ピーク料金の複雑化:平日 09:00–12:00、14:00–18:00(北京時間)はレートが 2 倍です。24 時間稼働の Agent パイプラインはスケジューリングの見直しが必要です。
- プレビュー版と GA の性能差:満血版は Agent・数学・コードで重点強化されています。4 月時点のベンチマークだけでは選定判断できません。
- Pro と Flash の誤ルーティング:1.6T と 284B では品質とコストが大きく異なります。用途に合わない振り分けは予算を無駄にします。
| 日付 | イベント |
|---|---|
| 2026-04-24 | V4 プレビュー公開+ MIT オープンソース(V4-Pro 1.6T、V4-Flash 284B) |
| 2026-05 | V4-Flash / V4-Pro 本番向けチューニング版リリース、API 正式提供 |
| 2026-06 | V4-Pro 出力単価を 75% 値下げ、$0.87/M tokens に恒久改定 |
| 2026-06-29 | DeepSeek が全 API ユーザーへメール通知:7 月中旬 GA 予定、ピーク料金を初公開 |
| 2026-07-19 | 複数開発者が GA グレー内測資格を取得、メディアが「満血版は翌日リリース」と報道 |
| 2026-07-20 | GA 正式版公開(本稿執筆日) |
| 2026-07-24 | 旧モデル名 deepseek-chat / deepseek-reasoner 永久停止 |
プレビュー版だけでも十分強力でしたが、満血版は Agent・数学推論・コード生成をさらに底上げし、商用向けの正式な料金体系とセットで提供されています。
02 CSA・HCA・mHC・Muon:100万 token コンテキストの技術基盤
| 項目 | V4-Pro | V4-Flash |
|---|---|---|
| 総パラメータ数 | 1.6 兆(1.6T) | 2840 億(284B) |
| トークンあたり活性パラメータ | 490 億(49B) | 130 億(13B) |
| Transformer 層数 | 61 層 | 43 層 |
| コンテキストウィンドウ | 1,000,000 tokens | 1,000,000 tokens |
| 最大出力 | 384K tokens | 384K tokens |
| 精度 | FP4(エキスパート重み)+ FP8(その他) | FP4 + FP8 混合 |
| 事前学習データ量 | 33T+ tokens | 32T+ tokens |
| ライセンス | MIT | MIT |
DeepSeek V4 は V2/V3 時代の MLA(Multi-head Latent Attention)を廃止し、二種類の新しい注意機構を組み合わせています。
- CSA(Compressed Sparse Attention):Softmax ゲート付きプーリングで KV 系列を 4 倍に圧縮し、FP4 精度の「ライトニングインデクサー」で top-k スパース選択(Pro は top-1024、Flash は top-512)を行います。直近 128 トークンのスライディングウィンドウも保持します。1M コンテキストでは V3.2 比 27% の推論 FLOPs で済みます。
- HCA(Heavily Compressed Attention):トークンを 128 倍に圧縮してからグローバル密集注意を実行し、長距離依存を捕捉します。CSA と相補的です。V4-Flash は最初の 2 層が HCA、以降 CSA/HCA が交互に配置され、V4-Pro も同様の構成です。
- mHC(Manifold-Constrained Hyper-Connections):4 チャネル残差ストリームを導入し、双確率行列制約を満たす混合行列で 61 層の深いネットワークでも信号が安定伝播します。
- Muon オプティマイザ:学習時は AdamW ではなく Muon を採用し、ニュートン–シュルツ直交化で勾配を処理することで、より速い収束と安定した学習を実現しています。
総合効果として、1M token シナリオでは KV Cache メモリが V3.2 の 10%(V4-Flash は 7% まで低減)に抑えられます。
| モード | 特徴 | 適用シーン |
|---|---|---|
| Non-think | 思考チェーンなし、最速応答 | 単純 Q&A、ルーティング |
| Think High | 明示的推論(thinking タグ) | 中程度の複雑タスク、コードデバッグ |
| Think Max | 最大推論強度、384K+ コンテキストが必要 | 複雑な数学、長鎖 Agent |
公式推奨サンプリングパラメータは temperature=1.0, top_p=1.0(全モード共通)です。ローカル推論を検討する場合は、ds4 による Mac 上の V4-Flash 推論も併せて参照してください。
03 ベンチマークと GPT-5.6 / Claude Fable 5 との比較
| ベンチマーク | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6%(オープンソース最高) | 96.0% | 個別未公開 | 約 69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
Artificial Analysis の評価によると、Claude Fable 5 は Strategy & Ops 指数タスクで 1 回あたり $3.48(スコア 50)、DeepSeek V4-Pro は同種タスクで $0.03(スコア 38)です。Fable 5 のコストは V4-Pro の 116 倍、スコア差は約 12 点にとどまります。
| 観点 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| オープンソース / 自ホスト | MIT、対応 | クローズド | クローズド |
| コンテキスト | 1M tokens | 未公開 | 1M tokens |
| API 出力単価(オフピーク) | $0.87/M | 約 $15/M | $50/M |
| API 出力単価(ピーク) | $1.74/M | — | — |
| コード能力 | 極めて高い(Fable 5 に接近) | 極めて高い | 最高(SWE-bench Pro 首位) |
| データプライバシー | プライベートデプロイ可 | 不可 | 不可 |
シーン別の選定指針:予算重視・高頻度呼び出し・プライベートデプロイ → V4-Pro または V4-Flash。究極のコード品質でコスト不問 → Claude Fable 5。複雑なアルゴリズムと数学推論 → GPT-5.6 Sol / Ultra。超大規模ログ処理 → V4-Flash(キャッシュヒット入力は $0.0028/M のみ)。
04 ピーク・オフピーク料金の仕組みとコスト最適化
GA 版で最も議論を呼んだのが、DeepSeek 初のピーク・オフピーク差別料金です。電力の時間帯別料金に似た設計で、ピーク帯(北京時間)は平日 09:00–12:00 と 14:00–18:00 にレートが 2 倍になります。
| モデル | 課金項目 | オフピーク | ピーク |
|---|---|---|---|
| V4-Pro | 入力(キャッシュヒット) | ¥0.025 / $0.0035 / 1M | 2 倍 |
| V4-Pro | 入力(キャッシュミス) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 / 1M |
| V4-Pro | 出力 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 / 1M |
| V4-Flash | 入力(キャッシュヒット) | ¥0.02 / $0.0028 / 1M | 2 倍 |
| V4-Flash | 入力(キャッシュミス) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 / 1M |
| V4-Flash | 出力 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 / 1M |
コスト削減の四つの実践:
- 非リアルタイム処理をオフピークへ:バッチ文書処理、データアノテーション、コードレビューは 18:00 以降または 9:00 前に cron 設定します。
- キャッシュヒットの活用:繰り返し使う System Prompt で Prompt Cache を構築します。V4-Flash のキャッシュヒットは $0.0028/M です。
- Flash で前段ルーティング:意図分類や軽量判断は V4-Flash、複雑推論のみ V4-Pro にエスカレーションします。
- 請求通知の確認:DeepSeek は料金変更の 24 時間前にメール通知を約束しています。
ピーク時でも V4-Pro 出力単価($1.74/M)は Claude Opus 4.8($15/M)や GPT-5.6 Sol(約 $15/M)の 8.6 倍安い水準です。
05 deepseek-chat 廃止と 7 月 24 日までの API 移行
重要:旧モデル名 deepseek-chat と deepseek-reasoner は 2026 年 7 月 24 日 15:59 UTC(日本時間 7 月 25 日 00:59) に永久停止します。
| 旧モデル名 | 新モデル名 | 備考 |
|---|---|---|
| deepseek-chat | deepseek-v4-flash(Non-think モード) | 高速、軽量タスク向け |
| deepseek-reasoner | deepseek-v4-flash(思考モード) | または deepseek-v4-pro でより強い推論 |
旧写法(7月24日以降は失効)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
新写法
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
V4 は OpenAI ChatCompletions 形式と Anthropic Messages 形式の両方に対応しています。base_url は変更せず、model パラメータのみ更新すれば移行できます。
以下は主要な公式ソースです。発版やページ更新後はリンクを再確認してください。
https://arxiv.org/abs/2606.19348
https://huggingface.co/deepseek-ai
六ステップ移行チェックリスト:
- 旧モデル名の全庫検索:コードリポジトリ、CI 設定、環境変数から
deepseek-chatとdeepseek-reasonerを洗い出します。 - 置換マッピングの確定:軽量対話は
deepseek-v4-flash(Non-think)、推論タスクは Flash 思考モードまたはdeepseek-v4-proに振り分けます。 - SDK 呼び出しの更新:OpenAI 互換 API は
modelのみ変更。Anthropic SDK もbase_url=https://api.deepseek.comは据え置きです。 - 思考モードの設定:旧 reasoner ユーザーは
extra_bodyで thinking を有効化します。Think Max は 384K+ コンテキストが必要です。 - Staging での検証:7 月 24 日前に E2E テストを完了し、ピーク料金が予算に与える影響を確認します。
- オフピークへのバッチ移行:文書バッチ処理やコードレビューを 18:00 以降や週末に cron し、Prompt Cache と組み合わせてコストを最小化します。
引用可能な技術データ(EEAT):
- SWE-bench Verified 80.6%:オープンモデル最高得点、Gemini 3.1 Pro と同率(出典:DeepSeek 公式ドキュメント、2026-07)。
- KV Cache メモリ 10%:1M token シナリオで V3.2 の 10%、V4-Flash は 7%(出典:arXiv:2606.19348)。
- コスパ 116 倍:Artificial Analysis Strategy & Ops タスクで V4-Pro $0.03 vs Fable 5 $3.48(出典:Artificial Analysis、2026-07)。
まとめ:DeepSeek V4 GA の価値は、Claude Fable 5 や GPT-5.6 を今すぐ上回ることではなく、クローズドフラッグシップの 1/10 から 1/100 のコストで、オープンモデル中最高クラスの性能を提供することにあります。ピーク料金は試算を複雑にしますが、全体として依然として競争力は極めて高いです。
DeepSeek V4 API を OpenClaw Gateway や Cursor Agent に接続する場合、個人 Mac のスリープは SWE-bench 級の長時間タスクを中断し、ピーク帯の 24 時間パイプラインもノート PC では安定稼働しません。API 単体ではローカル GPU は不要ですが、ローカル Gateway + クラウド推論 + 7×24 オーケストレーションのハイブリッド構成では、常時稼働 Agent の安定性がボトルネックになります。AI プログラミング Agent、OpenClaw マルチモデルルーティング、長時間 Agent ループの 7×24 運用が必要な本番環境では、CALMVPS のベアメタル Mac Mini レンタルが現実的な選択肢です。Apple Silicon 独占、Metal ネイティブ加速、月単位の柔軟契約、約 120 秒でプロビジョニング可能です。詳細は 料金ページをご確認ください。