2026 年 7 月 31 日、DeepSeek は V4-Flash を公式正式版(ビルド 0731)へ昇格させました。2840 億総パラメータ / 130 億活性の規模は据え置きで、再後学習のみにより複数の Agent ベンチで自社のより大きい V4-Pro プレビュー版を上回り、API 価格は Claude Opus 4.8 の数十分の一です。主力 V4-Pro 正式版と自社 Agent フレームワーク Harness はまだ未公開です。
本稿はDeepSeek API 接続、Agent パイプライン構築、国産オープンソース LLM の費用対効果評価を行う開発者向けです。4 月から 8 月までのタイムライン、公式料金と第三者 Intelligence Index の対照、CSA+HCA アーキテクチャと Harness のベンチ感度、Kimi K3 / GLM-5.2 / Qwen3.8-Max との横比較、ベンチ争点と「キルライン」価格戦の背景を整理し、六段階 API 移行チェックリストと FAQを提供します。読了後、「今 Flash と Pro のどちらを使うべきか」「ベンチは信頼できるか」「旧インターフェースはどう切り替えるか」を判断できる状態を目指します。
01 DeepSeek V4 Flash 正式版タイムライン:4 月プレビューから 7 月 API 公測まで
これは「アーキテクチャを変えて新モデルを出す」話ではなく、同一の 284B MoE が三か月の窓の中で連続改善されたプロセスです。各ステップがコミュニティで大きく議論されました。
- 2026 年 4 月 24 日:DeepSeek-V4 プレビュー版が初公開・オープンソース化。V4-Pro(1.6T 総パラメータ / 490 億活性)と V4-Flash(284B / 130 億)を含み、いずれも 100 万 tokenコンテキスト、MIT ライセンスです。
- 2026 年 7 月 24 日:旧モデル名
deepseek-chatとdeepseek-reasonerが正式停止し、全トラフィックが V4 系列の命名へ切り替わりました。 - 2026 年 7 月 27 日:月之暗面の Kimi K3(2.8T 総パラメータ)が Hugging Face でウェイト公開され、DeepSeek に直接の競合圧力を与えました。
- 2026 年 7 月 31 日:
deepseek-v4-flash正式版(0731)が API 公測に入り、オープンウェイトも Hugging Face で同期公開されました。changelog で自社 Agent フレームワーク Harness が初めて明記され、V4 正式版と同時リリース予定とされています。API 限定で、アプリと Web 版は未同期です。 - 2026 年 8 月 5 日時点:V4-Pro 正式版は依然「できるだけ早く公開」のみで、公式確定日はありません。一部中国メディアは匿名ソースとして内部テストが 7 月 28 日週に始まり、GA 窓が 8 月 10–20 日との未確認情報を引用していますが、DeepSeek 公式の確認はありません。参考情報として扱ってください。
性能向上は完全に後学習に由来し、パラメータ拡大ではありません。284B Flash が Agent ベンチで 1.6T V4-Pro プレビューを上回ったことは、2026 年下半期の競争焦点が「パラメータ積み上げ」から「後学習品質」へ移っていることを示しています。
02 DeepSeek V4 Flash 料金と競合パラメータ対照(2026 年 8 月)
以下の料金はいずれもベンダー公開データ(「ベンダー自報」)です。DeepSeek は将来、北京時間 9–12 時・14–18 時のピーク時間帯に 2 倍料金を API に適用する予定と告知していますが、執筆時点では具体の発効日は未公表です。
| モデル | 状態 | 総パラメータ / 活性 | 入力(キャッシュ未ヒット/ヒット、$/百万 token) | 出力($/百万 token) |
|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 公式正式版(07-31) | 284B / 13B | $0.14 / $0.0028 | $0.28 |
| DeepSeek-V4-Pro | プレビュー版(正式版未公開) | 1.6T / 49B | $0.435 / $0.003625 | $0.87 |
| Kimi K3 | ウェイト公開(07-27) | 2.8T / 約 104B(コミュニティ推定) | $3.00 / $0.30 | $15.00 |
| GLM-5.2 | オープンソース(2026 年 6 月) | ~744B / ~40B | 本稿では独立検証していません | |
| Qwen3.8-Max | API GA(08-02)、ウェイト未公開 | 2.4T / 95B | $2.00 / ~$0.17–0.25 | $6.00 |
第三者評価機関 Artificial Analysis の Intelligence Index と単タスクコスト(経済メディア経由の転載)は、別の視点を提示します。
| モデル | Intelligence Index | 単タスク平均コスト |
|---|---|---|
| DeepSeek-V4-Flash-0731 | 50 | $0.03 |
| Kimi K3 | 57 | $0.86 |
| GPT-5.6 Sol | Flash より約 9 点高い | $1.86 |
| Claude Fable 5 | Flash より約 9 点高い | $3.15 |
V4-Flash のインテリジェンススコアは最高ではありませんが、単タスクコストは Kimi K3 の約 1/29、Claude Fable 5 の約 1/105 です。DeepSeek が狙っているのは「ベンチ一位」ではなく「十分な知性+極限価格」です。
Claude Opus 4.8 との価格倍率(21 世紀経済報道の転載)では、キャッシュ未ヒット入力は約 36 倍安く、キャッシュヒット入力は約 179 倍、出力は約 89 倍安いとされています(ベンダー表示価格であり、独立監査ではありません)。
03 後学習がベンチを押し上げる仕組み:CSA+HCA、Harness、百万コンテキスト効率
アーキテクチャは変わらず、後学習が変わりました。 DeepSeek 公式は、V4-Flash-0731 と 4 月プレビュー版でパラメータ規模と構造が完全に同一であることを明言しています。性能向上は再後学習のみに由来します。技術レポート『DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence』は、4 月プレビューから継続する三つの主要アーキテクチャを説明しています。
- ハイブリッド Attention(CSA + HCA):対外には DSA スパース Attention と称され、長コンテキストの計算と KV キャッシュ負荷を抑えます。
- 流形制約ハイパーコネクション(mHC):従来の残差接続構造を改良します。
- Muon オプティマイザ:従来オプティマイザを置き換え、学習収束速度と安定性を向上させます。
公式指標(執筆時点で独立第三者の再現は未確認):百万 token コンテキスト下で、V4-Pro の単 token 推論 FLOPs は V3.2 の 27%、KV Cache 占有は 10% です。
Harness が初めて公式に登場しました。 7 月 31 日の changelog で DeepSeek Harness が命名されました。これは Claude Code に相当する自社 Agent 実行フレームワークで、ファイル読み書き、ツール呼び出し、エンドツーエンドのエンジニアリングタスクを担います。これまで DeepSeek モデルは主に Claude Code、OpenCode 等の第三者ツールに依存していました。公式 Agent ベンチ(Terminal Bench 2.0、Toolathlon 等)はすべて Harness「ミニマルモード」(minimal mode)で測定され、パラメータは max 档、top_p=0.95、temperature=1.0 です。changelog は「ベンチは harness 選択に非常に敏感」と明示しています。この一文は読者が留意すべき点です。
21 世紀経済報道が海外開発者のフィードバックを転載しているところによると、正式版では入力キャッシュヒット率の低さ、セーフティ分類器の偶発タイムアウトなどの実用性課題も報告され、「ベンチ急騰」ナラティブと一定の対比をなしています。
04 Kimi K3、GLM-5.2、Qwen3.8-Max 争奪戦と六段階 API 移行ガイド
V4-Flash-0731 は中国大規模言語モデルのオープンソース陣営が最も密集する窓に着地しました。Agent とバッチ呼び出しシナリオでは、選定ロジックは「誰のベンチが最高か」から「許容できる知性下限の中で請求を最小化できるか」へ移っています。
六段階導入ガイド(V4-Flash-0731 正式版への移行):
- 旧モデル名の停止を確認する: 7 月 24 日以降
deepseek-chat/deepseek-reasonerは退役済みです。deepseek-v4-flashまたはdeepseek-v4-pro(プレビュー)へ切り替えてください。 - 呼び出し入口を確認する: 0731 正式版はAPI 限定です。アプリと Web は旧版の可能性があります。本番環境は API changelog を基準にしてください。
- SDK 互換を維持する: OpenAI ChatCompletions と Anthropic 形式の接続ではコード変更は不要です。
deepseek-v4-flashは自動的に新正式版を指します。 - 二種類のベンチを区別する: SWE-bench Verified 等、第三者が広く採用するベンチは信頼度が比較的高いです。Terminal Bench 2.0 等の Agent ベンチは未公開 Harness に依存するため、Claude Code / Cursor へ直接横比較しないでください。
- 実ワークフローで A/B テストする: 自社コードベースと Agent パイプラインで Flash、Kimi K3、Qwen3.8-Max の実成功率と Token 請求を比較し、ベンダー自報数値だけで移行判断しないでください。
- V4-Pro と Harness GA を追跡する: 公式 changelog は「できるだけ早く公開」のみです。「8 月 10–20 日」等の具体窓はすべて未確認の噂です。DeepSeek 公式アカウントと api-docs の更新を基準にしてください。
公式ドキュメントと更新ログは DeepSeek API ドキュメントサイトを参照してください(リリース後はリンクを再開して最新料金とモデル名を確認してください)。
05 ベンチ争点、キルライン、Agent インフラ選定のまとめ
- Terminal Bench 2.0: V4-Flash-0731 のベンダー自報は 82.7 点、V4-Pro プレビューは 67.9 点です。いずれも未公開 Harness minimal mode ベースであり、「ベンダー+特定フレームワーク」の結果として扱ってください。
- 価格倍率(21 世紀経済報道): Claude Opus 4.8 比で、キャッシュ未ヒット入力は約 36 倍安く、キャッシュヒット入力は約 179 倍、出力は約 89 倍安い(ベンダー表示、独立監査ではありません)。
- 「キルライン」(斩杀线): 中国開発者コミュニティの用語で、DeepSeek の「十分な性能+極端な低価格」組み合わせが同業者に課す生存閾値を指します。性能で明確に上回れず、さらに低価格も実現できない競合は、市場での存在感を失うリスクがあります。日本語圏では「価格のキルライン」「参入障壁ライン」として議論されることもあります。
よくある質問 FAQ:
- Q: V4 と V3.2 の最大の違いは何ですか? A: ネイティブ 100 万 token コンテキスト、長コンテキスト FLOPs / KV Cache の大幅圧縮、Agent 能力の特化最適化で、Claude Code、OpenCode 等のツールに適合しています。
- Q: 日常利用では Flash と Pro のどちらを選ぶべきですか? A: バッチ呼び出しと Agent パイプラインは Flash-0731 を優先してください。より深い世界知識と複雑推論は Pro プレビューで暫定対応し、正式版公開後に再評価するのが妥当です。
- Q: V4-Pro 正式版は使えますか? A: 8 月 5 日時点では使えません。公式版は Flash-0731 のみで、API 限定です。
- Q: ベンチスコアはそのまま信頼できますか? A: 第三者が広く採用するベンチは参考にできます。Harness 依存の Agent ベンチは、コミュニティが Claude Code / Cursor で独立再現するまで慎重に扱ってください。
Agent ワークフローをクラウド API 呼び出しのみに依存すると、ネットワーク遅延、Token 請求の予測困難、モデルルート変更時の移行コストがボトルネックになります。純ローカルの Hugging Face ウェイトデプロイはユニファイドメモリ上限、7×24 安定性、マルチノード拡張に制約があります。Claude Code、OpenCode、OpenClaw、Xcode CI/CD をフル macOS 環境で動かし、Agent ノードを 7×24 常時稼働させたいチームには、CALMVPS ベアメタル Mac Mini M4 レンタルが通常より適しています。Apple Silicon 専有、六地域ノードの柔軟切替、約 120 秒デプロイで重 Agent ループをクラウドにオフロードできます。詳細は料金ページをご確認ください。
本番移行前に最新料金、ベンチ数値、V4-Pro / Harness の公開状況を公式ソースで再確認してください。本稿データは 2026 年 8 月 5 日時点です。