DeepSeek V4 Flash 正式版:
Opus 4.8に迫るスコア、価格は数十分の一、Pro版はまだ待ち

2026 年 7 月 31 日、DeepSeek は V4-Flash を公式正式版(ビルド 0731)へ昇格させました。2840 億総パラメータ / 130 億活性の規模は据え置きで、再後学習のみにより複数の Agent ベンチで自社のより大きい V4-Pro プレビュー版を上回り、API 価格は Claude Opus 4.8 の数十分の一です。主力 V4-Pro 正式版と自社 Agent フレームワーク Harness はまだ未公開です。

本稿はDeepSeek API 接続、Agent パイプライン構築、国産オープンソース LLM の費用対効果評価を行う開発者向けです。4 月から 8 月までのタイムライン、公式料金と第三者 Intelligence Index の対照、CSA+HCA アーキテクチャと Harness のベンチ感度、Kimi K3 / GLM-5.2 / Qwen3.8-Max との横比較、ベンチ争点と「キルライン」価格戦の背景を整理し、六段階 API 移行チェックリストと FAQを提供します。読了後、「今 Flash と Pro のどちらを使うべきか」「ベンチは信頼できるか」「旧インターフェースはどう切り替えるか」を判断できる状態を目指します。

01 DeepSeek V4 Flash 正式版タイムライン:4 月プレビューから 7 月 API 公測まで

これは「アーキテクチャを変えて新モデルを出す」話ではなく、同一の 284B MoE が三か月の窓の中で連続改善されたプロセスです。各ステップがコミュニティで大きく議論されました。

  • 2026 年 4 月 24 日:DeepSeek-V4 プレビュー版が初公開・オープンソース化。V4-Pro(1.6T 総パラメータ / 490 億活性)と V4-Flash(284B / 130 億)を含み、いずれも 100 万 tokenコンテキスト、MIT ライセンスです。
  • 2026 年 7 月 24 日:旧モデル名 deepseek-chatdeepseek-reasoner が正式停止し、全トラフィックが V4 系列の命名へ切り替わりました。
  • 2026 年 7 月 27 日:月之暗面の Kimi K3(2.8T 総パラメータ)が Hugging Face でウェイト公開され、DeepSeek に直接の競合圧力を与えました。
  • 2026 年 7 月 31 日:deepseek-v4-flash 正式版(0731)が API 公測に入り、オープンウェイトも Hugging Face で同期公開されました。changelog で自社 Agent フレームワーク Harness が初めて明記され、V4 正式版と同時リリース予定とされています。API 限定で、アプリと Web 版は未同期です。
  • 2026 年 8 月 5 日時点:V4-Pro 正式版は依然「できるだけ早く公開」のみで、公式確定日はありません。一部中国メディアは匿名ソースとして内部テストが 7 月 28 日週に始まり、GA 窓が 8 月 10–20 日との未確認情報を引用していますが、DeepSeek 公式の確認はありません。参考情報として扱ってください

性能向上は完全に後学習に由来し、パラメータ拡大ではありません。284B Flash が Agent ベンチで 1.6T V4-Pro プレビューを上回ったことは、2026 年下半期の競争焦点が「パラメータ積み上げ」から「後学習品質」へ移っていることを示しています。

02 DeepSeek V4 Flash 料金と競合パラメータ対照(2026 年 8 月)

以下の料金はいずれもベンダー公開データ(「ベンダー自報」)です。DeepSeek は将来、北京時間 9–12 時・14–18 時のピーク時間帯に 2 倍料金を API に適用する予定と告知していますが、執筆時点では具体の発効日は未公表です。

DeepSeek V4 Flash と国産オープンソース旗艦の料金対照
モデル 状態 総パラメータ / 活性 入力(キャッシュ未ヒット/ヒット、$/百万 token) 出力($/百万 token)
DeepSeek-V4-Flash-0731公式正式版(07-31)284B / 13B$0.14 / $0.0028$0.28
DeepSeek-V4-Proプレビュー版(正式版未公開)1.6T / 49B$0.435 / $0.003625$0.87
Kimi K3ウェイト公開(07-27)2.8T / 約 104B(コミュニティ推定)$3.00 / $0.30$15.00
GLM-5.2オープンソース(2026 年 6 月)~744B / ~40B本稿では独立検証していません
Qwen3.8-MaxAPI GA(08-02)、ウェイト未公開2.4T / 95B$2.00 / ~$0.17–0.25$6.00

第三者評価機関 Artificial Analysis の Intelligence Index と単タスクコスト(経済メディア経由の転載)は、別の視点を提示します。

Artificial Analysis 独立指数 vs 単タスクコスト(ベンダー自報ベンチとは方法論が異なります)
モデル Intelligence Index 単タスク平均コスト
DeepSeek-V4-Flash-073150$0.03
Kimi K357$0.86
GPT-5.6 SolFlash より約 9 点高い$1.86
Claude Fable 5Flash より約 9 点高い$3.15

V4-Flash のインテリジェンススコアは最高ではありませんが、単タスクコストは Kimi K3 の約 1/29、Claude Fable 5 の約 1/105 です。DeepSeek が狙っているのは「ベンチ一位」ではなく「十分な知性+極限価格」です。

Claude Opus 4.8 との価格倍率(21 世紀経済報道の転載)では、キャッシュ未ヒット入力は約 36 倍安く、キャッシュヒット入力は約 179 倍、出力は約 89 倍安いとされています(ベンダー表示価格であり、独立監査ではありません)。

03 後学習がベンチを押し上げる仕組み:CSA+HCA、Harness、百万コンテキスト効率

アーキテクチャは変わらず、後学習が変わりました。 DeepSeek 公式は、V4-Flash-0731 と 4 月プレビュー版でパラメータ規模と構造が完全に同一であることを明言しています。性能向上は再後学習のみに由来します。技術レポート『DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence』は、4 月プレビューから継続する三つの主要アーキテクチャを説明しています。

  • ハイブリッド Attention(CSA + HCA):対外には DSA スパース Attention と称され、長コンテキストの計算と KV キャッシュ負荷を抑えます。
  • 流形制約ハイパーコネクション(mHC):従来の残差接続構造を改良します。
  • Muon オプティマイザ:従来オプティマイザを置き換え、学習収束速度と安定性を向上させます。

公式指標(執筆時点で独立第三者の再現は未確認):百万 token コンテキスト下で、V4-Pro の単 token 推論 FLOPs は V3.2 の 27%、KV Cache 占有は 10% です。

Harness が初めて公式に登場しました。 7 月 31 日の changelog で DeepSeek Harness が命名されました。これは Claude Code に相当する自社 Agent 実行フレームワークで、ファイル読み書き、ツール呼び出し、エンドツーエンドのエンジニアリングタスクを担います。これまで DeepSeek モデルは主に Claude Code、OpenCode 等の第三者ツールに依存していました。公式 Agent ベンチ(Terminal Bench 2.0、Toolathlon 等)はすべて Harness「ミニマルモード」(minimal mode)で測定され、パラメータは max 档、top_p=0.95、temperature=1.0 です。changelog は「ベンチは harness 選択に非常に敏感」と明示しています。この一文は読者が留意すべき点です。

21 世紀経済報道が海外開発者のフィードバックを転載しているところによると、正式版では入力キャッシュヒット率の低さ、セーフティ分類器の偶発タイムアウトなどの実用性課題も報告され、「ベンチ急騰」ナラティブと一定の対比をなしています。

04 Kimi K3、GLM-5.2、Qwen3.8-Max 争奪戦と六段階 API 移行ガイド

V4-Flash-0731 は中国大規模言語モデルのオープンソース陣営が最も密集する窓に着地しました。Agent とバッチ呼び出しシナリオでは、選定ロジックは「誰のベンチが最高か」から「許容できる知性下限の中で請求を最小化できるか」へ移っています。

六段階導入ガイド(V4-Flash-0731 正式版への移行):

  1. 旧モデル名の停止を確認する: 7 月 24 日以降 deepseek-chat / deepseek-reasoner は退役済みです。deepseek-v4-flash または deepseek-v4-pro(プレビュー)へ切り替えてください。
  2. 呼び出し入口を確認する: 0731 正式版はAPI 限定です。アプリと Web は旧版の可能性があります。本番環境は API changelog を基準にしてください。
  3. SDK 互換を維持する: OpenAI ChatCompletions と Anthropic 形式の接続ではコード変更は不要です。deepseek-v4-flash は自動的に新正式版を指します。
  4. 二種類のベンチを区別する: SWE-bench Verified 等、第三者が広く採用するベンチは信頼度が比較的高いです。Terminal Bench 2.0 等の Agent ベンチは未公開 Harness に依存するため、Claude Code / Cursor へ直接横比較しないでください。
  5. 実ワークフローで A/B テストする: 自社コードベースと Agent パイプラインで Flash、Kimi K3、Qwen3.8-Max の実成功率と Token 請求を比較し、ベンダー自報数値だけで移行判断しないでください。
  6. V4-Pro と Harness GA を追跡する: 公式 changelog は「できるだけ早く公開」のみです。「8 月 10–20 日」等の具体窓はすべて未確認の噂です。DeepSeek 公式アカウントと api-docs の更新を基準にしてください。

公式ドキュメントと更新ログは DeepSeek API ドキュメントサイトを参照してください(リリース後はリンクを再開して最新料金とモデル名を確認してください)。

https://api-docs.deepseek.com/

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash

05 ベンチ争点、キルライン、Agent インフラ選定のまとめ

  • Terminal Bench 2.0: V4-Flash-0731 のベンダー自報は 82.7 点、V4-Pro プレビューは 67.9 点です。いずれも未公開 Harness minimal mode ベースであり、「ベンダー+特定フレームワーク」の結果として扱ってください。
  • 価格倍率(21 世紀経済報道): Claude Opus 4.8 比で、キャッシュ未ヒット入力は約 36 倍安く、キャッシュヒット入力は約 179 倍、出力は約 89 倍安い(ベンダー表示、独立監査ではありません)。
  • 「キルライン」(斩杀线): 中国開発者コミュニティの用語で、DeepSeek の「十分な性能+極端な低価格」組み合わせが同業者に課す生存閾値を指します。性能で明確に上回れず、さらに低価格も実現できない競合は、市場での存在感を失うリスクがあります。日本語圏では「価格のキルライン」「参入障壁ライン」として議論されることもあります。

よくある質問 FAQ:

  • Q: V4 と V3.2 の最大の違いは何ですか? A: ネイティブ 100 万 token コンテキスト、長コンテキスト FLOPs / KV Cache の大幅圧縮、Agent 能力の特化最適化で、Claude Code、OpenCode 等のツールに適合しています。
  • Q: 日常利用では Flash と Pro のどちらを選ぶべきですか? A: バッチ呼び出しと Agent パイプラインは Flash-0731 を優先してください。より深い世界知識と複雑推論は Pro プレビューで暫定対応し、正式版公開後に再評価するのが妥当です。
  • Q: V4-Pro 正式版は使えますか? A: 8 月 5 日時点では使えません。公式版は Flash-0731 のみで、API 限定です。
  • Q: ベンチスコアはそのまま信頼できますか? A: 第三者が広く採用するベンチは参考にできます。Harness 依存の Agent ベンチは、コミュニティが Claude Code / Cursor で独立再現するまで慎重に扱ってください。

Agent ワークフローをクラウド API 呼び出しのみに依存すると、ネットワーク遅延、Token 請求の予測困難、モデルルート変更時の移行コストがボトルネックになります。純ローカルの Hugging Face ウェイトデプロイはユニファイドメモリ上限、7×24 安定性、マルチノード拡張に制約があります。Claude Code、OpenCode、OpenClaw、Xcode CI/CD をフル macOS 環境で動かし、Agent ノードを 7×24 常時稼働させたいチームには、CALMVPS ベアメタル Mac Mini M4 レンタルが通常より適しています。Apple Silicon 専有、六地域ノードの柔軟切替、約 120 秒デプロイで重 Agent ループをクラウドにオフロードできます。詳細は料金ページをご確認ください。

本番移行前に最新料金、ベンチ数値、V4-Pro / Harness の公開状況を公式ソースで再確認してください。本稿データは 2026 年 8 月 5 日時点です。