DeepSeek V4 Flash 正式版上線:
跑分逼近 Opus 4.8,價格卻只要幾十分之一,Pro 版還要再等等

2026 年 7 月 31 日,DeepSeek 將 V4-Flash 升級為官方正式版(build 0731):284B 總參數 / 13B 激活規模不變,僅靠重新後訓練就在多項 Agent 基準上反超自家更大的 V4-Pro 預覽版,API 定價僅為 Claude Opus 4.8 的幾十分之一。旗艦 V4-Pro 官方版與自研 Agent 框架 Harness 仍未發布。

本文面向接入 DeepSeek API、搭建 Agent 流水線、評估國產開源大模型性價比的開發者:梳理4 月至 8 月完整時間線、官方定價與第三方 Intelligence Index 對照、CSA+HCA 架構與 Harness 跑分敏感性、Kimi K3 / GLM-5.2 / Qwen3.8-Max 橫向對比、跑分爭議與「斬殺線」價格戰背景,並給出六步 API 遷移清單與 FAQ。讀完應能回答:現在該用 Flash 還是 Pro、跑分能不能信、舊介面怎麼切。

01 DeepSeek V4 Flash 正式版時間線:從 4 月預覽到 7 月 API 公測

這不是一次「換架構發新模型」,而是同一套 284B MoE 在三個月視窗內的連續迭代——每一步都被社群放大討論:

  • 2026 年 4 月 24 日:DeepSeek-V4 預覽版首次發布並開源,含 V4-Pro(1.6T 總參數 / 49B 激活)與 V4-Flash(284B / 13B),均支援 100 萬 token 上下文,MIT 協議。
  • 2026 年 7 月 24 日:舊介面模型名 deepseek-chatdeepseek-reasoner 正式停用,全部流量切換到 V4 系列命名。
  • 2026 年 7 月 27 日:月之暗面 Kimi K3(2.8T 總參數)開源權重上線 Hugging Face,給 DeepSeek 製造直接競爭壓力。
  • 2026 年 7 月 31 日:deepseek-v4-flash 正式版(0731)進入 API 公測,開源權重同步 Hugging Face;changelog 首次點名自研 Agent 框架 Harness,稱將隨 V4 正式版發布。僅限 API——App 與網頁端暫未同步。
  • 截至 2026 年 8 月 5 日:V4-Pro 官方版仍是「盡快發布」,無官方確認日期。部分中文媒體援引未署名消息源稱內部測試已在 7 月 28 日那週啟動、GA 視窗或在 8 月 10–20 日——未經 DeepSeek 官方證實,僅供參考

性能提升完全來自後訓練,而非擴大參數——284B Flash 在 Agent 基準上反超 1.6T V4-Pro 預覽版,說明 2026 年下半年競爭焦點正在從「堆參數」轉向「後訓練品質」。

02 DeepSeek V4 Flash 定價與競品參數對照(2026 年 8 月)

以下定價均為廠商公開數據(「廠商自報」),DeepSeek 已預告未來將對 API 啟用北京時間 9–12 點、14–18 點高峰時段 2 倍加價,截至發稿未公布具體生效日期。

DeepSeek V4 Flash 與國產開源旗艦定價對照
模型 狀態 總參數 / 激活 輸入(快取未命中/命中,$/百萬 token) 輸出($/百萬 token)
DeepSeek-V4-Flash-0731官方正式版(07-31)284B / 13B$0.14 / $0.0028$0.28
DeepSeek-V4-Pro預覽版(官方版未發布)1.6T / 49B$0.435 / $0.003625$0.87
Kimi K3權重開源(07-27)2.8T / 約 104B(社群估算)$3.00 / $0.30$15.00
GLM-5.2開源(2026 年 6 月)~744B / ~40B本文未獨立核實
Qwen3.8-MaxAPI GA(08-02),權重待放出2.4T / 95B$2.00 / ~$0.17–0.25$6.00

第三方評測機構 Artificial Analysis 的 Intelligence Index 與單任務成本(經財經媒體轉引)呈現另一種視角:

Artificial Analysis 獨立指數 vs 單任務成本(與廠商自報跑分方法論不同)
模型 Intelligence Index 單任務平均成本
DeepSeek-V4-Flash-073150$0.03
Kimi K357$0.86
GPT-5.6 Sol比 Flash 高約 9 分$1.86
Claude Fable 5比 Flash 高約 9 分$3.15

V4-Flash 的智能分並非最高,但單任務成本約為 Kimi K3 的 1/29、Claude Fable 5 的 1/105——DeepSeek 打的是「夠用智能 + 極致價格」,而非「跑分第一」。

03 後訓練如何「變出」跑分:CSA+HCA、Harness 與百萬上下文效率

架構沒變,變的是後訓練。 DeepSeek 官方明確:V4-Flash-0731 與 4 月預覽版參數規模與結構完全相同,性能提升完全來自重新後訓練。技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》描述三處關鍵架構(自 4 月預覽沿用):

  • 混合注意力(CSA + HCA):對外稱 DSA 稀疏注意力,降低長上下文計算與顯存開銷。
  • 流形約束超連接(mHC):改進傳統殘差連接結構。
  • Muon 優化器:替換傳統優化器,提升訓練收斂速度與穩定性。

官方指標(尚未見獨立第三方複現):百萬 token 上下文下,V4-Pro 單 token 推理 FLOPs 僅為 V3.2 的 27%,KV Cache 佔用僅為 10%

Harness 首次亮相。 7 月 31 日 changelog 正式命名 DeepSeek Harness——自研 Agent 執行框架,對標 Claude Code,用於檔案讀寫、工具呼叫與端到端工程任務。此前 DeepSeek 模型主要依賴 Claude Code、OpenCode 等第三方工具。官方 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部用 Harness「極簡模式」(minimal mode)測得,參數為 max 檔位、top_p=0.95、temperature=1.0。changelog 主動提示:「跑分對 harness 選擇非常敏感」——這句話值得讀者留意。

據 21 世紀經濟報導轉引海外開發者反饋,正式版還存在輸入快取命中率偏低、安全分類器偶發逾時等可用性問題,與「跑分暴漲」敘事形成一定反差。

04 Kimi K3、GLM-5.2、Qwen3.8-Max 混戰與六步 API 遷移落地

V4-Flash-0731 落在中國大模型開源陣營最密集視窗期。對 Agent 與批量呼叫場景,選型邏輯已從「誰跑分最高」轉向「誰能在可接受智能下限內把帳單壓到最低」。

六步落地指南(遷移到 V4-Flash-0731 官方版):

  1. 核對舊模型名是否已停用: 自 7 月 24 日起 deepseek-chat / deepseek-reasoner 已退役,須改用 deepseek-v4-flashdeepseek-v4-pro(預覽)。
  2. 確認呼叫入口: 0731 正式版僅限 API,App 與網頁端可能仍為舊版;生產環境以 API changelog 為準。
  3. 保持 SDK 相容: OpenAI ChatCompletions 與 Anthropic 格式接入無需改程式碼,deepseek-v4-flash 會自動指向新官方版本。
  4. 區分兩類跑分: SWE-bench Verified 等第三方廣泛採用的基準可信度較高;Terminal Bench 2.0 等 Agent 跑分依賴未公開的 Harness,勿直接橫向套用到 Claude Code / Cursor。
  5. 在真實工作流 A/B 測試: 用自有程式碼庫與 Agent 流水線對比 Flash、Kimi K3、Qwen3.8-Max 的實際成功率與 Token 帳單,勿僅憑廠商自報數字遷移。
  6. 關注 V4-Pro 與 Harness GA: 官方 changelog 僅寫「盡快發布」;任何「8 月 10–20 日」具體視窗均屬未證實傳言,以 DeepSeek 官方帳號與 api-docs 更新為準。

官方文檔與更新日誌請參閱 DeepSeek API 文檔站(發版後請再次打開連結核對最新定價與模型名):

https://api-docs.deepseek.com/

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash

05 跑分爭議、斬殺線與 Agent 基礎設施選型收束

  • Terminal Bench 2.0: V4-Flash-0731 廠商自報 82.7 分,V4-Pro 預覽版 67.9 分——均基於未公開 Harness minimal mode,應視為「廠商 + 特定框架」結果。
  • 價格倍率(據 21 世紀經濟報導): 相對 Claude Opus 4.8,快取未命中輸入約便宜 36 倍,快取命中輸入約 179 倍,輸出約 89 倍(廠商標價,非獨立審計)。
  • 「斬殺線」: 中文開發者社群用語,指 DeepSeek「夠用性能 + 極端低價」組合給同行設下的生存門檻——友商若性能無明顯超越又無法更低定價,便可能失去市場存在感。

FAQ 速答

  • V4 和 V3.2 最大區別? 原生 100 萬 token 上下文,長上下文 FLOPs / KV Cache 大幅壓縮;Agent 能力專項優化,適配 Claude Code、OpenCode 等工具。
  • 日常選 Flash 還是 Pro? 批量呼叫、Agent 流水線優先 Flash-0731;更深世界知識與複雜推理可暫用 Pro 預覽版,等官方版再評估。
  • V4-Pro 官方版能用了嗎? 截至 8 月 5 日不能;僅 Flash-0731 為官方版且限 API。
  • 跑分能直接信嗎? 第三方廣泛基準可參考;Harness 依賴型 Agent 跑分建議等社群用 Claude Code / Cursor 獨立複現。

若 Agent 工作流完全押在雲端 API上,短板是網路延遲、Token 帳單波動與模型路由變更;純本地 Hugging Face 權重部署則受統一記憶體、7×24 穩定性與多節點擴展限制。對需要完整 macOS 環境跑 Claude Code、OpenCode、OpenClaw 與 Xcode CI/CD、且希望節點 7×24 線上的團隊,CALMVPS 裸金屬 Mac Mini M4 租賃通常是更優解:獨占 Apple Silicon、六地節點彈性切換、120 秒交付。機型與即時價格見 CALMVPS 定價頁

發布前請核實最新定價、跑分及 V4-Pro / Harness 上線狀態,本文數據截至 2026 年 8 月 5 日。