歷時三個月,DeepSeek V4 滿血版(GA 正式版)終於在 2026 年 7 月 20 日全面開放。相較 4 月預覽版,正式版在 Agent 協作、數學推理與程式碼生成上均有針對性強化,並首度導入峰谷差異化計費——標誌著 DeepSeek 從「近乎零成本試用」邁向有紀律的商業化營運。
本文面向正在評估 API 選型、關注開源權重與成本控管的 AI 開發者與產品團隊,從技術架構、Benchmark 跑分、定價策略、與 GPT-5.6 / Claude Fable 5 的橫向對比,以及 7 月 24 日截止的 API 遷移五個維度做完整解讀。
01 DeepSeek V4 GA 上線:從預覽版到滿血版的時間線
選型前的真實痛點:
- 舊介面名即將失效:
deepseek-chat與deepseek-reasoner將於 7 月 24 日永久下線,生產程式若未遷移將直接中斷。 - 峰谷計費增加複雜度:工作日 09:00–12:00、14:00–18:00 費率翻倍,7×24 Agent 流水線需重新排程。
- 預覽版與 GA 性能差:滿血版在 Agent、數學、程式碼上有專項提升,不能沿用 4 月基準做決策。
- Pro vs Flash 分流不清:1.6T 與 284B 規格差異大,錯誤路由會浪費預算或犧牲品質。
| 時間 | 事件 |
|---|---|
| 2026-04-24 | V4 預覽版上線 + 開源(MIT),含 V4-Pro(1.6T)和 V4-Flash(284B) |
| 2026-05 | V4-Flash 與 V4-Pro 生產調優版本上線,API 正式可用 |
| 2026-06 | V4-Pro 輸出價永久降價 75% 至 $0.87/M tokens |
| 2026-06-29 | DeepSeek 郵件通知全體 API 使用者:GA 將於 7 月中旬上線,首度披露峰谷計費 |
| 2026-07-19 | 多位開發者獲 GA 灰度內測資格,媒體報導「滿血版最快明日發布」 |
| 2026-07-20 | GA 正式版上線(本文發布日) |
| 2026-07-24 | 舊介面名 deepseek-chat / deepseek-reasoner 永久下線 |
一句話總結:V4 預覽版已經很強,滿血版在此基礎上做了 Agent 能力、數學推理和程式碼生成的專項提升,同時配套了正式的商業化計費體系。
02 DeepSeek V4 架構解析:CSA、HCA 與百萬 token 上下文
| 規格 | V4-Pro | V4-Flash |
|---|---|---|
| 總參數量 | 1.6 萬億(1.6T) | 2840 億(284B) |
| 每 Token 啟用參數 | 490 億(49B) | 130 億(13B) |
| Transformer 層數 | 61 層 | 43 層 |
| 上下文視窗 | 1,000,000 tokens | 1,000,000 tokens |
| 最大輸出 | 384K tokens | 384K tokens |
| 精度 | FP4(專家權重)+ FP8(其餘) | FP4 + FP8 混合 |
| 預訓練資料量 | 33T+ tokens | 32T+ tokens |
| 開源協議 | MIT | MIT |
DeepSeek V4 捨棄 V2/V3 時代的多頭潛在注意力(MLA),改採兩種全新注意力機制的混合體:
- 壓縮稀疏注意力(CSA):透過 Softmax 門控池化將 KV 序列壓縮 4 倍,再以 FP4 精度的「閃電索引器」做 top-k 稀疏選擇(Pro 選 top-1024,Flash 選 top-512),同時保留最近 128 個 token 滑動視窗。1M 上下文下相比 V3.2 僅需 27% 推理 FLOPs。
- 重度壓縮注意力(HCA):將 token 壓縮 128 倍後進行全域密集注意力,擷取長程依賴,與 CSA 形成互補。V4-Flash 前 2 層用 HCA,之後 CSA/HCA 交替;V4-Pro 結構類似。
- 流形約束超連接(mHC):引入 4 通道殘差流,透過滿足雙隨機矩陣約束的混合矩陣,確保 61 層深網路中訊號穩定傳播。
- Muon 優化器:訓練時採用 Muon 而非 AdamW,透過牛頓-舒爾茨正交化處理梯度,收斂更快、訓練更穩定。
綜合效果:1M token 場景下 KV 快取記憶體僅為 V3.2 的 10%(V4-Flash 低至 7%)。
| 模式 | 特點 | 適用場景 |
|---|---|---|
| Non-think | 無思維鏈,極速回應 | 簡單問答、路由分發 |
| Think High | 顯式推理(thinking 標籤) | 中等複雜任務、程式碼除錯 |
| Think Max | 最大推理力度,需 384K+ 上下文 | 複雜數學、長鏈路 Agent |
官方推薦取樣參數:temperature=1.0, top_p=1.0(全模式通用)。
03 DeepSeek V4 Benchmark 跑分:與 GPT-5.6、Claude Fable 5 怎麼比?
| 基準測試 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6%(開源最高) | 96.0% | 未單獨公布 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
根據 Artificial Analysis 評測:Claude Fable 5 在 Strategy & Ops 指數任務每次花費 $3.48(得分 50),DeepSeek V4-Pro 同類任務每次僅 $0.03(得分 38)。Fable 5 成本是 V4-Pro 的 116 倍,得分僅高出約 12 分。
| 維度 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 開源 / 可自託管 | MIT,支援 | 閉源 | 閉源 |
| 上下文視窗 | 1M tokens | 未公開 | 1M tokens |
| API 輸出價(平時) | $0.87/M | ~$15/M | $50/M |
| API 輸出價(高峰) | $1.74/M | — | — |
| 程式碼能力 | 極強(接近 Fable 5) | 極強 | 最強(SWE-bench Pro 領先) |
| 資料隱私 | 可私有部署 | 不可 | 不可 |
場景選型建議:預算有限 / 高頻呼叫 / 私有部署 → V4-Pro 或 V4-Flash;極致程式碼能力、不在乎成本 → Claude Fable 5;複雜演算法 + 數學推理 → GPT-5.6 Sol / Ultra;超大規模日誌處理 → V4-Flash(快取命中輸入僅 $0.0028/M)。
04 DeepSeek V4 峰谷計費怎麼算?省錢實操指南
GA 版本最受關注的變化:DeepSeek 首度引入峰谷差異化定價,類似電網分時電價。高峰時段(北京時間):工作日 09:00–12:00 和 14:00–18:00,費率翻倍。
| 模型 | 計費項 | 平時(Off-Peak) | 高峰(Peak) |
|---|---|---|---|
| V4-Pro | 輸入(快取命中) | ¥0.025 / $0.0035 / 1M | 翻倍 |
| V4-Pro | 輸入(快取未命中) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 / 1M |
| V4-Pro | 輸出 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 / 1M |
| V4-Flash | 輸入(快取命中) | ¥0.02 / $0.0028 / 1M | 翻倍 |
| V4-Flash | 輸入(快取未命中) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 / 1M |
| V4-Flash | 輸出 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 / 1M |
省錢四策略:
- 非即時任務排到非高峰:批次文件處理、資料標註、程式碼審查安排在 18:00 之後或 9:00 之前。
- 善用快取命中:重複 System Prompt 建構 Prompt Cache,V4-Flash 快取命中成本僅 $0.0028/M。
- Flash 做分流:簡單意圖識別、路由判斷用 V4-Flash,複雜推理再轉 V4-Pro。
- 關注帳單通知:DeepSeek 承諾計費變更 24 小時前郵件通知。
即使在高峰期,V4-Pro 輸出價($1.74/M)仍比 Claude Opus 4.8($15/M)和 GPT-5.6 Sol(約 $15/M)便宜 8.6 倍。
05 deepseek-chat 停用遷移指南與總結(7 月 24 日截止)
重要警告:舊模型名 deepseek-chat 和 deepseek-reasoner 將於 2026 年 7 月 24 日 15:59 UTC(北京時間 7 月 24 日 23:59) 永久停止存取。
| 舊模型名 | 新模型名 | 備註 |
|---|---|---|
| deepseek-chat | deepseek-v4-flash(非思考模式) | 速度快,適合輕量任務 |
| deepseek-reasoner | deepseek-v4-flash(思考模式) | 或升級到 deepseek-v4-pro 獲取更強推理 |
舊寫法(7 月 24 日後失效)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
新寫法
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
V4 同時支援 OpenAI ChatCompletions 格式和 Anthropic Messages 格式,base_url 不變,僅需更新 model 參數。使用 Anthropic SDK 時,base_url=https://api.deepseek.com 同樣無需修改,只替換模型名稱即可。
以下為主要官方來源,發版或頁面更新後請再次開啟連結核對:
https://arxiv.org/abs/2606.19348
https://huggingface.co/deepseek-ai
六步遷移落地:
- 全庫搜尋舊模型名:在程式碼儲存庫、CI 設定、環境變數中搜尋
deepseek-chat和deepseek-reasoner。 - 確定替換映射:輕量對話走
deepseek-v4-flash(Non-think),推理任務走 Flash 思考模式或deepseek-v4-pro。 - 更新 SDK 呼叫:OpenAI 相容介面僅改
model參數;Anthropic SDK 同樣base_url=https://api.deepseek.com不變。 - 設定思考模式:原 reasoner 使用者透過
extra_body啟用 thinking,Think Max 需 384K+ 上下文。 - Staging 環境驗證:在 7 月 24 日前完成端到端測試,確認峰谷計費對預算的影響。
- 排程非高峰批處理:將文件批處理、程式碼審查等任務 cron 到 18:00 後或週末,配合 Prompt Cache 最大化省錢。
可引用關鍵資料(EEAT):
- SWE-bench Verified 80.6%:開源模型最高分,與 Gemini 3.1 Pro 並列(來源:DeepSeek 官方文件,2026-07)。
- KV 快取記憶體 10%:1M token 場景下僅為 V3.2 的 10%,V4-Flash 低至 7%(來源:arXiv:2606.19348)。
- 性價比 116 倍:Artificial Analysis Strategy & Ops 任務,V4-Pro 每次 $0.03 vs Fable 5 每次 $3.48(來源:Artificial Analysis,2026-07)。
總結:DeepSeek V4 GA 正式版的價值不在於能否擊敗 Claude Fable 5 或 GPT-5.6(暫時還不能),而在於以閉源旗艦 1/10 乃至 1/100 的成本提供開源模型中無可爭議的最強性能。峰谷計費增加了成本複雜度,但本質上仍極具競爭力。
把 DeepSeek V4 API 接到本地 OpenClaw Gateway 或 Cursor Agent 時,個人 Mac 休眠會中斷長時 SWE-bench 類任務,峰谷時段的 7×24 流水線也難以在筆電上穩定排程。純 API 呼叫雖無需本地 GPU,但混合架構(本地 Gateway + 雲端推理 + 7×24 編排節點)的生產團隊常面臨本地機器不穩定、無法保證 Agent 常駐的痛點。對於需要 AI 程式設計 Agent、OpenClaw 多模型路由或長時 Agent 迴圈 7×24 穩定執行的生產環境,CALMVPS 裸機 Mac Mini 租賃通常是較優解:獨占 Apple Silicon、Metal 原生加速、按月彈性下單,約 120 秒交付。詳見 定價頁。