DeepSeek V4 满血版正式发布:
详解定价、架构与对标 GPT-5.6 的性能差距

等了整整三个月,DeepSeek V4 满血版(GA 正式版)终于在 2026 年 7 月 20 日正式上线。相比 4 月预览版,正式版带来 Agent 能力、数学推理与代码生成的专项提升,并首次引入峰谷差异化计费——标志着 DeepSeek 从「近乎免费」迈向有纪律的商业化运营。

本文面向正在评估 API 选型、关注开源权重与成本控制的 AI 开发者与产品团队,从技术架构、Benchmark 跑分、定价策略、与 GPT-5.6 / Claude Fable 5 的横向对比,以及 7 月 24 日截止的 API 迁移五个维度做完整解读。

01 DeepSeek V4 GA 上线:从预览版到满血版的时间线

选型前的真实痛点:

  • 旧接口名即将失效:deepseek-chatdeepseek-reasoner 将于 7 月 24 日永久下线,生产代码若未迁移将直接中断。
  • 峰谷计费增加复杂度:工作日 09:00–12:00、14:00–18:00 费率翻倍,24/7 Agent 流水线需重新排程。
  • 预览版与 GA 性能差:满血版在 Agent、数学、代码上有专项提升,不能沿用 4 月基准做决策。
  • Pro vs Flash 分流不清:1.6T 与 284B 规格差异大,错误路由会浪费预算或牺牲质量。
DeepSeek V4 关键时间线
时间 事件
2026-04-24 V4 预览版上线 + 开源(MIT),含 V4-Pro(1.6T)和 V4-Flash(284B)
2026-05 V4-Flash 与 V4-Pro 生产调优版本上线,API 正式可用
2026-06 V4-Pro 输出价永久降价 75% 至 $0.87/M tokens
2026-06-29 DeepSeek 邮件通知全体 API 用户:GA 将于 7 月中旬上线,首次披露峰谷计费
2026-07-19 多位开发者获 GA 灰度内测资格,媒体报道「满血版最快明日发布」
2026-07-20 GA 正式版上线(本文发布日)
2026-07-24 旧接口名 deepseek-chat / deepseek-reasoner 永久下线

一句话总结:V4 预览版已经很强,满血版在此基础上做了 Agent 能力、数学推理和代码生成的专项提升,同时配套了正式的商业化计费体系。

02 DeepSeek V4 架构解析:CSA、HCA 与百万 token 上下文

V4-Pro 与 V4-Flash 规格对照
规格 V4-Pro V4-Flash
总参数量 1.6 万亿(1.6T) 2840 亿(284B)
每 Token 激活参数 490 亿(49B) 130 亿(13B)
Transformer 层数 61 层 43 层
上下文窗口 1,000,000 tokens 1,000,000 tokens
最大输出 384K tokens 384K tokens
精度 FP4(专家权重)+ FP8(其余) FP4 + FP8 混合
预训练数据量 33T+ tokens 32T+ tokens
开源协议 MIT MIT

DeepSeek V4 抛弃了 V2/V3 时代的多头潜在注意力(MLA),采用两种全新注意力机制的混合体:

  • 压缩稀疏注意力(CSA):通过 Softmax 门控池化将 KV 序列压缩 4 倍,再用 FP4 精度的「闪电索引器」做 top-k 稀疏选择(Pro 选 top-1024,Flash 选 top-512),同时保留最近 128 个 token 滑动窗口。1M 上下文下相比 V3.2 仅需 27% 推理 FLOPs
  • 重度压缩注意力(HCA):将 token 压缩 128 倍后进行全局密集注意力,捕获长程依赖,与 CSA 形成互补。V4-Flash 前 2 层用 HCA,之后 CSA/HCA 交替;V4-Pro 结构类似。
  • 流形约束超连接(mHC):引入 4 通道残差流,通过满足双随机矩阵约束的混合矩阵,确保 61 层深网络中信号稳定传播。
  • Muon 优化器:训练时采用 Muon 而非 AdamW,通过牛顿-舒尔兹正交化处理梯度,收敛更快、训练更稳定。

综合效果:1M token 场景下 KV Cache 内存仅为 V3.2 的 10%(V4-Flash 低至 7%)。

三种推理模式
模式 特点 适用场景
Non-think 无思维链,极速响应 简单问答、路由分发
Think High 显式推理(thinking 标签) 中等复杂任务、代码调试
Think Max 最大推理力度,需 384K+ 上下文 复杂数学、长链路 Agent

官方推荐采样参数:temperature=1.0, top_p=1.0(全模式通用)。

03 DeepSeek V4 Benchmark 跑分:与 GPT-5.6、Claude Fable 5 怎么比?

V4-Pro 核心评测数据
基准测试 DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80.6%(开源最高) 96.0% 未单独公布 ~69%
SWE-bench Pro 55.4% 80.3% 78.1% 69.2%
LiveCodeBench (Pass@1) 93.5% 88.1% 87.4% 83.2%
Codeforces Elo 3,206
Terminal-Bench 2.1 83.9% 88.0% 85.1% 82.7%

根据 Artificial Analysis 评测:Claude Fable 5 在 Strategy & Ops 指数任务每次花费 $3.48(得分 50),DeepSeek V4-Pro 同类任务每次仅 $0.03(得分 38)。Fable 5 成本是 V4-Pro 的 116 倍,得分仅高出约 12 分。

三方旗舰定位对比
维度 DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
开源 / 可自托管 MIT,支持 闭源 闭源
上下文窗口 1M tokens 未公开 1M tokens
API 输出价(平时) $0.87/M ~$15/M $50/M
API 输出价(高峰) $1.74/M
代码能力 极强(接近 Fable 5) 极强 最强(SWE-bench Pro 领先)
数据隐私 可私有部署 不可 不可

场景选型建议:预算有限 / 高频调用 / 私有部署 → V4-Pro 或 V4-Flash;极致代码能力、不在乎成本 → Claude Fable 5;复杂算法 + 数学推理 → GPT-5.6 Sol / Ultra;超大规模日志处理 → V4-Flash(缓存命中输入仅 $0.0028/M)。

04 DeepSeek V4 峰谷计费怎么算?省钱实操指南

GA 版本最受关注的变化:DeepSeek 首次引入峰谷差异化定价,类似电网分时电价。高峰时段(北京时间):工作日 09:00–12:00 和 14:00–18:00,费率翻倍。

V4-Pro / V4-Flash 完整价格表
模型 计费项 平时(Off-Peak) 高峰(Peak)
V4-Pro 输入(缓存命中) ¥0.025 / $0.0035 / 1M 翻倍
V4-Pro 输入(缓存未命中) ¥3.00 / $0.435 / 1M ¥6.00 / $0.87 / 1M
V4-Pro 输出 ¥6.00 / $0.87 / 1M ¥12.00 / $1.74 / 1M
V4-Flash 输入(缓存命中) ¥0.02 / $0.0028 / 1M 翻倍
V4-Flash 输入(缓存未命中) ¥1.00 / $0.14 / 1M ¥2.00 / $0.28 / 1M
V4-Flash 输出 ¥2.00 / $0.28 / 1M ¥4.00 / $0.56 / 1M

省钱四策略:

  • 非实时任务排到非高峰:批量文档处理、数据标注、代码审查安排在 18:00 之后或 9:00 之前。
  • 善用缓存命中:重复 System Prompt 构建 Prompt Cache,V4-Flash 缓存命中成本仅 $0.0028/M。
  • Flash 做分流:简单意图识别、路由判断用 V4-Flash,复杂推理再转 V4-Pro。
  • 关注账单通知:DeepSeek 承诺计费变更 24 小时前邮件通知。

即使在高峰期,V4-Pro 输出价($1.74/M)仍比 Claude Opus 4.8($15/M)和 GPT-5.6 Sol(约 $15/M)便宜 8.6 倍

05 deepseek-chat 停用迁移指南与总结(7 月 24 日截止)

重要警告:旧模型名 deepseek-chatdeepseek-reasoner 将于 2026 年 7 月 24 日 15:59 UTC(北京时间 7 月 24 日 23:59) 永久停止访问。

API 迁移映射关系
旧模型名 新模型名 备注
deepseek-chat deepseek-v4-flash(非思考模式) 速度快,适合轻量任务
deepseek-reasoner deepseek-v4-flash(思考模式) 或升级到 deepseek-v4-pro 获取更强推理
deepseek_v4_migration.py
# 旧写法(7月24日后失效)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

# 新写法
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 同时支持 OpenAI ChatCompletions 格式和 Anthropic Messages 格式,base_url 不变,仅需更新 model 参数。

以下为主要官方来源,发版或页面更新后请再次打开链接核对:

https://api-docs.deepseek.com

https://arxiv.org/abs/2606.19348

https://huggingface.co/deepseek-ai

六步迁移落地:

  1. 全库搜索旧模型名:在代码仓库、CI 配置、环境变量中搜索 deepseek-chatdeepseek-reasoner
  2. 确定替换映射:轻量对话走 deepseek-v4-flash(Non-think),推理任务走 Flash 思考模式或 deepseek-v4-pro
  3. 更新 SDK 调用:OpenAI 兼容接口仅改 model 参数;Anthropic SDK 同样 base_url=https://api.deepseek.com 不变。
  4. 配置思考模式:原 reasoner 用户通过 extra_body 启用 thinking,Think Max 需 384K+ 上下文。
  5. Staging 环境验证:在 7 月 24 日前完成端到端测试,确认峰谷计费对预算的影响。
  6. 排程非高峰批处理:将文档批处理、代码审查等任务 cron 到 18:00 后或周末,配合 Prompt Cache 最大化省钱。

可引用关键数据(EEAT):

  • SWE-bench Verified 80.6%:开源模型最高分,与 Gemini 3.1 Pro 并列(来源:DeepSeek 官方文档,2026-07)。
  • KV Cache 内存 10%:1M token 场景下仅为 V3.2 的 10%,V4-Flash 低至 7%(来源:arXiv:2606.19348)。
  • 性价比 116 倍:Artificial Analysis Strategy & Ops 任务,V4-Pro 每次 $0.03 vs Fable 5 每次 $3.48(来源:Artificial Analysis,2026-07)。

总结:DeepSeek V4 GA 正式版的价值不在于能否击败 Claude Fable 5 或 GPT-5.6(暂时还不能),而在于以闭源旗舰 1/10 乃至 1/100 的成本提供开源模型中无可争议的最强性能。峰谷计费增加了成本复杂度,但本质上仍极具竞争力。

把 DeepSeek V4 API 接到本地 OpenClaw Gateway 或 Cursor Agent 时,个人 Mac 休眠会中断长时 SWE-bench 类任务,峰谷时段的 24/7 流水线也难以在笔记本上稳定排程。纯 API 调用虽无需本地 GPU,但混合架构(本地 Gateway + 云端推理 + 7×24 编排节点)的生产团队常面临本地机器不稳定、无法保证 Agent 常驻的痛点。对于需要 AI 编程 Agent、OpenClaw 多模型路由或长时 Agent 循环 7×24 稳定运行的生产环境,CALMVPS 裸金属 Mac Mini 租赁通常是更优解:独占 Apple Silicon、Metal 原生加速、按月弹性下单,约 120 秒交付。详见 定价页