2026 年 7 月 31 日,DeepSeek 将 V4-Flash 升级为官方正式版(build 0731):284B 总参数 / 13B 激活规模不变,仅靠重新后训练就在多项 Agent 基准上反超自家更大的 V4-Pro 预览版,API 定价仅为 Claude Opus 4.8 的几十分之一。旗舰 V4-Pro 官方版与自研 Agent 框架 Harness 仍未发布。
本文面向接入 DeepSeek API、搭建 Agent 流水线、评估国产开源大模型性价比的开发者:梳理4 月至 8 月完整时间线、官方定价与第三方 Intelligence Index 对照、CSA+HCA 架构与 Harness 跑分敏感性、Kimi K3 / GLM-5.2 / Qwen3.8-Max 横向对比、跑分争议与「斩杀线」价格战背景,并给出六步 API 迁移清单与 FAQ。读完应能回答:现在该用 Flash 还是 Pro、跑分能不能信、旧接口怎么切。
01 DeepSeek V4 Flash 正式版时间线:从 4 月预览到 7 月 API 公测
这不是一次「换架构发新模型」,而是同一套 284B MoE 在三个月窗口内的连续迭代——每一步都被社区放大讨论:
- 2026 年 4 月 24 日:DeepSeek-V4 预览版首次发布并开源,含 V4-Pro(1.6T 总参数 / 49B 激活)与 V4-Flash(284B / 13B),均支持 100 万 token 上下文,MIT 协议。
- 2026 年 7 月 24 日:旧接口模型名
deepseek-chat与deepseek-reasoner正式停用,全部流量切换到 V4 系列命名。 - 2026 年 7 月 27 日:月之暗面 Kimi K3(2.8T 总参数)开源权重上线 Hugging Face,给 DeepSeek 制造直接竞争压力。
- 2026 年 7 月 31 日:
deepseek-v4-flash正式版(0731)进入 API 公测,开源权重同步 Hugging Face;changelog 首次点名自研 Agent 框架 Harness,称将随 V4 正式版发布。仅限 API——App 与网页端暂未同步。 - 截至 2026 年 8 月 5 日:V4-Pro 官方版仍是「尽快发布」,无官方确认日期。部分中文媒体援引未署名消息源称内部测试已在 7 月 28 日那周启动、GA 窗口或在 8 月 10–20 日——未经 DeepSeek 官方证实,仅供参考。
性能提升完全来自后训练,而非扩大参数——284B Flash 在 Agent 基准上反超 1.6T V4-Pro 预览版,说明 2026 年下半年竞争焦点正在从「堆参数」转向「后训练质量」。
02 DeepSeek V4 Flash 定价与竞品参数对照(2026 年 8 月)
以下定价均为厂商公开数据(「厂商自报」),DeepSeek 已预告未来将对 API 启用北京时间 9–12 点、14–18 点高峰时段 2 倍加价,截至发稿未公布具体生效日期。
| 模型 | 状态 | 总参数 / 激活 | 输入(缓存未命中/命中,$/百万 token) | 输出($/百万 token) |
|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 官方正式版(07-31) | 284B / 13B | $0.14 / $0.0028 | $0.28 |
| DeepSeek-V4-Pro | 预览版(官方版未发布) | 1.6T / 49B | $0.435 / $0.003625 | $0.87 |
| Kimi K3 | 权重开源(07-27) | 2.8T / 约 104B(社区估算) | $3.00 / $0.30 | $15.00 |
| GLM-5.2 | 开源(2026 年 6 月) | ~744B / ~40B | 本文未独立核实 | |
| Qwen3.8-Max | API GA(08-02),权重待放出 | 2.4T / 95B | $2.00 / ~$0.17–0.25 | $6.00 |
第三方评测机构 Artificial Analysis 的 Intelligence Index 与单任务成本(经财经媒体转引)呈现另一种视角:
| 模型 | Intelligence Index | 单任务平均成本 |
|---|---|---|
| DeepSeek-V4-Flash-0731 | 50 | $0.03 |
| Kimi K3 | 57 | $0.86 |
| GPT-5.6 Sol | 比 Flash 高约 9 分 | $1.86 |
| Claude Fable 5 | 比 Flash 高约 9 分 | $3.15 |
V4-Flash 的智能分并非最高,但单任务成本约为 Kimi K3 的 1/29、Claude Fable 5 的 1/105——DeepSeek 打的是「够用智能 + 极致价格」,而非「跑分第一」。
03 后训练如何「变出」跑分:CSA+HCA、Harness 与百万上下文效率
架构没变,变的是后训练。 DeepSeek 官方明确:V4-Flash-0731 与 4 月预览版参数规模与结构完全相同,性能提升完全来自重新后训练。技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》描述三处关键架构(自 4 月预览沿用):
- 混合注意力(CSA + HCA):对外称 DSA 稀疏注意力,降低长上下文计算与显存开销。
- 流形约束超连接(mHC):改进传统残差连接结构。
- Muon 优化器:替换传统优化器,提升训练收敛速度与稳定性。
官方指标(尚未见独立第三方复现):百万 token 上下文下,V4-Pro 单 token 推理 FLOPs 仅为 V3.2 的 27%,KV Cache 占用仅为 10%。
Harness 首次亮相。 7 月 31 日 changelog 正式命名 DeepSeek Harness——自研 Agent 执行框架,对标 Claude Code,用于文件读写、工具调用与端到端工程任务。此前 DeepSeek 模型主要依赖 Claude Code、OpenCode 等第三方工具。官方 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部用 Harness「极简模式」(minimal mode)测得,参数为 max 档位、top_p=0.95、temperature=1.0。changelog 主动提示:「跑分对 harness 选择非常敏感」——这句话值得读者留意。
据 21 世纪经济报道转引海外开发者反馈,正式版还存在输入缓存命中率偏低、安全分类器偶发超时等可用性问题,与「跑分暴涨」叙事形成一定反差。
04 Kimi K3、GLM-5.2、Qwen3.8-Max 混战与六步 API 迁移落地
V4-Flash-0731 落在中国大模型开源阵营最密集窗口期。对 Agent 与批量调用场景,选型逻辑已从「谁跑分最高」转向「谁能在可接受智能下限内把账单压到最低」。
六步落地指南(迁移到 V4-Flash-0731 官方版):
- 核对旧模型名是否已停用: 自 7 月 24 日起
deepseek-chat/deepseek-reasoner已退役,须改用deepseek-v4-flash或deepseek-v4-pro(预览)。 - 确认调用入口: 0731 正式版仅限 API,App 与网页端可能仍为旧版;生产环境以 API changelog 为准。
- 保持 SDK 兼容: OpenAI ChatCompletions 与 Anthropic 格式接入无需改代码,
deepseek-v4-flash会自动指向新官方版本。 - 区分两类跑分: SWE-bench Verified 等第三方广泛采用的基准可信度较高;Terminal Bench 2.0 等 Agent 跑分依赖未公开的 Harness,勿直接横向套用到 Claude Code / Cursor。
- 在真实工作流 A/B 测试: 用自有代码库与 Agent 流水线对比 Flash、Kimi K3、Qwen3.8-Max 的实际成功率与 Token 账单,勿仅凭厂商自报数字迁移。
- 关注 V4-Pro 与 Harness GA: 官方 changelog 仅写「尽快发布」;任何「8 月 10–20 日」具体窗口均属未证实传言,以 DeepSeek 官方账号与 api-docs 更新为准。
官方文档与更新日志请参阅 DeepSeek API 文档站(发版后请再次打开链接核对最新定价与模型名):
05 跑分争议、斩杀线与 Agent 基础设施选型收束
- Terminal Bench 2.0: V4-Flash-0731 厂商自报 82.7 分,V4-Pro 预览版 67.9 分——均基于未公开 Harness minimal mode,应视为「厂商 + 特定框架」结果。
- 价格倍率(据 21 世纪经济报道): 相对 Claude Opus 4.8,缓存未命中输入约便宜 36 倍,缓存命中输入约 179 倍,输出约 89 倍(厂商标价,非独立审计)。
- 「斩杀线」: 中文开发者社区用语,指 DeepSeek「够用性能 + 极端低价」组合给同行设下的生存门槛——友商若性能无明显超越又无法更低定价,便可能失去市场存在感。
FAQ 速答
- V4 和 V3.2 最大区别? 原生 100 万 token 上下文,长上下文 FLOPs / KV Cache 大幅压缩;Agent 能力专项优化,适配 Claude Code、OpenCode 等工具。
- 日常选 Flash 还是 Pro? 批量调用、Agent 流水线优先 Flash-0731;更深世界知识与复杂推理可暂用 Pro 预览版,等官方版再评估。
- V4-Pro 官方版能用了吗? 截至 8 月 5 日不能;仅 Flash-0731 为官方版且限 API。
- 跑分能直接信吗? 第三方广泛基准可参考;Harness 依赖型 Agent 跑分建议等社区用 Claude Code / Cursor 独立复现。
若 Agent 工作流完全押在云端 API上,短板是网络延迟、Token 账单波动与模型路由变更;纯本地 Hugging Face 权重部署则受统一内存、7×24 稳定性与多节点扩展限制。对需要完整 macOS 环境跑 Claude Code、OpenCode、OpenClaw 与 Xcode CI/CD、且希望节点 7×24 在线的团队,CALMVPS 裸金属 Mac Mini M4 租赁通常是更优解:独占 Apple Silicon、六地节点弹性切换、120 秒交付。机型与实时价格见 CALMVPS 定价页。
发布前请核实最新定价、跑分及 V4-Pro / Harness 上线状态,本文数据截至 2026 年 8 月 5 日。