31 июля 2026 DeepSeek вывел V4-Flash в официальный API-билд 0731: 284B total / 13B active MoE без изменений — весь прирост от нового post-training pass. На agent-бенчмарках модель обходит более тяжёлую V4-Pro preview, а list price API — доли от Claude Opus 4.8. Флагман V4-Pro и in-house agent framework Harness по-прежнему не в GA.
Статья для разработчиков на DeepSeek API, владельцев agent pipeline и тех, кто считает TCO китайских open-weight моделей. Внутри: таймлайн апрель–август, vendor pricing vs Artificial Analysis Intelligence Index, CSA+HCA, предупреждения про Harness, матрица Kimi K3 / GLM-5.2 / Qwen3.8-Max, контекст kill-line, шесть шагов миграции и FAQ. После прочтения должно быть ясно: Flash или Pro сегодня, каким скором верить, как вывести legacy aliases из продакшена.
01 DeepSeek V4 Flash официально: от april preview к июльскому API
Это не «новая архитектура», а итерация того же 284B MoE за три месяца:
- 24 апреля 2026: preview DeepSeek-V4 — V4-Pro (1.6T / 49B active) и V4-Flash (284B / 13B), контекст 1M tokens, MIT.
- 24 июля 2026: legacy aliases
deepseek-chatиdeepseek-reasonerсняты; трафик на семейство V4. - 27 июля 2026: Moonshot AI выкладывает open weights Kimi K3 (2.8T) на Hugging Face — прямое давление за дни до апдейта DeepSeek.
- 31 июля 2026:
deepseek-v4-flash— официальная API beta (0731); веса синхронно на HF. Changelog впервые называет DeepSeek Harness. Только API — app и web chat без изменений. - На 5 августа 2026: официальный V4-Pro — «как можно скорее», без подтверждённой даты. Китайские СМИ цитируют анонимные источники про окно GA 10–20 августа — DeepSeek не подтверждал.
Прирост — post-training, не scaling: 284B Flash обгоняет 1.6T V4-Pro preview на agent tasks. Во второй половине 2026 конкуренция смещается от «кто больше параметров» к качеству post-training.
02 Цены DeepSeek V4 Flash и параметры vs конкуренты (август 2026)
Все цифры — vendor list price. DeepSeek анонсировал будущий 2x surcharge в peak hours (9:00–12:00 и 14:00–18:00 по Пекину) без фиксированной даты старта.
| Модель | Статус | Total / active | Input (cache miss / hit) | Output |
|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | Официально (31.07.) | 284B / 13B | $0.14 / $0.0028 | $0.28 |
| DeepSeek-V4-Pro | Только preview | 1.6T / 49B | $0.435 / $0.003625 | $0.87 |
| Kimi K3 | Open weights (27.07.) | 2.8T / ~104B (community est.) | $3.00 / $0.30 | $15.00 |
| GLM-5.2 | Open source (июнь 2026) | ~744B / ~40B | Независимо не верифицировано | |
| Qwen3.8-Max | API GA (02.08.), веса pending | 2.4T / 95B | $2.00 / ~$0.17–0.25 | $6.00 |
Независимый Artificial Analysis Intelligence Index и средняя стоимость за task (через финансовые медиа) дают другой ракурс, чем vendor agent scores:
| Модель | Intelligence Index | Средняя стоимость / task |
|---|---|---|
| DeepSeek-V4-Flash-0731 | 50 | $0.03 |
| Kimi K3 | 57 | $0.86 |
| GPT-5.6 Sol | ~9 пунктов выше Flash | $1.86 |
| Claude Fable 5 | ~9 пунктов выше Flash | $3.15 |
V4-Flash не лидер по index, но cost per task — примерно 1/29 от Kimi K3 и 1/105 от Claude Fable 5. DeepSeek оптимизирует «достаточный intelligence по цене, которую никто не бьёт», а не первое место в leaderboard.
03 Post-training, CSA+HCA и Harness: как выжать больше из той же архитектуры
Архитектура та же — работает post-training. DeepSeek подтверждает: V4-Flash-0731 имеет тот же parameter count и structure, что april preview. Technical report «DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence» описывает три структурных решения (с preview):
- Hybrid attention (CSA + HCA): маркетируется как DSA sparse attention; режет compute и memory на long context.
- Manifold-Constrained Hyper-Connections (mHC): апгрейд residual paths.
- Muon optimizer: быстрее convergence и стабильнее training dynamics.
Vendor metrics (пока без independent reproduction): на 1M context V4-Pro требует 27% per-token FLOPs от V3.2 и 10% KV cache footprint.
Дебют Harness. Changelog 31 июля впервые называет DeepSeek Harness — in-house agent execution framework против Claude Code: file I/O, tool calls, end-to-end engineering. Все опубликованные agent benchmarks (Terminal Bench 2.0, Toolathlon и др.) сняты в Harness minimal mode (ещё не public) с max effort, top_p=0.95, temperature=1.0. Changelog прямо пишет: scores «extremely sensitive to harness choice» — стоит читать буквально.
По данным 21st Century Business Herald, у разработчиков на official build — низкий input cache hit rate и occasional timeouts safety classifier. Контраст к нарративу «benchmark explosion».
04 Kimi K3, GLM-5.2, Qwen3.8-Max и шесть шагов миграции на V4-Flash-0731
V4-Flash-0731 попадает в самое плотное окно китайских open-weight релизов года. Для agent и batch workloads вопрос уже не «кто на вершине leaderboard», а «кто держит bill при приемлемом intelligence floor».
Шесть шагов миграции на V4-Flash-0731:
- Проверить legacy model names: с 24 июля
deepseek-chatиdeepseek-reasonerсняты — роутить наdeepseek-v4-flashилиdeepseek-v4-pro(preview). - Подтвердить surface: build 0731 — только API; app и web могут отставать — в проде ориентир API changelog.
- SDK compatibility: OpenAI ChatCompletions и Anthropic-shaped clients без изменений кода;
deepseek-v4-flashавтоматически указывает на новый official build. - Разделить классы бенчмарков: SWE-bench Verified и похожие third-party suites весомее, чем Terminal Bench 2.0 на unreleased Harness — не переносить 1:1 на Claude Code / Cursor.
- A/B на своих репозиториях: Flash vs Kimi K3 vs Qwen3.8-Max на реальных agent workflows — success rate и token spend, не только vendor slides.
- Следить за V4-Pro и Harness GA: официально только «as soon as possible»; любая дата 10–20 августа online — rumor до подтверждения в changelog.
Официальная документация и changelog:
05 Споры о бенчмарках, kill-line и выбор agent-инфраструктуры
- Terminal Bench 2.0 (vendor): V4-Flash-0731 82.7 vs V4-Pro preview 67.9 — на unreleased Harness minimal mode; framework-specific, не portable на Claude Code / Cursor.
- Price multiples vs Claude Opus 4.8 (21st Century Business Herald): cache-miss input ~36x дешевле, cache-hit input ~179x, output ~89x — vendor list, не audit.
- «Kill-line» (斩杀线): китайский dev-сленг про планку DeepSeek «достаточный capability + rock-bottom price» — конкуренты без явного выигрыша по quality или cost рискуют выпасть из routing tables.
FAQ
- Главное отличие V4 от V3.2? Native 1M token context, сильно сжатые FLOPs и KV cache на long context; agent capabilities под Claude Code, OpenCode и т.д.
- Flash или Pro на каждый день? Flash-0731 для bulk и agent pipelines; Pro preview — если нужен deeper reasoning и budget позволяет; переоценить после official Pro.
- Official V4-Pro уже live? На 5 августа нет; только Flash-0731 official, API-only.
- Можно ли верить benchmark numbers? Широко принятые third-party suites — да; harness-dependent agent scores — ждать independent reproduction.
Полная зависимость от cloud API — latency, billing spikes, routing churn. Локальный deploy open weights упирается в unified memory ceiling, 24/7 stability, multi-node scaling. Для команд с полным macOS stack (Claude Code, OpenCode, OpenClaw, Xcode CI/CD) и always-on agent nodes аренда bare-metal Mac Mini M4 у CALMVPS обычно лучший production fit: dedicated Apple Silicon, шесть регионов, delivery за 120 секунд. Конфигурации и live pricing: тарифы CALMVPS.
Перед деплоем сверьте актуальные цены, бенчмарки и статус V4-Pro / Harness — данные на 5 августа 2026.