DeepSeek V4 Flash GA:
бенчмарки у Opus 4.8, цена в десятки раз ниже — Pro всё ещё в preview

31 июля 2026 DeepSeek вывел V4-Flash в официальный API-билд 0731: 284B total / 13B active MoE без изменений — весь прирост от нового post-training pass. На agent-бенчмарках модель обходит более тяжёлую V4-Pro preview, а list price API — доли от Claude Opus 4.8. Флагман V4-Pro и in-house agent framework Harness по-прежнему не в GA.

Статья для разработчиков на DeepSeek API, владельцев agent pipeline и тех, кто считает TCO китайских open-weight моделей. Внутри: таймлайн апрель–август, vendor pricing vs Artificial Analysis Intelligence Index, CSA+HCA, предупреждения про Harness, матрица Kimi K3 / GLM-5.2 / Qwen3.8-Max, контекст kill-line, шесть шагов миграции и FAQ. После прочтения должно быть ясно: Flash или Pro сегодня, каким скором верить, как вывести legacy aliases из продакшена.

01 DeepSeek V4 Flash официально: от april preview к июльскому API

Это не «новая архитектура», а итерация того же 284B MoE за три месяца:

  • 24 апреля 2026: preview DeepSeek-V4 — V4-Pro (1.6T / 49B active) и V4-Flash (284B / 13B), контекст 1M tokens, MIT.
  • 24 июля 2026: legacy aliases deepseek-chat и deepseek-reasoner сняты; трафик на семейство V4.
  • 27 июля 2026: Moonshot AI выкладывает open weights Kimi K3 (2.8T) на Hugging Face — прямое давление за дни до апдейта DeepSeek.
  • 31 июля 2026: deepseek-v4-flash — официальная API beta (0731); веса синхронно на HF. Changelog впервые называет DeepSeek Harness. Только API — app и web chat без изменений.
  • На 5 августа 2026: официальный V4-Pro — «как можно скорее», без подтверждённой даты. Китайские СМИ цитируют анонимные источники про окно GA 10–20 августа — DeepSeek не подтверждал.

Прирост — post-training, не scaling: 284B Flash обгоняет 1.6T V4-Pro preview на agent tasks. Во второй половине 2026 конкуренция смещается от «кто больше параметров» к качеству post-training.

02 Цены DeepSeek V4 Flash и параметры vs конкуренты (август 2026)

Все цифры — vendor list price. DeepSeek анонсировал будущий 2x surcharge в peak hours (9:00–12:00 и 14:00–18:00 по Пекину) без фиксированной даты старта.

DeepSeek V4 Flash vs китайские open-weight flagship (за 1M tokens)
Модель Статус Total / active Input (cache miss / hit) Output
DeepSeek-V4-Flash-0731Официально (31.07.)284B / 13B$0.14 / $0.0028$0.28
DeepSeek-V4-ProТолько preview1.6T / 49B$0.435 / $0.003625$0.87
Kimi K3Open weights (27.07.)2.8T / ~104B (community est.)$3.00 / $0.30$15.00
GLM-5.2Open source (июнь 2026)~744B / ~40BНезависимо не верифицировано
Qwen3.8-MaxAPI GA (02.08.), веса pending2.4T / 95B$2.00 / ~$0.17–0.25$6.00

Независимый Artificial Analysis Intelligence Index и средняя стоимость за task (через финансовые медиа) дают другой ракурс, чем vendor agent scores:

Artificial Analysis Index vs cost per task (другая методология, чем vendor agent benches)
Модель Intelligence Index Средняя стоимость / task
DeepSeek-V4-Flash-073150$0.03
Kimi K357$0.86
GPT-5.6 Sol~9 пунктов выше Flash$1.86
Claude Fable 5~9 пунктов выше Flash$3.15

V4-Flash не лидер по index, но cost per task — примерно 1/29 от Kimi K3 и 1/105 от Claude Fable 5. DeepSeek оптимизирует «достаточный intelligence по цене, которую никто не бьёт», а не первое место в leaderboard.

03 Post-training, CSA+HCA и Harness: как выжать больше из той же архитектуры

Архитектура та же — работает post-training. DeepSeek подтверждает: V4-Flash-0731 имеет тот же parameter count и structure, что april preview. Technical report «DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence» описывает три структурных решения (с preview):

  • Hybrid attention (CSA + HCA): маркетируется как DSA sparse attention; режет compute и memory на long context.
  • Manifold-Constrained Hyper-Connections (mHC): апгрейд residual paths.
  • Muon optimizer: быстрее convergence и стабильнее training dynamics.

Vendor metrics (пока без independent reproduction): на 1M context V4-Pro требует 27% per-token FLOPs от V3.2 и 10% KV cache footprint.

Дебют Harness. Changelog 31 июля впервые называет DeepSeek Harness — in-house agent execution framework против Claude Code: file I/O, tool calls, end-to-end engineering. Все опубликованные agent benchmarks (Terminal Bench 2.0, Toolathlon и др.) сняты в Harness minimal mode (ещё не public) с max effort, top_p=0.95, temperature=1.0. Changelog прямо пишет: scores «extremely sensitive to harness choice» — стоит читать буквально.

По данным 21st Century Business Herald, у разработчиков на official build — низкий input cache hit rate и occasional timeouts safety classifier. Контраст к нарративу «benchmark explosion».

04 Kimi K3, GLM-5.2, Qwen3.8-Max и шесть шагов миграции на V4-Flash-0731

V4-Flash-0731 попадает в самое плотное окно китайских open-weight релизов года. Для agent и batch workloads вопрос уже не «кто на вершине leaderboard», а «кто держит bill при приемлемом intelligence floor».

Шесть шагов миграции на V4-Flash-0731:

  1. Проверить legacy model names: с 24 июля deepseek-chat и deepseek-reasoner сняты — роутить на deepseek-v4-flash или deepseek-v4-pro (preview).
  2. Подтвердить surface: build 0731 — только API; app и web могут отставать — в проде ориентир API changelog.
  3. SDK compatibility: OpenAI ChatCompletions и Anthropic-shaped clients без изменений кода; deepseek-v4-flash автоматически указывает на новый official build.
  4. Разделить классы бенчмарков: SWE-bench Verified и похожие third-party suites весомее, чем Terminal Bench 2.0 на unreleased Harness — не переносить 1:1 на Claude Code / Cursor.
  5. A/B на своих репозиториях: Flash vs Kimi K3 vs Qwen3.8-Max на реальных agent workflows — success rate и token spend, не только vendor slides.
  6. Следить за V4-Pro и Harness GA: официально только «as soon as possible»; любая дата 10–20 августа online — rumor до подтверждения в changelog.

Официальная документация и changelog:

https://api-docs.deepseek.com/

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash

05 Споры о бенчмарках, kill-line и выбор agent-инфраструктуры

  • Terminal Bench 2.0 (vendor): V4-Flash-0731 82.7 vs V4-Pro preview 67.9 — на unreleased Harness minimal mode; framework-specific, не portable на Claude Code / Cursor.
  • Price multiples vs Claude Opus 4.8 (21st Century Business Herald): cache-miss input ~36x дешевле, cache-hit input ~179x, output ~89x — vendor list, не audit.
  • «Kill-line» (斩杀线): китайский dev-сленг про планку DeepSeek «достаточный capability + rock-bottom price» — конкуренты без явного выигрыша по quality или cost рискуют выпасть из routing tables.

FAQ

  • Главное отличие V4 от V3.2? Native 1M token context, сильно сжатые FLOPs и KV cache на long context; agent capabilities под Claude Code, OpenCode и т.д.
  • Flash или Pro на каждый день? Flash-0731 для bulk и agent pipelines; Pro preview — если нужен deeper reasoning и budget позволяет; переоценить после official Pro.
  • Official V4-Pro уже live? На 5 августа нет; только Flash-0731 official, API-only.
  • Можно ли верить benchmark numbers? Широко принятые third-party suites — да; harness-dependent agent scores — ждать independent reproduction.

Полная зависимость от cloud API — latency, billing spikes, routing churn. Локальный deploy open weights упирается в unified memory ceiling, 24/7 stability, multi-node scaling. Для команд с полным macOS stack (Claude Code, OpenCode, OpenClaw, Xcode CI/CD) и always-on agent nodes аренда bare-metal Mac Mini M4 у CALMVPS обычно лучший production fit: dedicated Apple Silicon, шесть регионов, delivery за 120 секунд. Конфигурации и live pricing: тарифы CALMVPS.

Перед деплоем сверьте актуальные цены, бенчмарки и статус V4-Pro / Harness — данные на 5 августа 2026.