DeepSeek V4 GA:
цены, архитектура и сравнение с GPT-5.6

TL;DR: 20 июля 2026 DeepSeek V4 вышел в general availability после трёх месяцев preview. GA усиливает agentic tasks, математику и код; впервые у DeepSeek — peak-valley pricing по пекинскому времени. Это переход от «почти бесплатно» к формальной коммерческой модели.

Материал для разработчиков, которые выбирают API, оценивают open weights и контролируют production cost. Внутри: разбор архитектуры MoE 1,6T/284B, таблицы benchmarks vs GPT-5.6 и Claude Fable 5, полный прайс peak/off-peak, чеклист миграции deepseek-chat до 24 июля.

01 DeepSeek V4 GA: что изменилось относительно апрельского preview

Риски до переключения:

  • Legacy endpoints отключают 24 июля: deepseek-chat и deepseek-reasoner будут сняты навсегда. Немигрированный production-код перестанет работать сразу.
  • Peak pricing добавляет планирование: в будни 09:00–12:00 и 14:00–18:00 по Пекину тариф ×2. 24/7 agent pipelines нужно перераспределять по cron.
  • GA ≠ preview по качеству: agent, math и code получили точечные улучшения. Бенчмарки апреля больше не репрезентативны.
  • Pro vs Flash — разные классы: 1,6T и 284B — не взаимозаменяемые tier. Неверный routing сжигает бюджет или режет качество.
Ключевые даты DeepSeek V4
Дата Событие
24.04.2026 Preview V4 + MIT open source: V4-Pro (1,6T) и V4-Flash (284B)
Май 2026 Production-tuned V4-Flash и V4-Pro, API в general availability
Июнь 2026 Output V4-Pro снижен на 75% — $0,87/M tokens
29.06.2026 Email всем API-пользователям: GA в середине июля, первое раскрытие peak-valley pricing
19.07.2026 Gray-release GA для отобранных разработчиков; СМИ — «запуск завтра»
20.07.2026 GA официально live
24.07.2026 deepseek-chat / deepseek-reasoner сняты навсегда

GA — не новая архитектура, а апрельский preview, доведённый до production: стабильность, коммерческий прайс и доработки под agent/math/code.

02 Архитектура DeepSeek V4: CSA, HCA и контекст 1M tokens

V4-Pro vs V4-Flash — спецификация
Параметр V4-Pro V4-Flash
Всего параметров 1,6 триллиона 284 миллиарда
Активных на token 49B (3% от total) 13B (4,6% от total)
Слои 61 43
Context window 1 000 000 tokens 1 000 000 tokens
Max output 384K tokens 384K tokens
Precision FP4 (MoE experts) + FP8 (остальное) FP4 + FP8 mixed
Training data 33T+ tokens 32T+ tokens
Лицензия MIT MIT

DeepSeek заменил Multi-head Latent Attention (MLA) из V2/V3 на двухконтурную гибридную систему:

  • Compressed Sparse Attention (CSA): softmax-gated pooling сжимает KV в 4×, затем FP4 lightning indexer выбирает top-k (top-1024 на Pro, top-512 на Flash) плюс sliding window 128 tokens. На 1M tokens inference требует лишь 27% FLOPs V3.2.
  • Heavily Compressed Attention (HCA): 128× сжатие и dense global attention для long-range паттернов, которые CSA может пропустить. CSA и HCA чередуются по слоям.
  • Manifold-Constrained Hyper-Connections (mHC): 4-канальный residual stream с doubly stochastic matrix стабилизирует градиенты через 61 слой.
  • Muon Optimizer: Newton-Schulz orthogonalization условионирует шаги лучше AdamW — быстрее сходимость.

Итог: KV cache на 1M tokens — 10% памяти V3.2 (7% на V4-Flash).

Три режима reasoning
Режим Описание Когда использовать
Non-think Без chain of thought, минимальная latency Простые запросы, routing, classification
Think High Явный reasoning в thinking blocks Debugging, задачи средней сложности
Think Max Максимальный reasoning (384K+ context) Сложная математика, multi-step agent planning

Официальный sampling для всех режимов: temperature=1.0, top_p=1.0.

03 Benchmarks DeepSeek V4: сравнение с GPT-5.6 и Claude Fable 5

Ключевые benchmarks V4-Pro
Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80,6% (рекорд open weights) 96,0% N/A ~69%
SWE-bench Pro 55,4% 80,3% 78,1% 69,2%
LiveCodeBench (Pass@1) 93,5% 88,1% 87,4% 83,2%
Codeforces Elo 3 206
Terminal-Bench 2.1 83,9% 88,0% 85,1% 82,7%

По Artificial Analysis на Strategy & Ops: Claude Fable 5 — 50 баллов за $3,48/задачу; DeepSeek V4-Pro — 38 баллов за $0,03/задачу. Разрыв по цене — 116× при ~24% gap по performance.

Позиционирование frontier-моделей
Измерение DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open weights / self-host Да (MIT) Нет Нет
1M context Да Не подтверждено Да
Output cost (off-peak) $0,87/M ~$15/M ~$50/M
Output cost (peak) $1,74/M
Coding overall Второй tier Второй tier Лидирует SWE-bench Pro
Data sovereignty Self-host возможен Нет Нет

V4-Pro или V4-Flash — budget, high-volume, self-hosted workloads. Claude Fable 5 — hardest multi-file работа в репозитории. GPT-5.6 — terminal-heavy agentic flows и интеграция M365/Azure.

04 Peak-valley pricing DeepSeek V4: расчёт и снижение затрат

Главное коммерческое изменение GA — time-based pricing. В будни по Пекину peak: 09:00–12:00 и 14:00–18:00, тариф ×2.

Полная таблица цен V4-Pro / V4-Flash
Модель Статья Off-peak Peak
V4-Pro Input (cache hit) $0,0035/1M ×2
V4-Pro Input (cache miss) $0,435/1M $0,87/1M
V4-Pro Output $0,87/1M $1,74/1M
V4-Flash Input (cache hit) $0,0028/1M ×2
V4-Flash Input (cache miss) $0,14/1M $0,28/1M
V4-Flash Output $0,28/1M $0,56/1M

Четыре практических способа снизить bill:

  • Batch jobs off-peak: summarization, code review и data pipelines — после 18:00 или до 09:00 по Пекину.
  • Максимизировать cache hit: статичный system prompt первым. Cache hit V4-Flash — $0,0028/M.
  • Routing Flash → Pro: intent classification и FAQ на Flash; сложный reasoning — на Pro.
  • Мониторить billing emails: DeepSeek шлёт уведомление за 24 часа до изменения тарифов.

Даже в peak V4-Pro output $1,74/M — в 8,6× дешевле Claude Opus 4.8 ($15/M) и GPT-5.6 Sol (~$15/M).

05 Миграция с deepseek-chat до 24 июля: чеклист и FAQ

Дедлайн: 24 июля 2026, 15:59 UTC. Legacy-имена deepseek-chat и deepseek-reasoner будут отключены навсегда.

Маппинг API-миграции
Старая модель Новый эквивалент Примечание
deepseek-chat deepseek-v4-flash (non-thinking) Drop-in для большинства chat-сценариев
deepseek-reasoner deepseek-v4-flash (thinking mode) Или upgrade на deepseek-v4-pro
deepseek_v4_migration.py
Legacy (отключается 24 июля)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

GA V4
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 поддерживает OpenAI ChatCompletions и Anthropic Messages API. Base URL без изменений — меняется только имя модели.

Официальные источники — перепроверяйте после upstream-обновлений:

https://api-docs.deepseek.com

https://arxiv.org/abs/2606.19348

https://huggingface.co/deepseek-ai

Шесть шагов миграции:

  1. Поиск по репозиторию: все вхождения deepseek-chat и deepseek-reasoner в коде, CI-конфигах и env vars.
  2. Маппинг замен: лёгкий chat → deepseek-v4-flash (Non-think); reasoning → Flash thinking mode или deepseek-v4-pro.
  3. Обновление SDK: OpenAI-compatible clients — только смена model name. Anthropic SDK сохраняет base_url=https://api.deepseek.com.
  4. Настройка thinking mode: бывшие reasoner-пользователи включают thinking через extra_body. Think Max требует 384K+ context.
  5. Staging E2E: полная валидация до 24 июля; проверить влияние peak pricing на бюджет.
  6. Cron off-peak: document processing и code review после 18:00 или в выходные; комбинировать с Prompt Cache.

Цитируемые данные (EEAT):

  • SWE-bench Verified 80,6%: лучший результат среди open weights, паритет с Gemini 3.1 Pro (DeepSeek official docs, июль 2026).
  • KV cache 10%: на 1M tokens — 10% памяти V3.2; V4-Flash до 7% (arXiv:2606.19348).
  • 116× cost advantage: Artificial Analysis Strategy & Ops — V4-Pro $0,03/задача vs Fable 5 $3,48/задача (Artificial Analysis, июль 2026).

FAQ:

  • GA меняет веса? Нет — та же MIT-архитектура апрельского preview; изменения в stability, routing и pricing.
  • Self-host V4-Pro реалистичен? Да при MIT; для production inference нужен кластер GPU/HBM — см. ds4 на Mac для edge-сценариев.
  • Peak pricing в выходные? Только будни по пекинскому времени; суббота/воскресенье — off-peak.
  • V4-Flash vs V4-Pro для coding agents? Flash — routing и bulk; Pro — SWE-bench-grade задачи и Think Max.

Bottom line: DeepSeek V4 GA не про победу над Claude Fable 5 или GPT-5.6 на каждом benchmark — про сильнейший open-weight tier при 1/10–1/100 стоимости закрытых frontier-моделей. Peak-valley усложняет billing, но margin остаётся огромным.

При интеграции DeepSeek V4 API в локальный OpenClaw Gateway или Cursor agent stack sleeping Mac рвёт длинные SWE-bench runs, а peak-hour 24/7 pipelines на ноутбуке нестабильны. Чистый API не требует локального GPU, но гибрид (local gateway + cloud inference + always-on orchestration) часто упирается в отсутствие постоянного хоста для agent loops. Для AI coding agents, OpenClaw multi-model routing или 24/7 agent cycles аренда bare-metal Mac Mini CALMVPS обычно рациональнее: dedicated Apple Silicon, Metal-native acceleration, гибкая помесячная оплата, provisioning ~120 с. Страница цен.