TL;DR: 20 июля 2026 DeepSeek V4 вышел в general availability после трёх месяцев preview. GA усиливает agentic tasks, математику и код; впервые у DeepSeek — peak-valley pricing по пекинскому времени. Это переход от «почти бесплатно» к формальной коммерческой модели.
Материал для разработчиков, которые выбирают API, оценивают open weights и контролируют production cost. Внутри: разбор архитектуры MoE 1,6T/284B, таблицы benchmarks vs GPT-5.6 и Claude Fable 5, полный прайс peak/off-peak, чеклист миграции deepseek-chat до 24 июля.
01 DeepSeek V4 GA: что изменилось относительно апрельского preview
Риски до переключения:
- Legacy endpoints отключают 24 июля:
deepseek-chatиdeepseek-reasonerбудут сняты навсегда. Немигрированный production-код перестанет работать сразу. - Peak pricing добавляет планирование: в будни 09:00–12:00 и 14:00–18:00 по Пекину тариф ×2. 24/7 agent pipelines нужно перераспределять по cron.
- GA ≠ preview по качеству: agent, math и code получили точечные улучшения. Бенчмарки апреля больше не репрезентативны.
- Pro vs Flash — разные классы: 1,6T и 284B — не взаимозаменяемые tier. Неверный routing сжигает бюджет или режет качество.
| Дата | Событие |
|---|---|
| 24.04.2026 | Preview V4 + MIT open source: V4-Pro (1,6T) и V4-Flash (284B) |
| Май 2026 | Production-tuned V4-Flash и V4-Pro, API в general availability |
| Июнь 2026 | Output V4-Pro снижен на 75% — $0,87/M tokens |
| 29.06.2026 | Email всем API-пользователям: GA в середине июля, первое раскрытие peak-valley pricing |
| 19.07.2026 | Gray-release GA для отобранных разработчиков; СМИ — «запуск завтра» |
| 20.07.2026 | GA официально live |
| 24.07.2026 | deepseek-chat / deepseek-reasoner сняты навсегда |
GA — не новая архитектура, а апрельский preview, доведённый до production: стабильность, коммерческий прайс и доработки под agent/math/code.
02 Архитектура DeepSeek V4: CSA, HCA и контекст 1M tokens
| Параметр | V4-Pro | V4-Flash |
|---|---|---|
| Всего параметров | 1,6 триллиона | 284 миллиарда |
| Активных на token | 49B (3% от total) | 13B (4,6% от total) |
| Слои | 61 | 43 |
| Context window | 1 000 000 tokens | 1 000 000 tokens |
| Max output | 384K tokens | 384K tokens |
| Precision | FP4 (MoE experts) + FP8 (остальное) | FP4 + FP8 mixed |
| Training data | 33T+ tokens | 32T+ tokens |
| Лицензия | MIT | MIT |
DeepSeek заменил Multi-head Latent Attention (MLA) из V2/V3 на двухконтурную гибридную систему:
- Compressed Sparse Attention (CSA): softmax-gated pooling сжимает KV в 4×, затем FP4 lightning indexer выбирает top-k (top-1024 на Pro, top-512 на Flash) плюс sliding window 128 tokens. На 1M tokens inference требует лишь 27% FLOPs V3.2.
- Heavily Compressed Attention (HCA): 128× сжатие и dense global attention для long-range паттернов, которые CSA может пропустить. CSA и HCA чередуются по слоям.
- Manifold-Constrained Hyper-Connections (mHC): 4-канальный residual stream с doubly stochastic matrix стабилизирует градиенты через 61 слой.
- Muon Optimizer: Newton-Schulz orthogonalization условионирует шаги лучше AdamW — быстрее сходимость.
Итог: KV cache на 1M tokens — 10% памяти V3.2 (7% на V4-Flash).
| Режим | Описание | Когда использовать |
|---|---|---|
| Non-think | Без chain of thought, минимальная latency | Простые запросы, routing, classification |
| Think High | Явный reasoning в thinking blocks | Debugging, задачи средней сложности |
| Think Max | Максимальный reasoning (384K+ context) | Сложная математика, multi-step agent planning |
Официальный sampling для всех режимов: temperature=1.0, top_p=1.0.
03 Benchmarks DeepSeek V4: сравнение с GPT-5.6 и Claude Fable 5
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6% (рекорд open weights) | 96,0% | N/A | ~69% |
| SWE-bench Pro | 55,4% | 80,3% | 78,1% | 69,2% |
| LiveCodeBench (Pass@1) | 93,5% | 88,1% | 87,4% | 83,2% |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9% | 88,0% | 85,1% | 82,7% |
По Artificial Analysis на Strategy & Ops: Claude Fable 5 — 50 баллов за $3,48/задачу; DeepSeek V4-Pro — 38 баллов за $0,03/задачу. Разрыв по цене — 116× при ~24% gap по performance.
| Измерение | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open weights / self-host | Да (MIT) | Нет | Нет |
| 1M context | Да | Не подтверждено | Да |
| Output cost (off-peak) | $0,87/M | ~$15/M | ~$50/M |
| Output cost (peak) | $1,74/M | — | — |
| Coding overall | Второй tier | Второй tier | Лидирует SWE-bench Pro |
| Data sovereignty | Self-host возможен | Нет | Нет |
V4-Pro или V4-Flash — budget, high-volume, self-hosted workloads. Claude Fable 5 — hardest multi-file работа в репозитории. GPT-5.6 — terminal-heavy agentic flows и интеграция M365/Azure.
04 Peak-valley pricing DeepSeek V4: расчёт и снижение затрат
Главное коммерческое изменение GA — time-based pricing. В будни по Пекину peak: 09:00–12:00 и 14:00–18:00, тариф ×2.
| Модель | Статья | Off-peak | Peak |
|---|---|---|---|
| V4-Pro | Input (cache hit) | $0,0035/1M | ×2 |
| V4-Pro | Input (cache miss) | $0,435/1M | $0,87/1M |
| V4-Pro | Output | $0,87/1M | $1,74/1M |
| V4-Flash | Input (cache hit) | $0,0028/1M | ×2 |
| V4-Flash | Input (cache miss) | $0,14/1M | $0,28/1M |
| V4-Flash | Output | $0,28/1M | $0,56/1M |
Четыре практических способа снизить bill:
- Batch jobs off-peak: summarization, code review и data pipelines — после 18:00 или до 09:00 по Пекину.
- Максимизировать cache hit: статичный system prompt первым. Cache hit V4-Flash — $0,0028/M.
- Routing Flash → Pro: intent classification и FAQ на Flash; сложный reasoning — на Pro.
- Мониторить billing emails: DeepSeek шлёт уведомление за 24 часа до изменения тарифов.
Даже в peak V4-Pro output $1,74/M — в 8,6× дешевле Claude Opus 4.8 ($15/M) и GPT-5.6 Sol (~$15/M).
05 Миграция с deepseek-chat до 24 июля: чеклист и FAQ
Дедлайн: 24 июля 2026, 15:59 UTC. Legacy-имена deepseek-chat и deepseek-reasoner будут отключены навсегда.
| Старая модель | Новый эквивалент | Примечание |
|---|---|---|
| deepseek-chat | deepseek-v4-flash (non-thinking) | Drop-in для большинства chat-сценариев |
| deepseek-reasoner | deepseek-v4-flash (thinking mode) | Или upgrade на deepseek-v4-pro |
Legacy (отключается 24 июля)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
GA V4
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
V4 поддерживает OpenAI ChatCompletions и Anthropic Messages API. Base URL без изменений — меняется только имя модели.
Официальные источники — перепроверяйте после upstream-обновлений:
https://arxiv.org/abs/2606.19348
https://huggingface.co/deepseek-ai
Шесть шагов миграции:
- Поиск по репозиторию: все вхождения
deepseek-chatиdeepseek-reasonerв коде, CI-конфигах и env vars. - Маппинг замен: лёгкий chat →
deepseek-v4-flash(Non-think); reasoning → Flash thinking mode илиdeepseek-v4-pro. - Обновление SDK: OpenAI-compatible clients — только смена model name. Anthropic SDK сохраняет
base_url=https://api.deepseek.com. - Настройка thinking mode: бывшие reasoner-пользователи включают thinking через
extra_body. Think Max требует 384K+ context. - Staging E2E: полная валидация до 24 июля; проверить влияние peak pricing на бюджет.
- Cron off-peak: document processing и code review после 18:00 или в выходные; комбинировать с Prompt Cache.
Цитируемые данные (EEAT):
- SWE-bench Verified 80,6%: лучший результат среди open weights, паритет с Gemini 3.1 Pro (DeepSeek official docs, июль 2026).
- KV cache 10%: на 1M tokens — 10% памяти V3.2; V4-Flash до 7% (arXiv:2606.19348).
- 116× cost advantage: Artificial Analysis Strategy & Ops — V4-Pro $0,03/задача vs Fable 5 $3,48/задача (Artificial Analysis, июль 2026).
FAQ:
- GA меняет веса? Нет — та же MIT-архитектура апрельского preview; изменения в stability, routing и pricing.
- Self-host V4-Pro реалистичен? Да при MIT; для production inference нужен кластер GPU/HBM — см. ds4 на Mac для edge-сценариев.
- Peak pricing в выходные? Только будни по пекинскому времени; суббота/воскресенье — off-peak.
- V4-Flash vs V4-Pro для coding agents? Flash — routing и bulk; Pro — SWE-bench-grade задачи и Think Max.
Bottom line: DeepSeek V4 GA не про победу над Claude Fable 5 или GPT-5.6 на каждом benchmark — про сильнейший open-weight tier при 1/10–1/100 стоимости закрытых frontier-моделей. Peak-valley усложняет billing, но margin остаётся огромным.
При интеграции DeepSeek V4 API в локальный OpenClaw Gateway или Cursor agent stack sleeping Mac рвёт длинные SWE-bench runs, а peak-hour 24/7 pipelines на ноутбуке нестабильны. Чистый API не требует локального GPU, но гибрид (local gateway + cloud inference + always-on orchestration) часто упирается в отсутствие постоянного хоста для agent loops. Для AI coding agents, OpenClaw multi-model routing или 24/7 agent cycles аренда bare-metal Mac Mini CALMVPS обычно рациональнее: dedicated Apple Silicon, Metal-native acceleration, гибкая помесячная оплата, provisioning ~120 с. Страница цен.