Après trois mois de preview, DeepSeek V4 est officiellement passé en disponibilité générale (GA) le 20 juillet 2026. La version complète apporte des gains mesurables sur les tâches agentiques, le raisonnement mathématique et le code — ainsi qu'une première chez DeepSeek : une tarification horaire en pointe et hors pointe.
Ce guide s'adresse aux développeurs qui comparent les options d'API, les modèles à poids ouverts et le contrôle des coûts en production. Vous y trouverez l'architecture détaillée, les chiffres de benchmarks, les grilles tarifaires, une comparaison franche face à GPT-5.6 et Claude Fable 5, plus une checklist de migration avant l'échéance du 24 juillet.
01 Qu'est-ce qui change entre la GA et la preview d'avril ?
Points de friction avant de basculer :
- Fin des endpoints legacy le 24 juillet :
deepseek-chatetdeepseek-reasonerseront définitivement désactivés. Tout code de production non migré tombe immédiatement. - La tarification en pointe ajoute de la planification : les tarifs doublent en semaine de 09h00 à 12h00 et de 14h00 à 18h00, heure de Pékin. Les pipelines d'agents 24/7 doivent être replanifiés.
- Les perfs GA diffèrent de la preview : agent, mathématiques et code ont reçu des améliorations ciblées. Les benchmarks d'avril ne sont plus fiables.
- Le routage Pro vs Flash compte : 1,6T et 284B ne se comportent pas pareil. Un mauvais routage gaspille le budget ou sacrifie la qualité.
| Date | Événement |
|---|---|
| 24 avr. 2026 | Preview V4 + open source MIT : V4-Pro (1,6T) et V4-Flash (284B) |
| Mai 2026 | V4-Flash et V4-Pro retouchés production, API généralement disponible |
| Juin 2026 | Baisse permanente de 75 % du prix de sortie V4-Pro à 0,87 $/M tokens |
| 29 juin 2026 | E-mail à tous les utilisateurs API : GA mi-juillet, première mention de la tarification pointe-vallée |
| 19 juil. 2026 | Accès gray-release GA pour développeurs sélectionnés ; presse sur lancement imminent |
| 20 juil. 2026 | GA officiellement en ligne |
| 24 juil. 2026 | Retrait définitif de deepseek-chat / deepseek-reasoner |
La GA n'est pas une nouvelle architecture — c'est la preview d'avril qui entre en production avec des gains de stabilité et une structure tarifaire commerciale formalisée.
02 Comment DeepSeek V4 rend 1M tokens viable à l'échelle
| Spécification | V4-Pro | V4-Flash |
|---|---|---|
| Paramètres totaux | 1,6 billion | 284 milliards |
| Actifs par token | 49B (3 % du total) | 13B (4,6 % du total) |
| Couches | 61 | 43 |
| Fenêtre de contexte | 1 000 000 tokens | 1 000 000 tokens |
| Sortie maximale | 384K tokens | 384K tokens |
| Précision | FP4 (experts MoE) + FP8 (reste) | FP4 + FP8 mixte |
| Données d'entraînement | 33T+ tokens | 32T+ tokens |
| Licence | MIT | MIT |
DeepSeek a remplacé la Multi-head Latent Attention (MLA) des V2/V3 par un système hybride à deux voies :
- Compressed Sparse Attention (CSA) : compresse les entrées KV par un facteur 4 via pooling softmax-gated, puis utilise un indexeur FP4 lightning pour la sélection top-k (top-1024 sur Pro, top-512 sur Flash), plus une fenêtre glissante de 128 tokens. À 1M tokens, l'inférence ne consomme que 27 % des FLOPs de V3.2.
- Heavily Compressed Attention (HCA) : compression 128× suivie d'une attention dense globale. Capture les motifs longue portée que la CSA peut manquer. CSA et HCA alternent entre les couches.
- Manifold-Constrained Hyper-Connections (mHC) : un flux résiduel à 4 canaux régi par une matrice doublement stochastique stabilise les gradients sur 61 couches profondes.
- Optimiseur Muon : l'orthogonalisation Newton-Schulz conditionne mieux les pas de gradient qu'AdamW, accélérant la convergence.
Résultat net : le cache KV à 1M tokens tombe à 10 % de la mémoire V3.2 (7 % sur V4-Flash).
| Mode | Description | Cas d'usage |
|---|---|---|
| Non-think | Rapide, sans chaîne de pensée | Requêtes simples, routage, classification |
| Think High | Raisonnement explicite dans des blocs thinking | Débogage, tâches de complexité moyenne |
| Think Max | Effort de raisonnement maximal (contexte 384K+) | Mathématiques complexes, planification agent multi-étapes |
Échantillonnage officiel recommandé : temperature=1.0, top_p=1.0 pour tous les modes.
03 DeepSeek V4 bat-il GPT-5.6 ? Les chiffres des benchmarks
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % (record open source) | 96,0 % | N/A | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
Selon Artificial Analysis sur les tâches Strategy & Ops : Claude Fable 5 obtient 50 à 3,48 $ par tâche ; DeepSeek V4-Pro obtient 38 à 0,03 $ par tâche. Soit 116× moins cher pour un écart de performance de 24 %.
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Poids ouverts / auto-hébergeable | Oui (MIT) | Non | Non |
| Contexte 1M | Oui | Non confirmé | Oui |
| Coût sortie (hors pointe) | 0,87 $/M | ~15 $/M | ~50 $/M |
| Coût sortie (pointe) | 1,74 $/M | — | — |
| Meilleur code global | Second rang | Second rang | Leader SWE-bench Pro |
| Souveraineté des données | Auto-hébergement possible | Non | Non |
Choisir V4-Pro ou V4-Flash pour le budget, les volumes élevés ou l'auto-hébergement. Choisir Claude Fable 5 pour les dépôts multi-fichiers les plus exigeants. Choisir GPT-5.6 pour les workflows agentiques orientés terminal et l'intégration M365/Azure.
04 Tarification pointe-vallée DeepSeek : comment réduire les coûts ?
Le changement GA le plus marquant : une tarification horaire. Les tarifs doublent en semaine aux heures de pointe de Pékin : 09h00–12h00 et 14h00–18h00.
| Modèle | Poste | Hors pointe | Pointe |
|---|---|---|---|
| V4-Pro | Entrée (cache hit) | 0,0035 $/1M | ×2 |
| V4-Pro | Entrée (cache miss) | 0,435 $/1M | 0,87 $/1M |
| V4-Pro | Sortie | 0,87 $/1M | 1,74 $/1M |
| V4-Flash | Entrée (cache hit) | 0,0028 $/1M | ×2 |
| V4-Flash | Entrée (cache miss) | 0,14 $/1M | 0,28 $/1M |
| V4-Flash | Sortie | 0,28 $/1M | 0,56 $/1M |
Quatre leviers concrets pour baisser la facture :
- Planifier les batchs hors pointe : lancer synthèse, revue de code et pipelines de données après 18h00 ou avant 09h00, heure de Pékin.
- Maximiser le taux de cache hit : placer les prompts système statiques en tête. Les cache hits V4-Flash ne coûtent que 0,0028 $/M.
- Routage Flash pour les requêtes simples : classification d'intention et FAQ sur Flash ; escalade vers Pro pour le raisonnement complexe.
- Surveiller les e-mails de facturation : DeepSeek envoie un préavis de 24 h avant tout changement tarifaire.
Même en pointe, la sortie V4-Pro à 1,74 $/M reste 8,6× moins chère que Claude Opus 4.8 (15 $/M) et GPT-5.6 Sol (~15 $/M).
05 Comment migrer de deepseek-chat avant le 24 juillet
Échéance : 24 juillet 2026, 15h59 UTC. Les noms legacy deepseek-chat et deepseek-reasoner seront définitivement désactivés.
| Ancien modèle | Nouvel équivalent | Notes |
|---|---|---|
| deepseek-chat | deepseek-v4-flash (non-thinking) | Remplacement direct pour la plupart des cas chat |
| deepseek-reasoner | deepseek-v4-flash (mode thinking) | Ou passage à deepseek-v4-pro |
Ancien (expire le 24 juillet)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
Nouveau
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
V4 prend en charge les formats OpenAI ChatCompletions et Anthropic Messages. L'URL de base reste identique ; seul le nom de modèle change.
Sources officielles principales — revérifiez les liens après toute mise à jour en amont :
https://arxiv.org/abs/2606.19348
https://huggingface.co/deepseek-ai
Checklist de migration en six étapes :
- Auditer le code : repérer toutes les références à
deepseek-chatetdeepseek-reasonerdans le code, les CI et les variables d'environnement. - Mapper les remplacements : chat léger vers
deepseek-v4-flash(Non-think) ; raisonnement vers Flash en mode thinking oudeepseek-v4-pro. - Mettre à jour les appels SDK : les clients compatibles OpenAI ne changent que le nom de modèle. Le SDK Anthropic conserve
base_url=https://api.deepseek.com. - Configurer le mode thinking : les anciens utilisateurs de reasoner activent le thinking via
extra_body. Think Max exige un contexte 384K+. - Tester en staging : validation bout en bout avant le 24 juillet. Vérifier l'impact de la tarification pointe sur le budget.
- Planifier les batchs hors pointe : traitement documentaire et revue de code après 18h00 ou le week-end. Combiner avec le Prompt Cache pour maximiser les économies.
Données techniques citables :
- SWE-bench Verified 80,6 % : meilleur score open source, à égalité avec Gemini 3.1 Pro (source : documentation officielle DeepSeek, juil. 2026).
- Cache KV à 10 % : les scénarios à 1M tokens n'utilisent que 10 % de la mémoire V3.2 ; V4-Flash descend à 7 % (source : arXiv:2606.19348).
- Avantage coût 116× : Artificial Analysis Strategy & Ops : V4-Pro 0,03 $/tâche vs Fable 5 3,48 $/tâche (source : Artificial Analysis, juil. 2026).
Verdict : la GA DeepSeek V4 ne vise pas à battre Claude Fable 5 ou GPT-5.6 sur chaque benchmark — elle livre la meilleure performance open source à 1/10 à 1/100 du coût des modèles frontier propriétaires.
Brancher l'API DeepSeek V4 sur une passerelle OpenClaw locale ou une stack Cursor pose deux contraintes : un Mac en veille interrompt les runs longs type SWE-bench, et les pipelines 24/7 en heures de pointe sont difficiles à planifier sur un portable. Les appels API purs n'exigent pas de GPU local, mais les setups hybrides (passerelle locale + inférence cloud + orchestration always-on) manquent souvent d'hôte stable pour les boucles agent. Pour les environnements de production avec agents de code IA, routage multi-modèles OpenClaw ou cycles agent 24/7, la location Mac Mini bare metal CALMVPS convient en général mieux : Apple Silicon dédié, accélération Metal native, facturation mensuelle flexible, provisioning en ~120 secondes. Consultez la page tarifs.