DeepSeek V4 en disponibilité générale (juillet 2026) :
tarifs, benchmarks et comparaison avec GPT-5.6

Après trois mois de preview, DeepSeek V4 est officiellement passé en disponibilité générale (GA) le 20 juillet 2026. La version complète apporte des gains mesurables sur les tâches agentiques, le raisonnement mathématique et le code — ainsi qu'une première chez DeepSeek : une tarification horaire en pointe et hors pointe.

Ce guide s'adresse aux développeurs qui comparent les options d'API, les modèles à poids ouverts et le contrôle des coûts en production. Vous y trouverez l'architecture détaillée, les chiffres de benchmarks, les grilles tarifaires, une comparaison franche face à GPT-5.6 et Claude Fable 5, plus une checklist de migration avant l'échéance du 24 juillet.

01 Qu'est-ce qui change entre la GA et la preview d'avril ?

Points de friction avant de basculer :

  • Fin des endpoints legacy le 24 juillet : deepseek-chat et deepseek-reasoner seront définitivement désactivés. Tout code de production non migré tombe immédiatement.
  • La tarification en pointe ajoute de la planification : les tarifs doublent en semaine de 09h00 à 12h00 et de 14h00 à 18h00, heure de Pékin. Les pipelines d'agents 24/7 doivent être replanifiés.
  • Les perfs GA diffèrent de la preview : agent, mathématiques et code ont reçu des améliorations ciblées. Les benchmarks d'avril ne sont plus fiables.
  • Le routage Pro vs Flash compte : 1,6T et 284B ne se comportent pas pareil. Un mauvais routage gaspille le budget ou sacrifie la qualité.
Chronologie clé DeepSeek V4
Date Événement
24 avr. 2026 Preview V4 + open source MIT : V4-Pro (1,6T) et V4-Flash (284B)
Mai 2026 V4-Flash et V4-Pro retouchés production, API généralement disponible
Juin 2026 Baisse permanente de 75 % du prix de sortie V4-Pro à 0,87 $/M tokens
29 juin 2026 E-mail à tous les utilisateurs API : GA mi-juillet, première mention de la tarification pointe-vallée
19 juil. 2026 Accès gray-release GA pour développeurs sélectionnés ; presse sur lancement imminent
20 juil. 2026 GA officiellement en ligne
24 juil. 2026 Retrait définitif de deepseek-chat / deepseek-reasoner

La GA n'est pas une nouvelle architecture — c'est la preview d'avril qui entre en production avec des gains de stabilité et une structure tarifaire commerciale formalisée.

02 Comment DeepSeek V4 rend 1M tokens viable à l'échelle

Spécifications V4-Pro vs V4-Flash
Spécification V4-Pro V4-Flash
Paramètres totaux 1,6 billion 284 milliards
Actifs par token 49B (3 % du total) 13B (4,6 % du total)
Couches 61 43
Fenêtre de contexte 1 000 000 tokens 1 000 000 tokens
Sortie maximale 384K tokens 384K tokens
Précision FP4 (experts MoE) + FP8 (reste) FP4 + FP8 mixte
Données d'entraînement 33T+ tokens 32T+ tokens
Licence MIT MIT

DeepSeek a remplacé la Multi-head Latent Attention (MLA) des V2/V3 par un système hybride à deux voies :

  • Compressed Sparse Attention (CSA) : compresse les entrées KV par un facteur 4 via pooling softmax-gated, puis utilise un indexeur FP4 lightning pour la sélection top-k (top-1024 sur Pro, top-512 sur Flash), plus une fenêtre glissante de 128 tokens. À 1M tokens, l'inférence ne consomme que 27 % des FLOPs de V3.2.
  • Heavily Compressed Attention (HCA) : compression 128× suivie d'une attention dense globale. Capture les motifs longue portée que la CSA peut manquer. CSA et HCA alternent entre les couches.
  • Manifold-Constrained Hyper-Connections (mHC) : un flux résiduel à 4 canaux régi par une matrice doublement stochastique stabilise les gradients sur 61 couches profondes.
  • Optimiseur Muon : l'orthogonalisation Newton-Schulz conditionne mieux les pas de gradient qu'AdamW, accélérant la convergence.

Résultat net : le cache KV à 1M tokens tombe à 10 % de la mémoire V3.2 (7 % sur V4-Flash).

Trois modes de raisonnement
Mode Description Cas d'usage
Non-think Rapide, sans chaîne de pensée Requêtes simples, routage, classification
Think High Raisonnement explicite dans des blocs thinking Débogage, tâches de complexité moyenne
Think Max Effort de raisonnement maximal (contexte 384K+) Mathématiques complexes, planification agent multi-étapes

Échantillonnage officiel recommandé : temperature=1.0, top_p=1.0 pour tous les modes.

03 DeepSeek V4 bat-il GPT-5.6 ? Les chiffres des benchmarks

Benchmarks principaux V4-Pro
Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80,6 % (record open source) 96,0 % N/A ~69 %
SWE-bench Pro 55,4 % 80,3 % 78,1 % 69,2 %
LiveCodeBench (Pass@1) 93,5 % 88,1 % 87,4 % 83,2 %
Codeforces Elo 3 206
Terminal-Bench 2.1 83,9 % 88,0 % 85,1 % 82,7 %

Selon Artificial Analysis sur les tâches Strategy & Ops : Claude Fable 5 obtient 50 à 3,48 $ par tâche ; DeepSeek V4-Pro obtient 38 à 0,03 $ par tâche. Soit 116× moins cher pour un écart de performance de 24 %.

Comparaison des modèles frontier
Dimension DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Poids ouverts / auto-hébergeable Oui (MIT) Non Non
Contexte 1M Oui Non confirmé Oui
Coût sortie (hors pointe) 0,87 $/M ~15 $/M ~50 $/M
Coût sortie (pointe) 1,74 $/M
Meilleur code global Second rang Second rang Leader SWE-bench Pro
Souveraineté des données Auto-hébergement possible Non Non

Choisir V4-Pro ou V4-Flash pour le budget, les volumes élevés ou l'auto-hébergement. Choisir Claude Fable 5 pour les dépôts multi-fichiers les plus exigeants. Choisir GPT-5.6 pour les workflows agentiques orientés terminal et l'intégration M365/Azure.

04 Tarification pointe-vallée DeepSeek : comment réduire les coûts ?

Le changement GA le plus marquant : une tarification horaire. Les tarifs doublent en semaine aux heures de pointe de Pékin : 09h00–12h00 et 14h00–18h00.

Grille tarifaire complète V4-Pro / V4-Flash
Modèle Poste Hors pointe Pointe
V4-Pro Entrée (cache hit) 0,0035 $/1M ×2
V4-Pro Entrée (cache miss) 0,435 $/1M 0,87 $/1M
V4-Pro Sortie 0,87 $/1M 1,74 $/1M
V4-Flash Entrée (cache hit) 0,0028 $/1M ×2
V4-Flash Entrée (cache miss) 0,14 $/1M 0,28 $/1M
V4-Flash Sortie 0,28 $/1M 0,56 $/1M

Quatre leviers concrets pour baisser la facture :

  • Planifier les batchs hors pointe : lancer synthèse, revue de code et pipelines de données après 18h00 ou avant 09h00, heure de Pékin.
  • Maximiser le taux de cache hit : placer les prompts système statiques en tête. Les cache hits V4-Flash ne coûtent que 0,0028 $/M.
  • Routage Flash pour les requêtes simples : classification d'intention et FAQ sur Flash ; escalade vers Pro pour le raisonnement complexe.
  • Surveiller les e-mails de facturation : DeepSeek envoie un préavis de 24 h avant tout changement tarifaire.

Même en pointe, la sortie V4-Pro à 1,74 $/M reste 8,6× moins chère que Claude Opus 4.8 (15 $/M) et GPT-5.6 Sol (~15 $/M).

05 Comment migrer de deepseek-chat avant le 24 juillet

Échéance : 24 juillet 2026, 15h59 UTC. Les noms legacy deepseek-chat et deepseek-reasoner seront définitivement désactivés.

Correspondance de migration API
Ancien modèle Nouvel équivalent Notes
deepseek-chat deepseek-v4-flash (non-thinking) Remplacement direct pour la plupart des cas chat
deepseek-reasoner deepseek-v4-flash (mode thinking) Ou passage à deepseek-v4-pro
deepseek_v4_migration.py
Ancien (expire le 24 juillet)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

Nouveau
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 prend en charge les formats OpenAI ChatCompletions et Anthropic Messages. L'URL de base reste identique ; seul le nom de modèle change.

Sources officielles principales — revérifiez les liens après toute mise à jour en amont :

https://api-docs.deepseek.com

https://arxiv.org/abs/2606.19348

https://huggingface.co/deepseek-ai

Checklist de migration en six étapes :

  1. Auditer le code : repérer toutes les références à deepseek-chat et deepseek-reasoner dans le code, les CI et les variables d'environnement.
  2. Mapper les remplacements : chat léger vers deepseek-v4-flash (Non-think) ; raisonnement vers Flash en mode thinking ou deepseek-v4-pro.
  3. Mettre à jour les appels SDK : les clients compatibles OpenAI ne changent que le nom de modèle. Le SDK Anthropic conserve base_url=https://api.deepseek.com.
  4. Configurer le mode thinking : les anciens utilisateurs de reasoner activent le thinking via extra_body. Think Max exige un contexte 384K+.
  5. Tester en staging : validation bout en bout avant le 24 juillet. Vérifier l'impact de la tarification pointe sur le budget.
  6. Planifier les batchs hors pointe : traitement documentaire et revue de code après 18h00 ou le week-end. Combiner avec le Prompt Cache pour maximiser les économies.

Données techniques citables :

  • SWE-bench Verified 80,6 % : meilleur score open source, à égalité avec Gemini 3.1 Pro (source : documentation officielle DeepSeek, juil. 2026).
  • Cache KV à 10 % : les scénarios à 1M tokens n'utilisent que 10 % de la mémoire V3.2 ; V4-Flash descend à 7 % (source : arXiv:2606.19348).
  • Avantage coût 116× : Artificial Analysis Strategy & Ops : V4-Pro 0,03 $/tâche vs Fable 5 3,48 $/tâche (source : Artificial Analysis, juil. 2026).

Verdict : la GA DeepSeek V4 ne vise pas à battre Claude Fable 5 ou GPT-5.6 sur chaque benchmark — elle livre la meilleure performance open source à 1/10 à 1/100 du coût des modèles frontier propriétaires.

Brancher l'API DeepSeek V4 sur une passerelle OpenClaw locale ou une stack Cursor pose deux contraintes : un Mac en veille interrompt les runs longs type SWE-bench, et les pipelines 24/7 en heures de pointe sont difficiles à planifier sur un portable. Les appels API purs n'exigent pas de GPU local, mais les setups hybrides (passerelle locale + inférence cloud + orchestration always-on) manquent souvent d'hôte stable pour les boucles agent. Pour les environnements de production avec agents de code IA, routage multi-modèles OpenClaw ou cycles agent 24/7, la location Mac Mini bare metal CALMVPS convient en général mieux : Apple Silicon dédié, accélération Metal native, facturation mensuelle flexible, provisioning en ~120 secondes. Consultez la page tarifs.