Le 31 juillet 2026, DeepSeek a promu V4-Flash en version API officielle (build 0731) : 284B paramètres totaux / 13B actifs inchangés, les gains provenant exclusivement d'un nouveau cycle de post-entraînement. Sur plusieurs benchmarks agent, le modèle dépasse la preview V4-Pro plus volumineuse, pour un tarif API représentant une fraction de Claude Opus 4.8. Le flagship V4-Pro et le framework agent Harness restent non publiés en GA.
Cet article s'adresse aux équipes branchées sur l'API DeepSeek, aux responsables de pipelines agent et aux acheteurs comparant l'économie des modèles chinois open source. Vous y trouverez la chronologie avril–août, les tarifs éditeur face à l'Intelligence Index d'Artificial Analysis, l'architecture CSA+HCA, les réserves sur Harness, une matrice Kimi K3 / GLM-5.2 / Qwen3.8-Max, le contexte de la kill-line, six étapes de migration et une FAQ. Objectif : choisir Flash ou Pro aujourd'hui, distinguer scores fiables et marketing, et basculer proprement les anciens alias.
01 DeepSeek V4 Flash officiel : de la preview d'avril à l'API de juillet
Il ne s'agit pas d'une nouvelle architecture, mais d'une itération continue du même MoE 284B sur trois mois :
- 24 avril 2026 : preview DeepSeek-V4 avec V4-Pro (1,6T / 49B actifs) et V4-Flash (284B / 13B), contexte 1M tokens, licence MIT.
- 24 juillet 2026 : retrait des alias
deepseek-chatetdeepseek-reasoner; trafic basculé vers la famille V4. - 27 juillet 2026 : Moonshot AI publie les poids ouverts de Kimi K3 (2,8T) sur Hugging Face, renforçant la pression concurrentielle avant la mise à jour DeepSeek.
- 31 juillet 2026 :
deepseek-v4-flashen beta API officielle (0731) ; poids synchronisés sur Hugging Face. Le changelog nomme pour la première fois DeepSeek Harness. API uniquement — application et web inchangés. - Au 5 août 2026 : V4-Pro officiel toujours annoncé « dès que possible », sans date confirmée. Certains médias chinois citent des sources anonymes pour une fenêtre GA 10–20 août — non confirmé par DeepSeek.
La progression vient du post-entraînement, pas du scaling : un Flash 284B devançant une preview Pro 1,6T sur les tâches agent signale que la compétition de fin 2026 se joue sur la qualité d'entraînement, pas seulement sur le nombre de paramètres.
02 Tarifs DeepSeek V4 Flash et paramètres face à la concurrence (août 2026)
Tous les montants ci-dessous sont des tarifs publics éditeur. DeepSeek a annoncé une future majoration x2 en heures de pointe (9h–12h et 14h–18h, heure de Pékin), sans date d'entrée en vigueur.
| Modèle | Statut | Total / actifs | Entrée (cache miss / hit) | Sortie |
|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | Officiel (31 juil.) | 284B / 13B | 0,14 $ / 0,0028 $ | 0,28 $ |
| DeepSeek-V4-Pro | Preview uniquement | 1,6T / 49B | 0,435 $ / 0,003625 $ | 0,87 $ |
| Kimi K3 | Poids ouverts (27 juil.) | 2,8T / ~104B (est. communauté) | 3,00 $ / 0,30 $ | 15,00 $ |
| GLM-5.2 | Open source (juin 2026) | ~744B / ~40B | Non vérifié indépendamment | |
| Qwen3.8-Max | API GA (2 août), poids en attente | 2,4T / 95B | 2,00 $ / ~0,17–0,25 $ | 6,00 $ |
L'Intelligence Index d'Artificial Analysis et le coût moyen par tâche (reprise par la presse financière) complètent la lecture éditeur :
| Modèle | Intelligence Index | Coût moyen / tâche |
|---|---|---|
| DeepSeek-V4-Flash-0731 | 50 | 0,03 $ |
| Kimi K3 | 57 | 0,86 $ |
| GPT-5.6 Sol | ~9 points au-dessus de Flash | 1,86 $ |
| Claude Fable 5 | ~9 points au-dessus de Flash | 3,15 $ |
V4-Flash ne domine pas l'index, mais coûte environ 29 fois moins par tâche que Kimi K3 et 105 fois moins que Claude Fable 5 — DeepSeek mise sur une intelligence suffisante au prix le plus bas du marché, pas sur le premier rang des benchmarks.
03 Post-entraînement, CSA+HCA et Harness : extraire plus d'une architecture inchangée
Architecture identique — le post-entraînement fait la différence. DeepSeek confirme que V4-Flash-0731 conserve la même taille et structure que la preview d'avril. Le rapport technique « DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence » décrit trois choix structurels (depuis la preview) :
- Attention hybride (CSA + HCA) : présentée comme attention sparse DSA ; réduit calcul et mémoire en long contexte.
- Hyper-connexions à contrainte de variété (mHC) : amélioration des chemins résiduels.
- Optimiseur Muon : convergence plus rapide et entraînement plus stable.
Chiffres éditeur (sans reproduction indépendante à ce jour) : à 1M tokens, V4-Pro n'utilise que 27 % des FLOPs par token de V3.2 et 10 % de l'empreinte KV cache.
Première mention de Harness. Le changelog du 31 juillet nomme DeepSeek Harness, framework agent interne positionné face à Claude Code pour lecture/écriture de fichiers, appels d'outils et tâches d'ingénierie de bout en bout. Tous les benchmarks agent publiés (Terminal Bench 2.0, Toolathlon, etc.) ont été mesurés en mode minimal Harness avec effort max, top_p=0,95, temperature=1,0. Le changelog avertit que les scores sont « extrêmement sensibles au choix du harness » — à prendre au sérieux.
Selon 21st Century Business Herald, des retours développeurs signalent des taux de cache hit d'entrée faibles et des timeouts occasionnels du classificateur de sécurité — un contrepoint utile au récit de bond spectaculaire des scores.
04 Kimi K3, GLM-5.2, Qwen3.8-Max et six étapes pour migrer vers V4-Flash-0731
V4-Flash-0731 arrive dans la fenêtre la plus dense de lancements open source chinois de l'année. Pour les charges agent et batch, la question n'est plus « qui mène le classement », mais « qui maintient la facture sous un seuil d'intelligence acceptable ».
Six étapes de migration vers V4-Flash-0731 :
- Vérifier les anciens noms de modèle : depuis le 24 juillet,
deepseek-chatetdeepseek-reasonersont retirés — router versdeepseek-v4-flashoudeepseek-v4-pro(preview). - Confirmer le canal de déploiement : le build 0731 est API uniquement ; app et web peuvent être en retard — la production suit le changelog API.
- Conserver la compatibilité SDK : OpenAI ChatCompletions et format Anthropic inchangés ;
deepseek-v4-flashpointe automatiquement vers le build officiel. - Séparer les familles de benchmarks : SWE-bench Verified et suites tierces largement adoptées sont plus fiables que Terminal Bench 2.0 lié à un Harness non public — ne pas extrapoler vers Claude Code ou Cursor.
- A/B sur vos propres dépôts : comparer Flash, Kimi K3 et Qwen3.8-Max sur vos workflows agent réels — taux de succès et dépense en tokens, pas les slides éditeur seuls.
- Suivre la GA de V4-Pro et Harness : texte officiel limité à « dès que possible » ; toute date 10–20 août vue en ligne reste une rumeur jusqu'à confirmation changelog.
Documentation et changelog officiels :
05 Controverses de benchmarks, kill-line et choix d'infrastructure agent
- Terminal Bench 2.0 (éditeur) : V4-Flash-0731 à 82,7 vs. preview V4-Pro 67,9 — mesuré avec Harness minimal mode non public ; résultat spécifique au framework.
- Multiples tarifaires vs. Claude Opus 4.8 (21st Century Business Herald) : entrée cache miss environ 36x moins chère, entrée cache hit 179x, sortie 89x — tarifs liste éditeur, non audités.
- « Kill-line » (斩杀线) : expression de la communauté chinoise pour la barre « performance suffisante + prix plancher » imposée par DeepSeek — les concurrents sans avantage net en qualité ou en coût risquent de disparaître des tables de routage.
FAQ
- Principal écart V4 vs. V3.2 ? Contexte natif 1M tokens, FLOPs et KV cache fortement réduits en long contexte ; capacités agent optimisées pour Claude Code, OpenCode, etc.
- Flash ou Pro au quotidien ? Flash-0731 pour appels massifs et pipelines agent ; Pro preview si raisonnement plus profond et budget plus large — réévaluer à la sortie du Pro officiel.
- V4-Pro officiel disponible ? Non au 5 août ; seul Flash-0731 est officiel, API uniquement.
- Peut-on faire confiance aux benchmarks ? Suites tierces largement adoptées oui ; scores agent dépendants de Harness à confirmer par reproduction indépendante avec Claude Code ou Cursor.
S'appuyer entièrement sur des API cloud expose à la latence, aux pics de facturation et aux changements de routage. Un déploiement local de poids ouverts bute sur les plafonds de mémoire unifiée, la stabilité 24/7 et le scaling multi-nœuds. Pour les équipes nécessitant un macOS complet (Claude Code, OpenCode, OpenClaw, CI/CD Xcode) avec des nœuds agent toujours actifs, la location bare-metal Mac Mini M4 CALMVPS est en général le meilleur choix de production : Apple Silicon dédié, six régions, livraison en 120 secondes. Modèles et tarifs en direct : tarifs CALMVPS.
Vérifiez tarifs, benchmarks et statut V4-Pro / Harness avant mise en production — données au 5 août 2026.