Les équipes qui routent du trafic de production vers des API chinoises viennent de perdre une règle simple. En cinq jours, DeepSeek a relevé certaines tranches jusqu’à 1100 %, Alibaba a publié les poids d’un fleuron à 2,4 billions de paramètres, et Zhipu a livré GLM-5.3 avec un saut d’environ 6× sur les benches de code, sans changer de base. Le signal commun n’est pas « la Chine baisse encore ». C’est le passage du prix plancher au pouvoir de tarification.
Le texte reste dans le brief source : chronologie, grille en RMB, specs Qwen, benches GLM, trois logiques, tableau comparatif, points contestés et six contrôles. Vous devez pouvoir dire à quelle ligne correspondent les 1100 %, qui peut commercialiser Qwen3.8-Max, et si GLM-5.3 est un nouveau fondement.
01 Chronologie de la hausse DeepSeek : quoi, quand
La douleur opérationnelle est nette. Les titres citent 11×, 1100 % et 350 % comme un seul chiffre. Une rumeur interdisait le téléchargement depuis les États-Unis, l’UE, le Royaume-Uni et la Corée. Les deux se tranchent avec une date et une ligne de facturation.
| Date | Événement |
|---|---|
| 16 juillet 2026 | Moonshot AI ouvre Kimi K3 (2,8 T) ; intérêt sécuritaire américain déjà noté |
| 30 juillet 2026 | OpenAI baisse GPT-5.6 Luna de 80 % |
| 2–3 août 2026 | Alibaba annonce puis lance Qwen3.8-Max en API hébergée |
| 6–7 août 2026 | OpenAI fait de Luna le modèle gratuit par défaut, texte illimité |
| 10 août 2026 | Meta publie Muse Glimmer (30B, Apache 2.0) et annonce les poids de Muse Spark 1.2 |
| 12 août 2026 | Alibaba dépose Qwen3.8-2.4T-A95B sur Hugging Face / ModelScope ; xAI livre Grok 4.6 |
| 13 août 2026 | DeepSeek-V4-Pro en GA et hausse au 17 août ; Google baisse Gemini 3.7 Flash |
| 14 août 2026 | Zhipu livre GLM-5.3 sur la même base 743B que GLM-5.2 |
| 17 août 2026, 00:00 Pékin | Les nouveaux tarifs DeepSeek s’appliquent |
Dans la même fenêtre, les laboratoires américains baissent et gratuisent la couche grand public. La presse économique chinoise parle de « trois mises à jour par semaine » et range DeepSeek, Alibaba, Zhipu, Kimi K3 et MiniMax H3 comme une pression sur une re-tarification mondiale.
Un labo tarifie l’heure. Un autre publie des poids avec un plafond de revenus. Un troisième ne scale que le post-entraînement. Ensemble, ils définissent qui fixe le prix.
02 Nouveaux tarifs DeepSeek, specs Qwen3.8, benches GLM-5.3
Heures de pointe : 9 h–12 h et 14 h–18 h, heure de Pékin. Unité : RMB pour 1 M de tokens. Source : annonce officielle DeepSeek, recoupée dans le brief avec Wall Street CN, IT Home et V2EX.
| Poste (pour 1 M de tokens) | Ancien | Nouveau, heures creuses | Nouveau, pointe | Hausse pointe |
|---|---|---|---|---|
| V4-Flash entrée cache hit | ¥0,02 | ¥0,05 | ¥0,10 | ~400 % |
| V4-Flash entrée cache miss | ¥1,0 | ¥1,5 | ¥3,0 | 200 % |
| V4-Flash sortie | ¥2,0 | ¥4,5 | ¥9,0 | 350 % |
| V4-Pro entrée cache hit | ¥0,025 | ¥0,15 | ¥0,30 | ~1100 % |
| V4-Pro entrée cache miss | ¥3,0 | ¥4,5 | ¥9,0 | 200 % |
| V4-Pro sortie | ¥6,0 | ¥13,5 | ¥27,0 | 350 % |
Les 1100 % concernent l’entrée cache hit en pointe, la tranche qui partait presque de zéro. La sortie, qui pèse sur les vraies factures, monte de 350 %. Une modélisation citée dans la version anglaise du brief (environ 84 M de tokens/mois, surtout en heures creuses, moitié de hits) aboutit plutôt à 1,8×.
| Rubrique | Détail |
|---|---|
| Paramètres | 2,4 T au total, 95 B actifs (MoE, 512 experts, 10 routés + 1 partagé) |
| Contexte | 262 144 tokens natifs, extensible à ~1,01 M ; Max hébergé à 1 M par défaut |
| Rythme | Aperçu 2 août → API 3 août → poids 12 août |
| API internationale | 2 $ / M en entrée, 6 $ / M en sortie |
| Licence | Pas Apache 2.0 — « Qwen3.8-Max License » sur mesure |
| Enjeu | Premier fleuron Max d’Alibaba en poids ouverts ; 3.5 / 3.6 / 3.7 Max restaient API only |
| Bench | GLM-5.2 | GLM-5.3 | Écart |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | +23,7 |
| DeepSWE v1.1 | 46,2 % | 66,9 % | +20,7 |
| Agents' Last Exam (CLI) | 23,8 % | 28,5 % | +4,7 |
| CyberGym | 77,2 % | 84,5 % | +7,3 |
| AutomationBench | 26,2 % | 48,2 % | +22,0 |
Aucune reprise tierce. Sur Terminal-Bench 3.0, GLM-5.3 reste derrière GPT-5.6 Sol (34,6 %) et Claude Fable 5 (33,7 %). Premier groupe open-weight, pas une victoire frontier.
Le titre cite l’entrée cache hit. La facture suit la sortie et l’entrée cache miss.
03 Tarification horaire, licence sur mesure, post-entraînement
DeepSeek rend la capacité visible. Le tarif plat et bas marchait tant que les GPU suivaient. Quand l’usage explose, « encourager une planification plus souple » veut dire : déplacez vous-mêmes la pointe. En heures de pointe, l’API officielle dépasse selon le brief des revendeurs comme GMI Cloud et Novita. L’hypothèse « l’officiel est toujours le moins cher » casse pour la première fois.
Alibaba achète l’écosystème et garde le plafond. Les poids 2,4 T se téléchargent. La licence impose une autorisation commerciale séparée au-delà de 50 M$ de revenus MaaS ou « assistant de travail IA » sur 12 mois. Au-delà de 100 M de MAU ou 20 M$ de revenus mensuels, le nom du modèle doit être affiché. Ce n’est pas le même degré d’ouverture que Muse Glimmer (Apache 2.0 sans clause). L’interdiction géographique est fausse : le texte n’en contient aucune.
GLM-5.3 ne réentraîne pas la base. Mêmes 743 B que 5.2. Terminal-Bench 3.0 de 4,6 % à 28,3 %, environ 6×, uniquement en élargissant les environnements RL du post-entraînement. Quand le pretraining plafonne, le post-entraînement devient un levier moins cher qu’un nouveau fondement.
China labs · Aug 12–17 2026
DeepSeek TOD pricing · cache-hit input ~1100%
Qwen3.8 2.4T-A95B weights + custom license
GLM-5.3 same 743B base · post-training only
US labs Luna -80% then free default · Gemini 3.7 Flash cut
Signal pricing power, not floor price
- Entrée cache hit V4-Pro : ¥0,025 → ¥0,30 en pointe, environ 1100 %.
- Qwen3.8-Max : 2,4 T / 95 B actifs ; API internationale 2 $ / 6 $ ; licence sur mesure.
- GLM-5.3 Terminal-Bench 3.0 : 4,6 % → 28,3 % (auto-mesure) ; derrière Sol 34,6 % et Fable 5 33,7 %.
04 DeepSeek reste-t-il le fleuron le moins cher ? Six contrôles
Change du brief : environ ¥7,15 / 1 $. Ordre de grandeur seulement.
| Modèle | Entrée (pour 1 M) | Sortie (pour 1 M) | Poids ouverts |
|---|---|---|---|
| DeepSeek V4-Pro (pointe) | ¥9,0 (~1,26 $) | ¥27,0 (~3,78 $) | Non |
| DeepSeek V4-Pro (heures creuses) | ¥4,5 (~0,63 $) | ¥13,5 (~1,89 $) | Non |
| Qwen3.8-Max (international) | 2 $ | 6 $ | Oui (licence sur mesure) |
| OpenAI GPT-5.6 Luna | 0,20 $ | 1,20 $ | Non |
| Claude Opus 5 (ratio Alibaba) | ~5 $ | ~25 $ | Non |
Les heures creuses V4-Pro restent nettement sous Claude Opus 5. Ce n’est plus le moins cher du plateau. Qwen international et Luna sous-cotent les heures creuses DeepSeek. « Modèle chinois = moins cher » n’est plus une hypothèse sûre.
Points marqués non vérifiés dans le brief :
- 1100 % est exact et incomplet. Uniquement l’entrée cache hit en pointe. Sortie +350 %.
- Zhenwu M890 / Pangu AL128 : relais de médias financiers chinois, sans document technique Alibaba ni bench tiers.
- Faille Cursor via GLM-5.3 : VentureBeat et Zhipu, détails techniques non publiés.
- Contrôles d’export de représailles : pas d’annonce officielle.
Six contrôles :
- Ouvrir la grille officielle DeepSeek. Séparer cache hit, cache miss et sortie, heures creuses et pointe. Pointe 9 h–12 h et 14 h–18 h Pékin, effet au 17 août 00:00.
- Ramener chaque titre à une ligne. ~1100 % = entrée cache hit V4-Pro en pointe. 350 % = sortie. 200 % = cache miss.
- Lire le fichier Qwen3.8-Max License. Pas d’interdiction géographique. Licence commerciale au-delà de 50 M$ MaaS / assistant IA sur 12 mois. Nom du modèle visible au-delà de 100 M de MAU ou 20 M$ mensuels.
- Traiter les benches GLM comme auto-mesures. Même base 743 B. Terminal-Bench 3.0 4,6 % → 28,3 %. Derrière Sol et Fable 5. Pas de reprise tierce.
- Construire sa matrice. DeepSeek creux/pointe, Qwen 2 $ / 6 $, Luna 0,20 $ / 1,20 $, Opus 5 ~5 $ / ~25 $.
- Planifier la charge. Creux + bons hits ≈ 1,8×. Pointe + misses ≈ titre. L’auto-hébergement exige licence et nœud, pas seulement le téléchargement.
Sources primaires (rouvrir après publication et vérifier le texte en ligne) :
05 FAQ hausse DeepSeek : facture, licence, où faire tourner les agents
FAQ
- DeepSeek reste-t-il moins cher que GPT-5.6 ou Claude ? En heures creuses, oui face à Claude Opus 5. Plus le moins cher globalement. Luna (0,20 $ / 1,20 $) et Qwen international (2 $ / 6 $) sous-cotent au moins une dimension des nouveaux creux.
- Puis-je utiliser les poids Qwen3.8-Max gratuitement en commercial ? Oui dans la plupart des cas. Projets perso et usage interne sans extra. Un MaaS ou assistant IA au-delà de 50 M$ sur 12 mois exige une licence séparée.
- Interdiction pour les utilisateurs US, UE ou UK ? Non. Aucune clause géographique. Les limites sont liées au chiffre d’affaires.
- Quelle différence entre GLM-5.3 et 5.2 ? Rien au niveau de la base. Mêmes 743 milliards. Le saut d’environ 6× vient du RL mis à l’échelle en post-entraînement.
- Meta ouvrira-t-il vraiment le fleuron, pas seulement Glimmer ? Pas encore. Glimmer est un distillat 30B. Muse Spark 1.2 reste fermé ; Zuckerberg a dit « bientôt ». Intention, pas un fichier sur disque.
Le brief nomme aussi, avec prudence, une couche géopolitique. Kimi K3 a déjà attiré un examen sécuritaire américain. Certains analystes lisent le dépôt 2,4 T dans cette fenêtre comme une consolidation d’influence internationale avant un possible resserrement. Interprétation, pas fait établi. La presse tech anglophone a surtout traité ces sorties comme des news produit isolées, pas comme un motif national.
Chasser seulement l’API officielle bon marché expose à la pointe horaire. Télécharger 2,4 T de MoE sans nœud stable ne fait pas un environnement de production. Les clouds GPU partagés mêlent isolation, affichage de licence et journaux 7×24 — un frein aussi pour les flux créatifs Apple (Xcode, rendu, agents locaux). Pour les équipes qui veulent un macOS complet pour Cursor, des essais open-weight et l’iOS CI/CD, avec des nœuds toujours en ligne, la location Mac Mini bare-metal CALMVPS est en général la meilleure option : Apple Silicon dédié, élasticité mensuelle, remise en environ 120 secondes. Tarifs sur la page prix CALMVPS.
Sources : annonce tarifaire officielle DeepSeek, recoupée avec Wall Street CN, IT Home, AIGC.cn, V2EX ; dépôts officiels Qwen (Hugging Face / ModelScope) et SCMP sur la licence ; page technique GLM-5.3 de Zhipu (Z.ai), VentureBeat, StableLearn ; blog Meta AI Research et VentureBeat sur Muse Glimmer ; Yicai et Sohu Finance sur le rythme chinois. Prix, licence et benches à la date de publication. Revérifier le texte officiel avant republication. Puces, faille Cursor et rumeurs d’export restent non vérifiées dans le brief.