Le 3 août 2026, Alibaba a mis en disponibilité générale son modèle phare Qwen3.8-Max et lancé l'agent « Qwen Office » — 2,4 billions de paramètres totaux, 95 milliards actifs par token, fenêtre de contexte 1M tokens, 5e place sur Arena Text Arena, seul modèle non-Anthropic du top 8.
Cet article s'adresse aux développeurs et décideurs techniques qui évaluent le routage API, le calendrier open weight et la migration d'outils agent. Vous y trouverez la chronologie complète du 16 juillet au 3 août, un tableau de specs et benchmarks, la logique MoE, une comparaison avec Kimi K3 / DeepSeek V4 / Claude, la controverse du label open source, ainsi qu'une checklist en six étapes et une FAQ. À la fin : utilisable aujourd'hui, poids réellement ouverts, positionnement face à Kimi K3.
01 Chronologie : Kimi K3, preview Qwen, DeepSeek Flash, GA Alibaba
Fin juillet 2026, les labs chinois ont enchaîné les releases à un rythme soutenu :
- 16 juillet : Moonshot AI publie Kimi K3 (MoE 2,8T, 896 experts / 16 actifs), centré sur benchmarks indépendants et rapport technique.
- 19 juillet : preview Qwen3.8-Max via Token Plan, Qoder et QoderWork à 10 % du tarif standard futur — sans paramètres actifs, sans tableau de benchmarks, CGU interdisant l'usage production automatisé.
- 27 juillet : Kimi K3 publie ses poids ouverts sur Hugging Face, avec une partie de l'infrastructure de serving.
- 31 juillet : DeepSeek V4-Flash dépasse sa propre preview V4-Pro sur neuf benchmarks agent/code — sans augmentation de paramètres.
- 3 août : Qwen3.8-Max passe en GA avec tableau complet et « Qwen Office ». Action Alibaba HK +7 %, cotation US +4,5 %.
- « Semaine prochaine » (vers le 10 août) : poids ouverts promis pour Qwen3.8-Max et Qwen3.8-27B sur Hugging Face et ModelScope — aucun dépôt, licence ou date ferme à la rédaction.
Le récit « tout scaler » cède la place à une course à l'efficacité architecturale — DeepSeek V4-Flash progresse sans plus de paramètres ; Qwen3.8-Max parie sur « gros total, petit actif ».
02 Spécifications et benchmarks Qwen3.8-Max (août 2026)
Chiffres issus des supports de lancement Alibaba. Les lignes « mesure éditeur » n'ont pas été reproduites indépendamment à la rédaction. Vérifier les sources officielles avant engagement production.
| Élément | Valeur |
|---|---|
| Date GA | 3 août 2026 |
| Paramètres totaux / actifs | 2,4T / 95B |
| Architecture | MoE sparse + attention hybride sur base Qwen3.5 |
| Fenêtre de contexte | 1M tokens (≈983K en mode thinking ; max 131K en sortie) |
| Modalités d'entrée | Texte, image, vidéo |
| Tarif API (international) | 2 $ / 6 $ par million tokens entrée/sortie |
| Arena Text Arena (snapshot 1er août) | 5e, 1 496 points (Preliminary) — seul non-Anthropic du top 8 |
| Arena Vision Arena | 2e, derrière Claude Fable 5 |
| PaperBench (mesure éditeur) | 93,0 (+28,2 vs génération précédente) |
| SWE-bench Pro (mesure éditeur) | 67,7 — derrière Fable 5 à 80,0 |
| Poids ouverts | Promis « semaine prochaine » ; non publiés à la rédaction |
03 Logique architecturale et quatre alertes de transparence
Pourquoi MoE sparse plutôt que densité pure ? Qwen3.8-Max atteint 2,4T de paramètres totaux en n'activant que 95B par token. Le coût d'inférence suit le nombre actif, pas le total — d'où un tarif API à 2 $/6 $ par million de tokens, nettement sous Claude Opus 5 (5 $/25 $) et Fable 5 (10 $/50 $).
reasoning_effort comme levier de coût : trois niveaux — low, medium, xhigh (défaut) — pour arbitrer latence et profondeur. API native via enable_thinking, interface Anthropic-compatible via reasoning.effort.
L'autonomie longue durée comme argument central : cas démonstratifs incluant un projet de code 16 jours sans intervention humaine, une optimisation de puce en 500+ étapes, et RecreationBench (reconstruction d'application en boîte noire). Benchmarks internes Alibaba ; trace partielle sur GitHub (qwen-code-dev-bot/oh-my-cli), sans audit indépendant.
Distribution : Qwen3.8-Max intégré à « Qwen Office », protocoles API compatibles OpenAI et Anthropic — Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw via changement de base URL.
Quatre alertes à suivre :
- Label « Open-Source » avant les poids : qwen.ai marque open source le jour du GA — aucun dépôt Hugging Face ou ModelScope, licence ou date de publication.
- Benchmarks exclusivement éditeur : PaperBench, QwenSWEBench, RecreationBench — aucune plateforme neutre n'a reproduit les chiffres GA.
- Lacunes de transparence en preview : preview du 19 juillet sans paramètres actifs, model card ni évaluation sécurité — plusieurs évaluateurs indépendants déconseillaient la migration production.
- Divulgation tardive des paramètres actifs : Kimi K3 ~50B, DeepSeek V4-Pro 49B — Alibaba révèle « 95B » seulement au GA, rien en preview.
Dans le seul test indépendant comparable — architecture logicielle en aveugle sur 269 fichiers — Kimi K3 obtient 83/100 et Qwen3.8-Max 80/100 : match serré, pas de domination nette.
04 Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude
| Modèle | Total / actif | Prix (in/out par 1M tokens) | Poids ouverts ? | Benchmark indépendant |
|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 95B | 2 $ / 6 $ | Promis, non livrés | Aucun pour l'instant |
| Kimi K3 | 2,8T / ~50B | 3 $ / 15 $ | Livrés le 27 juillet | AA Intelligence Index ≈ 57,11 |
| DeepSeek V4-Flash | Identique V4-Pro | Non entièrement publié | Livrés | 9 benchmarks agent/code > V4-Pro |
| Claude Opus 5 | Non divulgué | 5 $ / 25 $ | Fermé | Haut du classement Arena |
| Claude Fable 5 | Non divulgué | 10 $ / 50 $ | Fermé | N°1 Arena Text Arena |
Six étapes de déploiement (Qwen3.8-Max adapté à votre stack ?) :
- Choisir le mode d'accès : API QwenCloud (protocoles OpenAI ou Anthropic) pour inférence hébergée ; attendre Qwen3.8-27B ou évaluer les poids Kimi K3 déjà publiés pour on-prem.
- Vérifier le statut open weight : au 4 août, poids non publiés. Le label « Open-Source » sur qwen.ai ne vaut pas artefact téléchargeable tant qu'aucun dépôt n'existe.
- Configurer reasoning_effort : associer low / medium / xhigh à la complexité — low pour appels simples, xhigh pour workflows agent profonds.
- Brancher la toolchain agent : remplacer base URL et clé API dans Claude Code, Qoder CLI ou OpenClaw via l'endpoint Anthropic-compatible.
- Lancer des A/B sur vos workloads : ne pas migrer sur les benchmarks éditeur seuls. Comparer Qwen3.8-Max, Kimi K3 et DeepSeek V4 sur vos codebases et flux agent réels.
- Attendre la reproduction indépendante : suivre Artificial Analysis et Arena.ai pour des scores tiers GA avant de faire de Qwen3.8-Max la route production par défaut.
05 Données citables, FAQ et choix d'infrastructure agent
- Total vs actif : 2,4T total, 95B activés par token — coût d'inférence comparable à un modèle dense ~100B, pas un appel complet 2,4T.
- Compétitivité tarifaire API : 2 $/6 $ par million de tokens sous Claude Opus 5 (5 $/25 $) et Fable 5 (10 $/50 $) ; cache implicite dès 0,25 $/million.
- Portée grand public : Apple Intelligence en Chine s'appuie sur Qwen — checkpoint ~27B compressé sous 4 Go en local sur iPhone 15+, étendant la portée de Qwen au-delà des benchmarks API.
FAQ
- Qwen3.8-Max est-il open source aujourd'hui ? Non. L'API est live via Alibaba Cloud Model Studio ; les poids ne sont pas publiés. « Open-Source » sur qwen.ai décrit une intention, pas un artefact livré.
- Comparaison avec Kimi K3 ? Pas de face-à-face autoritaire unique. Seul test indépendant : Kimi K3 83/100 vs Qwen 80/100. Avantage K3 : poids publics et score AA ; avantage Qwen : tarif API plus bas et multimodal natif plus large.
- 2,4T implique-t-il un datacenter ? Pour le checkpoint complet, oui. L'API contourne ce besoin. On-prem : viser Qwen3.8-27B à la publication des poids.
- Peut-on faire confiance aux benchmarks Alibaba ? Les traiter comme des affirmations éditeur. Attendre reproduction tierce ou tester sur vos propres workloads.
S'appuyer uniquement sur des appels API cloud pour les workflows agent implique latence, factures token imprévisibles et coût de migration lors des changements de routage. Un déploiement Ollama local heurte les plafonds de mémoire unifiée, la stabilité 24/7 et la montée en charge multi-région. Pour les équipes nécessitant un environnement macOS complet (Claude Code, Qoder CLI, OpenClaw, CI/CD Xcode) avec nœuds agent toujours actifs, la location Mac Mini M4 bare metal CALMVPS est généralement le meilleur compromis : Apple Silicon dédié, flexibilité six régions, provisioning ~120 s. Tarifs live sur la page tarifs CALMVPS.
Vérifier prix, statut open weight et benchmarks Qwen3.8-Max auprès des sources officielles avant migration production. Informations basées sur les données publiques de début août 2026.