Synthèse : Le 16 juillet 2026, Moonshot AI a dévoilé Kimi K3 — le plus grand modèle open source au monde avec 2,8 billions de paramètres, une fenêtre de contexte de 1M tokens, la vision native et des tarifs API à 3 $ / 15 $ par million de tokens. Les poids complets arrivent le 27 juillet.
Cet article s'adresse aux équipes qui évaluent un changement d'API, le calendrier des poids ouverts et les agents de code longue durée. Vous y trouverez la fiche technique, trois innovations architecturales (KDA, AttnRes, Stable LatentMoE), des tableaux de benchmarks face à Claude Fable 5 et GPT-5.6 Sol, une grille tarifaire, un parcours d'intégration en six étapes et une matrice de scénarios — pour répondre : peut-on l'utiliser aujourd'hui, comment se compare-t-il, vaut-il la migration ?
01 Kimi K3 : spécifications, lancement discret et enjeux
Pièges fréquents avant de choisir :
- Le nombre de paramètres seul trompe : les MoE n'activent qu'une fraction d'experts par token — vérifiez experts actifs et efficacité du contexte.
- Les harness de benchmark diffèrent : Moonshot utilise Kimi Code ; GPT Codex ; Claude Claude Code — traitez les scores inter-éditeurs comme indicatifs.
- 1M de contexte sans architecture est du marketing : le coût du cache KV explose sans mécanismes comme KDA.
- Attendre les poids retarde la production : l'API est live ; l'auto-hébergement peut attendre le 27 juillet.
Kimi K3 est un modèle MoE de 2,8T paramètres de Moonshot AI (Pékin) — premier modèle ouvert de classe 3T, ~75 % au-dessus de DeepSeek V4 Pro (1,6T). Il active 16 experts sur 896 par passe avant, offre un contexte réel de 1 048 576 tokens et accepte texte, image et vidéo. ID modèle : kimi-k3. Le raisonnement démarre en effort maximal.
| Spécification | Détail |
|---|---|
| Paramètres totaux | 2,8 billions |
| Architecture | Kimi Delta Attention + Attention Residuals + Stable LatentMoE |
| Experts actifs | 16 / 896 (sparsité 1,8 %) |
| Fenêtre de contexte | 1M tokens |
| Tarifs API | 3 $ entrée / 15 $ sortie par 1M tokens |
| Poids ouverts | 27 juillet 2026 sur Hugging Face |
Dans la nuit du 16 juillet, Moonshot a activé l'API — bannière dans la documentation, pas de conférence de presse. Ce lancement discret contraste avec l'échelle : le plus grand modèle open source jamais publié.
Pourquoi cette sortie compte : la montée de DeepSeek a érodé la position de Moonshot en 18 mois. K3 marque le retour — les modèles Kimi ont détenu le record open source 9 des 12 derniers mois ; ARR au-delà de 300 M$ en juin 2026 ; 6e tour de financement à 31,5 Md$ pre-money ; revenus API 70 %+ du total, utilisateurs payants à l'étranger +400 %. Calendrier : veille de la WAIC 2026 à Shanghai. Une entreprise en forte croissance qui affirme sa technologie, pas un simple jeu d'échelle.
02 Architecture Kimi K3 : KDA, AttnRes et Stable LatentMoE
La plupart des lancements « plus grand modèle » ajoutent du calcul. K3 introduit trois corrections d'ingénierie pour le long contexte et la sparsité MoE extrême.
Kimi Delta Attention (KDA) alterne des couches d'attention linéaire économiques et des couches full-attention en ratio 3:1. Résultat : jusqu'à 75 % de mémoire cache KV en moins et jusqu'à 6,3× de décodage plus rapide à 1M tokens — performances égales ou supérieures aux baselines full-attention sur tâches courtes, longues et RL, sans compromis de capacité. C'est pourquoi la fenêtre 1M est tarifée à plat, pas théorique.
Attention Residuals (AttnRes) remplacent l'accumulation uniforme en profondeur par une récupération sélective entre couches — environ 25 % d'efficacité d'entraînement en plus pour moins de 2 % de calcul supplémentaire.
Stable LatentMoE rend la sparsité 1,8 % (16/896 experts) entraînable via Quantile Balancing, Per-Head Muon, activation SiTU et Gated MLA — ~2,5× meilleure efficacité de scaling vs Kimi K2. Entraînement en MXFP4 et activations MXFP8 pour un déploiement quantization-aware.
03 Benchmarks Kimi K3 et tarification API
Scores publiés par Moonshot ci-dessous. Reproduction indépendante en cours — à traiter comme indicatif.
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| DeepSWE | 67,5 | 70,0 | 73,0 | 59,0 |
| Program Bench | 77,8 | 76,8 | 77,6 | 71,9 |
| Terminal Bench 2.1 | 88,3 | 84,6 | 88,8 | 84,6 |
| FrontierSWE | 81,2 | 86,6 | 71,3 | 66,7 |
| SWE Marathon | 42,0 | 35,0 | 39,0 | 40,0 |
| BrowseComp | 91,2 | 88,0 | 90,4 | 84,3 |
| OmniDocBench | 91,1 | 89,8 | 85,8 | 87,9 |
| HLE-Full | 43,5 | 53,3 | 44,5 | — |
SWE Marathon — code soutenu longue durée — est le point fort : K3 mène à 42,0, 7 points d'avance sur Claude Fable 5. La tête de OmniDocBench s'aligne avec vision native et contexte 1M. Indice Artificial Analysis v4.1 : K3 57,1 (4e rang), seulement 2,8 points derrière #1 Fable 5 (59,9), largement devant la plupart des poids ouverts.
| Modèle | Entrée | Sortie | Entrée cache hit | Contexte |
|---|---|---|---|---|
| Kimi K3 | 3,00 $ | 15,00 $ | 0,30 $ | 1M |
| Claude Sonnet 5 | 3,00 $ | 15,00 $ | — | 200K |
| Claude Opus 4.8 | 5,00 $ | 25,00 $ | — | 200K |
| GPT-5.5 | 5,00 $ | 30,00 $ | — | 400K |
| DeepSeek V4 Pro | 1,74 $ | 3,48 $ | 0,145 $ | 128K |
K3 aligne les tarifs standard de Claude Sonnet 5 mais offre 5× le contexte. Mooncake split-inference atteint 90 %+ de cache hit dans les workflows Kimi Code — coût moyen d'entrée effectif ~0,55 $/M (moyenne pondérée OpenRouter sur 7 jours). vs Opus 4.8 : plus fort sur plusieurs benchmarks à ~60 % du coût entrée et ~40 % sortie.
04 Utiliser Kimi K3 dès maintenant : quatre voies et six étapes
- Chat gratuit : kimi.com — connexion Google, raisonnement max, sans carte bancaire.
- API officielle : compatible OpenAI sur
https://api.moonshot.ai/v1, clé depuis platform.kimi.ai. - OpenRouter :
moonshotai/kimi-k3— tarifs officiels, sans majoration, contexte 1M complet. - Auto-hébergement le 27 juillet : poids complets sur Hugging Face ; la production exige 64+ accélérateurs, pas un portable.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Analyse ce dépôt pour repérer les goulots..."}]
)
print(response.choices[0].message.content)
Sources principales — revérifier les liens après mise à jour en amont :
Six étapes de déploiement en production :
- Créer les identifiants API : inscription sur platform.kimi.ai, facturation, génération de clé.
- Choisir la route : API Moonshot directe ou OpenRouter
moonshotai/kimi-k3dans votre stack OpenAI existante. - Activer le cache de prompts : clés de cache pour échelle dépôt et boucles agent — viser 90 %+ de hits.
- Planifier l'usage 1M : analyse de dépôt entier, documents juridiques/recherche, mémoire agent multi-session — tarif plat rendant la fenêtre complète praticable.
- Routage hybride : tâches longues code et documents sur K3 ; corrections difficiles sur gros dépôts en fallback Fable 5 ; agents terminal lourds conservent GPT-5.6 Sol.
- Calendrier 27 juillet : suivre builds quant MXFP4/NVFP4 Hugging Face et support day-0 vLLM/SGLang si auto-hébergement requis.
05 Kimi K3 face à la concurrence, poids ouverts et FAQ
| Cas d'usage | Meilleur choix | Pourquoi |
|---|---|---|
| Sessions de code longues et soutenues | Kimi K3 | Mène SWE Marathon ; 1M évite la perte en cours de tâche |
| Corrections complexes sur gros dépôts | Claude Fable 5 | Avance significative sur FrontierSWE |
| Workflows agents terminal/outils | GPT-5.6 Sol | Leadership Terminal Bench et indice agent |
| Analyse documentaire multimodale | Kimi K3 | Meilleur OmniDocBench ; vision + 1M |
| Production sensible au coût | DeepSeek V4 Pro | Sortie 3,48 $/M, bien moins cher |
| Auto-hébergement open source (après 27/07) | Kimi K3 | Plus grands poids ouverts disponibles |
| Recherche en raisonnement profond | Claude Fable 5 | Leadership HLE-Full (53,3 vs 43,5) |
Sortie des poids ouverts le 27 juillet : K3 devient le plus grand modèle ouvert téléchargeable, le premier au-delà de 2T paramètres, et une nouvelle base de fine-tuning — entraînement MXFP4 pour une inférence efficace sur matériel moderne. Support day-0 attendu dans transformers, vLLM et SGLang.
Données citables (EEAT) :
- Échelle : 2,8T paramètres totaux, 16/896 experts actifs — ~75 % au-dessus de DeepSeek V4 Pro (blog Moonshot, 16/07/2026).
- Efficacité KDA : 75 % de réduction cache KV, jusqu'à 6,3× accélération décodage à 1M tokens (docs techniques Moonshot).
- Indice d'intelligence : 57,1 sur Artificial Analysis v4.1 — premier plan parmi modèles ouverts (Artificial Analysis, juillet 2026).
FAQ :
- Q : Kimi K3 est-il gratuit ? R : Oui sur kimi.com avec compte gratuit ; l'API est payante au token (3 $ / 15 $ par 1M).
- Q : Peut-on l'exécuter localement ? R : Pas avant les poids du 27 juillet ; ensuite 64+ GPU classe H100 pour l'inférence de production.
- Q : Kimi K3 vs DeepSeek V4 Pro ? R : K3 a presque 2× les paramètres, 1M vs 128K de contexte, scores code plus élevés — DeepSeek bien moins cher en sortie (3,48 $/M).
- Q : Le contexte 1M est-il utile ? R : Oui pour appels dépôt entier, documents juridiques/recherche de bout en bout et agents à longue mémoire — tarif plat le rend viable.
- Q : Quand arrivent les modes raisonnement bas/élevé ? R : Moonshot annonce des mises à jour ultérieures ; seul le max est disponible aujourd'hui.
Conclusion : Kimi K3 est le modèle open source le plus capable publié à ce jour. Il ne remporte pas chaque benchmark — Fable 5 et GPT-5.6 Sol mènent encore sur des tâches ciblées — mais il reste compétitif globalement, domine le code longue durée et la compréhension documentaire, et livre 1M de contexte au tarif Sonnet. Les poids du 27 juillet sont la date à retenir.
Dates clés : Maintenant → essai sur kimi.com · 17–20 juillet → WAIC Shanghai · 27 juillet → poids Hugging Face.
Faire tourner des agents Kimi K3 sur un portable en veille interrompt les boucles SWE Marathon ; des dépôts parallèles se disputent RAM et bande passante. Pour Cursor Agent, Kimi Code ou OpenClaw Gateway 24/7, la location Mac Mini bare metal CALMVPS convient en général mieux : Apple Silicon dédié, accélération Metal native, provisioning ~120 s — agents lourds dans le cloud, validation des plans en local. Page tarifs.