Kimi K3 poids ouverts :
2,8T MoE, 1M tokens — ce que Moonshot vient de libérer

Le 27 juillet 2026, vers 23 h, Moonshot AI a publié l'intégralité des poids Kimi K3 (~1,56 To), son rapport technique, ainsi que MoonEP, FlashKDA et AgentEnv — le premier modèle de classe 3T entièrement mis à disposition, avec 1 million de tokens de contexte.

Cet article s'adresse aux décideurs techniques et créatifs qui évaluent licence open weight, coût d'auto-hébergement et choix d'API. Vous y trouverez une chronologie de onze jours, une matrice de spécifications, l'analyse des innovations d'architecture, les scores Vals AI, deux seuils commerciaux de licence, les tarifs API et six étapes de déploiement — pour répondre à : open source ou open weight ? Faut-il auto-héberger ? Quels pièges juridiques ?

01 De l'API aux poids ouverts Kimi K3 : chronologie de onze jours et erreurs fréquentes

Erreurs fréquentes avant de télécharger les poids :

  • Confondre « open source » et « open weight » : Moonshot emploie officiellement « open weight », jamais « open source » — un audit OSI sous-estime les risques de conformité.
  • Ignorer les seuils de licence : La nouvelle licence custom introduit un plafond MaaS de 20 M$ sur 12 mois et une obligation d'affichage à 100 M MAU — différente du Modified MIT de K2.
  • Compter les paramètres, pas le coût d'activation : 2,8T au total, 16 experts actifs sur 896 — l'auto-hébergement exige un super-nœud 64+ GPU, hors de portée du matériel grand public.
  • Mélanger géopolitique et ingénierie : Accusations américaines (22–23 juillet) et réponse chinoise (28 juillet) pendant WAIC 2026 — évaluer séparément le contexte politique et les choix techniques.

Seulement onze jours séparent le lancement API de la libération complète des poids :

  • 16 juillet (veille WAIC) : K3 sur kimi.com, Kimi Work, Kimi Code et API — poids encore fermés. Titre du blog : « Kimi K3: Open Frontier Intelligence ».
  • 17 juillet : Analyses sectorielles ; Xinhua qualifie le modèle de plus vaste jamais publié.
  • 22–23 juillet : Escalade du différend sur la distillation — Michael Kratsios accuse Moonshot ; Scott Bessent évoque des sanctions.
  • 27 juillet (~23 h) : Poids complets, rapport technique, MoonEP et AgentEnv (FlashKDA déjà open source).
  • 28 juillet : Réponse du ministère chinois ; Alibaba annonce Qwen3.8-Max-Preview (24T) — concurrence dans le « club 3T ».
Spécifications clés Kimi K3 (27 juillet 2026)
Attribut Valeur
Paramètres totaux 2,8 billions (2,8T)
Paramètres actifs ~104 milliards
Architecture Mixture-of-Experts (MoE)
Configuration experts 896 experts routés, 16 actifs par token (+ experts partagés)
Attention Kimi Delta Attention (KDA) + Gated MLA
Fenêtre de contexte 1 048 576 tokens (1M)
Multimodal Vision native (ViT-V2, 27 couches)
Format des poids MXFP4 poids + MXFP8 activation
Taille du téléchargement ~1,56 To (Hugging Face)
Licence Licence custom (open weight, pas open source)

02 Architecture Kimi K3 : KDA, AttnRes et trois composants infra open source

K3 repense trois piliers du deep learning — attention, connexions résiduelles, optimiseur — au lieu de simplement empiler des paramètres.

Kimi Delta Attention (KDA) : Décroissance par canal plutôt que scalaire ; formule DPLR chunkwise pour récurrence linéaire. KDA alterne avec quelques couches Gated MLA et maintient un KV cache faible à 1M tokens.

Attention Residuals (AttnRes) : Agrégation sélective et dépendante de l'entrée de toutes les couches précédentes — ~25 % d'efficacité d'entraînement, surcoût inférieur à 2 %.

Per-Head Muon : Optimisation indépendante par tête d'attention — technique d'entraînement invisible côté API, mais clé pour la performance par paramètre actif.

Stable LatentMoE : Sparsité 896→16 (~1,8 %), Quantile Balancing et MoonEP — borne théorique des experts redondants par nœud démontrée.

Trois composants infra open source
Composant Rôle Capacité clé
MoonEP Bibliothèque de communication MoE Réplication temporaire des experts surchargés ; distribution uniforme des tokens par nœud
FlashKDA Opérateur KDA sur NVIDIA CUTLASS Prefill sur H20 1,72–2,22× plus rapide que la baseline flash-linear-attention
AgentEnv Sandbox agent avec KVCache.ai (Firecracker microVM) Entraînement RL agent parallèle ; checkpoint 133 ms, recovery 49 ms (chiffres éditeur, reproduction indépendante en attente)

Moonshot ne livre pas seulement des poids : l'infrastructure qui a rendu K3 entraînable est ouverte — un niveau rare de transparence ingénierie dans la classe 3T, pertinent pour les workflows créatifs à long contexte sur Mac.

03 Benchmarks Kimi K3 : SWE-bench, tarifs API et deux seuils commerciaux de licence

Priorité aux mesures indépendantes ; chiffres éditeur signalés séparément.

SWE-bench Verified (Vals AI, juillet 2026)
Modèle Score Release
Claude Opus 5 97 % 2026-07-24
GPT-5.6 Sol 96,2 % 2026-07-09
Claude Fable 5 95 % 2026-06-09
Kimi K3 93,4 % 2026-07-16
Qwen3.7-Max 79,4 % 2026-05-19
DeepSeek-V4 76,2 % 2026-04-23

Artificial Analysis Intelligence Index (max) : K3 atteint ~57 — 3e mondial, leader open weight. Coût ~0,95 $/tâche vs Fable 5 ~2,4 $ — mais plus cher que GLM-5.2 (~0,47 $). Plafond de capacité open weight, pas champion prix-performance. Arena.ai Frontend Code Arena : K3 en tête.

Open weight ≠ open source : OSI exige données, code et processus reproductible — K3 publie poids, rapport et infra d'inférence. Licence custom avec deux seuils :

  • Revenu MaaS : Si le licencié exploite un service Model-as-a-Service avec >20 M$ de revenus sur 12 mois, accord séparé avec Moonshot requis.
  • Affichage à l'échelle : Au-delà de 100 M MAU ou 20 M$ de revenus mensuels, affichage prominent de « Kimi K3 » obligatoire.
Tarifs API Kimi K3 (par million de tokens)
Type de token Prix
Entrée (cache hit) 0,30 $
Entrée (cache miss) 3,00 $
Sortie (incl. reasoning) 15,00 $

L'architecture Mooncake dépasse 90 % de cache hit sur charges de code — coût effectif proche de 0,30 $/M en entrée. Auto-hébergement : super-nœud 64+ GPU recommandé ; pour la plupart des équipes, API ou OpenRouter (7 fournisseurs actifs).

04 Intégration API Kimi K3 et six étapes de mise en production

Moonshot propose des Chat Completions compatibles OpenAI — ID modèle kimi-k3, base URL https://api.moonshot.ai/v1.

kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Analyse ce code..."}]
)

Sources officielles — vérifier avant citation :

https://kimi.com/blog/kimi-k3

https://api.moonshot.ai/v1

https://huggingface.co/moonshotai

Six étapes de mise en production :

  1. Clarifier la licence : Vérifier si revenu MaaS >20 M$ ou MAU >100 M est plausible — impliquer le juridique tôt.
  2. Choisir la route : API Moonshot directe ou OpenRouter moonshotai/kimi-k3 dans votre stack OpenAI SDK existante.
  3. Activer le prompt caching : Clés de cache pour codebase et boucles agent — viser 90 %+ de hits, ~0,30 $/M en entrée effectif.
  4. Auto-hébergement vs API : 1,56 To et 64+ GPU — sans cluster, privilégier API ou hébergement tiers.
  5. Routage hybride : Sessions de code longues sur K3 ; bugfixes difficiles en fallback Claude Fable 5 ; agents terminal sur GPT-5.6 Sol.
  6. Évaluer les repos infra : MoonEP, FlashKDA, AgentEnv pour entraînement MoE ou RL agent — revérifier GitHub après release.

05 Données citables, FAQ et conclusion production

Données citables (EEAT) :

  • Échelle : 2,8T paramètres totaux, 16/896 experts actifs — premier modèle 3T entièrement publié (blog Moonshot, 27 juillet 2026).
  • SWE-bench Verified : 93,4 % mesuré indépendamment — leader camp open weight (Vals AI, juillet 2026).
  • FlashKDA : Prefill sur H20 1,72–2,22× plus rapide que baseline (GitHub Moonshot — vérifier après release).

FAQ :

  • Q : Kimi K3 est-il open source ? R : Non — open weight : poids et infra publics, données et code d'entraînement complets absents (définition OSI non remplie).
  • Q : Usage commercial libre ? R : Oui pour la plupart des cas ; MaaS >20 M$/12 mois ou MAU >100 M déclenche des clauses spécifiques.
  • Q : Combien de GPU pour auto-héberger ? R : Officiellement super-nœud 64+ GPU ; API ou OpenRouter plus réaliste pour la majorité.
  • Q : Performance vs coût ? R : Modèle open weight le plus capable, mais plus cher que GLM-5.2 — plafond de capacité, pas champion budget.
  • Q : Différence avec K2 ? R : ~3× paramètres, AttnRes et Per-Head Muon nouveaux, contexte 1M, clauses MaaS renforcées.

Conclusion : La libération des poids Kimi K3 marque l'entrée des labs chinois dans le « club 3T » — ingénierie (KDA, MoonEP) et géopolitique se superposent, mais en production : lire la licence, puis choisir API ou hébergement plutôt que télécharger aveuglément 1,56 To.

Un MacBook en gateway 7×24 interrompt les marathons de code quand il se met en veille ; un cluster 64 GPU reste hors de portée pour un studio indépendant. Pour Kimi Code, agents Cursor ou OpenClaw Gateway en continu, la location Mac Mini bare metal CALMVPS reste l'option la plus fiable : Apple Silicon dédié, accélération Metal native, provisioning en 120 secondes — boucles agent lourdes dans le cloud, revue locale uniquement. Voir les tarifs.