Am Abend des 27. Juli 2026 veröffentlichte Moonshot AI die vollständigen Kimi K3-Gewichte (~1,56 TB), den Technical Report sowie MoonEP, FlashKDA und AgentEnv — das erste vollständig freigegebene Modell in der 3T-Klasse mit 1M Token Kontext.
Dieser datengetriebene Report richtet sich an Teams, die Open-Weight-Lizenzen, Self-Hosting-Kosten und API-Routing evaluieren. Enthalten: 11-Tage-Timeline, Spezifikationstabelle, Architektur-Innovationen, Vals-AI-Benchmarks, zwei kommerzielle Lizenz-Schwellen, API-Preise, sechs Produktionsschritte und DSGVO-Hinweis — damit Sie beantworten: Open Source oder Open Weight? Lohnt Self-Hosting? Welche Compliance-Fallen?
01 Kimi K3 von API-Launch zu Open Weights: 11-Tage-Timeline und typische Fehlannahmen
Typische Fehlannahmen vor dem Gewichts-Download:
- „Open Source“ vs. Open Weight verwechseln: Moonshot nutzt offiziell nur „open weight“, nie „open source“ — Legal-Teams, die OSI-Kriterien anlegen, unterschätzen Compliance-Risiken.
- Lizenz-Schwellen ignorieren: Die neue Custom License führt MaaS-Umsatzschwelle $20 Mio./12 Monate und 100 Mio. MAU-Anzeigepflicht ein — abweichend von Modified MIT bei K2.
- Nur Parameter zählen, nicht Aktivierungskosten: 2,8T Gesamtparameter, aber nur 16 von 896 Experten pro Token — Self-Hosting erfordert 64+ GPU-Supernode, Consumer-Hardware scheitert.
- Destillations-Streit mit Engineering vermischen: US-Vorwürfe (22.–23. Juli) und chinesische Gegenreaktion (28. Juli) überlagern WAIC 2026 — Geopolitik und Architektur getrennt bewerten.
Vom API-Launch bis zur vollständigen Gewichtsfreigabe vergingen nur 11 Tage:
- 16. Juli (WAIC-Vorabend): K3 auf kimi.com, Kimi Work, Kimi Code und API live — Gewichte noch geschlossen. Blog-Titel: „Kimi K3: Open Frontier Intelligence“.
- 17. Juli: Branchenanalysen zur Architektur; Xinhua berichtet über das größte veröffentlichte Modell weltweit.
- 22.–23. Juli: US-Destillations-Streit eskaliert — Michael Kratsios wirft Moonshot industrialisierte Destillation von Anthropic Fable vor; Scott Bessent erwägt Sanktionen.
- 27. Juli (~23:00): Vollständige Gewichte, Technical Report, MoonEP und AgentEnv (FlashKDA bereits früher open source).
- 28. Juli: Chinesisches Handelsministerium reagiert; Alibaba kündigt Qwen3.8-Max-Preview (24T) an — Wettbewerb in der „3T-Club“-Phase.
| Merkmal | Wert |
|---|---|
| Gesamtparameter | 2,8 Billionen (2,8T) |
| Aktive Parameter | ~104 Mrd. |
| Architektur | Mixture-of-Experts (MoE) |
| Experten-Konfiguration | 896 Routing-Experten, 16 aktiv pro Token (+ Shared Experts) |
| Aufmerksamkeit | Kimi Delta Attention (KDA) + Gated MLA |
| Kontextfenster | 1.048.576 Token (1M) |
| Multimodal | Native Vision (ViT-V2, 27 Layer) |
| Gewichtsformat | MXFP4 Gewichte + MXFP8 Aktivierung |
| Download-Größe | ~1,56 TB (Hugging Face) |
| Lizenz | Custom License (open weight, nicht open source) |
02 Kimi K3 Architektur: KDA, AttnRes und drei open-source Infra-Komponenten
K3 überarbeitet drei klassische Deep-Learning-Bausteine — Attention, Residualverbindungen, Optimizer — statt nur Parameter zu skalieren.
Kimi Delta Attention (KDA): Statt skalarer Vergessensrate pro Kanal eigene Decay-Rate; chunkweise DPLR-Formel für lineare Rekursion. KDA wechselt mit wenigen Gated-MLA-Schichten und hält KV-Cache bei 1M Token niedrig.
Attention Residuals (AttnRes): Selektive, inputabhängige Aggregation aller vorherigen Layer statt uniformer Addition — ~25 % Trainingseffizienz, Overhead unter 2 %.
Per-Head Muon: Unabhängige Optimierung pro Attention-Head — reine Trainingstechnik, API-nutzbar ohne Sichtbarkeit, aber entscheidend für Leistung pro aktivem Parameter.
Stable LatentMoE: 896→16 Sparsity (~1,8 %), Quantile Balancing plus MoonEP — theoretische Obergrenze redundanter Experten pro Node nachweisbar.
| Komponente | Rolle | Kernfähigkeit |
|---|---|---|
| MoonEP | MoE-Kommunikationsbibliothek | Temporäre Replikation überlasteter Experten; gleichmäßige Token-Verteilung pro Node |
| FlashKDA | KDA-Operator auf NVIDIA CUTLASS | Prefill auf H20 1,72–2,22× schneller als flash-linear-attention-Baseline |
| AgentEnv | Agent-Sandbox mit KVCache.ai (Firecracker microVM) | Paralleles Agent-RL-Training; Checkpoint 133 ms, Recovery 49 ms (Herstellerangabe, noch ohne unabhängige Reproduktion) |
Moonshot liefert nicht nur Gewichte, sondern die Infrastruktur, die K3 trainierbar machte — ein seltenes Maß an Engineering-Transparenz in der 3T-Klasse.
03 Kimi K3 Benchmarks: SWE-bench, API-Preise und zwei kommerzielle Lizenz-Schwellen
Priorität: unabhängige Drittanbieter-Daten; Herstellerangaben separat gekennzeichnet.
| Modell | Score | Release |
|---|---|---|
| Claude Opus 5 | 97 % | 2026-07-24 |
| GPT-5.6 Sol | 96,2 % | 2026-07-09 |
| Claude Fable 5 | 95 % | 2026-06-09 |
| Kimi K3 | 93,4 % | 2026-07-16 |
| Qwen3.7-Max | 79,4 % | 2026-05-19 |
| DeepSeek-V4 | 76,2 % | 2026-04-23 |
Artificial Analysis Intelligence Index (max): K3 erreicht ~57 — global Platz 3, führend unter Open Weights. Kosten ~$0,95/Task vs. Fable 5 ~$2,4 — aber teurer als GLM-5.2 (~$0,47). Fähigkeitsobergrenze im Open-Camp, nicht Preis-Leistungs-Sieger. Arena.ai Frontend Code Arena: K3 führt.
Open Weight ≠ Open Source: OSI verlangt Trainingsdaten, Code und reproduzierbaren Prozess — K3 liefert Gewichte, Report und Inferenz-Infra. Custom License mit zwei Schwellen:
- MaaS-Umsatz: Betreibt der Lizenznehmer Model-as-a-Service mit >$20 Mio. Umsatz in 12 Monaten, ist eine separate Vereinbarung mit Moonshot nötig.
- Skalen-Anzeige: Bei >100 Mio. MAU oder >$20 Mio. Monatsumsatz muss „Kimi K3“ prominent angezeigt werden.
| Token-Typ | Preis |
|---|---|
| Input (Cache Hit) | $0,30 |
| Input (Cache Miss) | $3,00 |
| Output (inkl. Reasoning) | $15,00 |
Mooncake-Architektur erreicht bei Coding-Workloads >90 % Cache-Hit — effektive Input-Kosten näher $0,30/M. Self-Hosting: 64+ GPU-Supernode empfohlen; für die meisten Teams API oder OpenRouter (7 Anbieter live).
04 Kimi K3 API-Anbindung und sechs Schritte zum Produktions-Rollout
Moonshot bietet OpenAI-kompatible Chat Completions — Model-ID kimi-k3, Base URL https://api.moonshot.ai/v1.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Analysiere diesen Code..."}]
)
Primärquellen — vor Zitaten erneut prüfen:
https://huggingface.co/moonshotai
Sechs Schritte zum Produktions-Rollout:
- Lizenzgrenzen klären: Prüfen, ob MaaS-Umsatz >$20 Mio. oder MAU >100 Mio. realistisch — Legal früh einbinden.
- Route wählen: Direkte Moonshot-API oder OpenRouter
moonshotai/kimi-k3im bestehenden OpenAI-SDK-Stack. - Prompt-Caching aktivieren: Cache-Keys für Repository-Skala und Agent-Loops — 90 %+ Hit-Raten anstreben, effektiv ~$0,30/M Input.
- Self-Hosting vs. API: 1,56 TB Gewichte und 64+ GPUs — ohne Cluster API oder Drittanbieter-Hosting wählen.
- Hybrid-Routing: Lange Coding-Sessions auf K3; schwierigste Repo-Bugfixes Fallback Claude Fable 5; terminal-lastige Agents behalten GPT-5.6 Sol.
- Infra-Repos evaluieren: MoonEP, FlashKDA, AgentEnv für MoE-Training oder Agent-RL — GitHub-Stand nach Release erneut prüfen.
05 Zitierbare Kennzahlen, FAQ, DSGVO und Fazit
Zitierbare Kennzahlen (EEAT):
- Scale: 2,8T Gesamtparameter, 16/896 aktive Experten — erstes vollständig freigegebenes 3T-Modell (Moonshot Blog, 27.07.2026).
- SWE-bench Verified: 93,4 % unabhängig gemessen — führend im Open-Weight-Camp (Vals AI, Juli 2026).
- FlashKDA: Prefill auf H20 1,72–2,22× schneller als Baseline (Moonshot GitHub — Stand nach Release prüfen).
FAQ:
- F1: Ist Kimi K3 Open Source? A: Nein — Open Weight: Gewichte und Infra öffentlich, Trainingsdaten und vollständiger Trainingscode fehlen (OSI-Definition nicht erfüllt).
- F2: Kommerziell nutzbar? A: Für die meisten Szenarien ja; MaaS >$20 Mio./12 Monate oder MAU >100 Mio. löst Lizenzklauseln aus.
- F3: Wie viele GPUs für Self-Hosting? A: Offiziell 64+ GPU-Supernode; API oder OpenRouter für die meisten Teams realistischer.
- F4: Performance vs. Kosten? A: Stärkstes Open-Weight-Modell, aber teurer als GLM-5.2 — Fähigkeitsobergrenze, nicht Budget-Sieger.
- F5: Unterschied zu K2? A: ~3× Parameter, AttnRes und Per-Head Muon neu, 1M Kontext, verschärfte MaaS-Lizenzklauseln.
DSGVO: Moonshot-API (api.moonshot.ai) verarbeitet Prompts in chinesischen Rechenzentren — Drittlandübermittlung nach Art. 44 ff. DSGVO für EU-Teams mit personenbezogenen Daten. Self-Hosting in EU reduziert Cloud-Exposition; Auftragsverarbeitung und Standardvertragsklauseln prüfen.
Fazit: Kimi K3 Open Weights markiert den Eintritt chinesischer Labs in den „3T-Club“ — Engineering (KDA, MoonEP) und Geopolitik überlagern sich, aber für Produktion gilt: Lizenz lesen, dann API oder Hosting wählen — nicht blind 1,56 TB laden.
K3-Agents auf schlafendem Laptop brechen lange SWE-Marathons; 64-GPU-Cluster sind für Einzelentwickler unrealistisch. Für Cursor Agent, Kimi Code oder OpenClaw Gateway 24/7 ist CALMVPS Bare-Metal Mac Mini Miete die stabilere Wahl: dediziertes Apple Silicon, Metal-native Beschleunigung, ~120 s Provisioning — schwere Agent-Runs in die Cloud, lokal nur Review. Preisseite.