Kimi K3 Open Weights:
2,8T MoE, 1M Kontext — Moonshot legt Gewichte frei

Am Abend des 27. Juli 2026 veröffentlichte Moonshot AI die vollständigen Kimi K3-Gewichte (~1,56 TB), den Technical Report sowie MoonEP, FlashKDA und AgentEnv — das erste vollständig freigegebene Modell in der 3T-Klasse mit 1M Token Kontext.

Dieser datengetriebene Report richtet sich an Teams, die Open-Weight-Lizenzen, Self-Hosting-Kosten und API-Routing evaluieren. Enthalten: 11-Tage-Timeline, Spezifikationstabelle, Architektur-Innovationen, Vals-AI-Benchmarks, zwei kommerzielle Lizenz-Schwellen, API-Preise, sechs Produktionsschritte und DSGVO-Hinweis — damit Sie beantworten: Open Source oder Open Weight? Lohnt Self-Hosting? Welche Compliance-Fallen?

01 Kimi K3 von API-Launch zu Open Weights: 11-Tage-Timeline und typische Fehlannahmen

Typische Fehlannahmen vor dem Gewichts-Download:

  • „Open Source“ vs. Open Weight verwechseln: Moonshot nutzt offiziell nur „open weight“, nie „open source“ — Legal-Teams, die OSI-Kriterien anlegen, unterschätzen Compliance-Risiken.
  • Lizenz-Schwellen ignorieren: Die neue Custom License führt MaaS-Umsatzschwelle $20 Mio./12 Monate und 100 Mio. MAU-Anzeigepflicht ein — abweichend von Modified MIT bei K2.
  • Nur Parameter zählen, nicht Aktivierungskosten: 2,8T Gesamtparameter, aber nur 16 von 896 Experten pro Token — Self-Hosting erfordert 64+ GPU-Supernode, Consumer-Hardware scheitert.
  • Destillations-Streit mit Engineering vermischen: US-Vorwürfe (22.–23. Juli) und chinesische Gegenreaktion (28. Juli) überlagern WAIC 2026 — Geopolitik und Architektur getrennt bewerten.

Vom API-Launch bis zur vollständigen Gewichtsfreigabe vergingen nur 11 Tage:

  • 16. Juli (WAIC-Vorabend): K3 auf kimi.com, Kimi Work, Kimi Code und API live — Gewichte noch geschlossen. Blog-Titel: „Kimi K3: Open Frontier Intelligence“.
  • 17. Juli: Branchenanalysen zur Architektur; Xinhua berichtet über das größte veröffentlichte Modell weltweit.
  • 22.–23. Juli: US-Destillations-Streit eskaliert — Michael Kratsios wirft Moonshot industrialisierte Destillation von Anthropic Fable vor; Scott Bessent erwägt Sanktionen.
  • 27. Juli (~23:00): Vollständige Gewichte, Technical Report, MoonEP und AgentEnv (FlashKDA bereits früher open source).
  • 28. Juli: Chinesisches Handelsministerium reagiert; Alibaba kündigt Qwen3.8-Max-Preview (24T) an — Wettbewerb in der „3T-Club“-Phase.
Kimi K3 Kerndaten (Stand 27.07.2026)
Merkmal Wert
Gesamtparameter 2,8 Billionen (2,8T)
Aktive Parameter ~104 Mrd.
Architektur Mixture-of-Experts (MoE)
Experten-Konfiguration 896 Routing-Experten, 16 aktiv pro Token (+ Shared Experts)
Aufmerksamkeit Kimi Delta Attention (KDA) + Gated MLA
Kontextfenster 1.048.576 Token (1M)
Multimodal Native Vision (ViT-V2, 27 Layer)
Gewichtsformat MXFP4 Gewichte + MXFP8 Aktivierung
Download-Größe ~1,56 TB (Hugging Face)
Lizenz Custom License (open weight, nicht open source)

02 Kimi K3 Architektur: KDA, AttnRes und drei open-source Infra-Komponenten

K3 überarbeitet drei klassische Deep-Learning-Bausteine — Attention, Residualverbindungen, Optimizer — statt nur Parameter zu skalieren.

Kimi Delta Attention (KDA): Statt skalarer Vergessensrate pro Kanal eigene Decay-Rate; chunkweise DPLR-Formel für lineare Rekursion. KDA wechselt mit wenigen Gated-MLA-Schichten und hält KV-Cache bei 1M Token niedrig.

Attention Residuals (AttnRes): Selektive, inputabhängige Aggregation aller vorherigen Layer statt uniformer Addition — ~25 % Trainingseffizienz, Overhead unter 2 %.

Per-Head Muon: Unabhängige Optimierung pro Attention-Head — reine Trainingstechnik, API-nutzbar ohne Sichtbarkeit, aber entscheidend für Leistung pro aktivem Parameter.

Stable LatentMoE: 896→16 Sparsity (~1,8 %), Quantile Balancing plus MoonEP — theoretische Obergrenze redundanter Experten pro Node nachweisbar.

Drei open-source Infra-Komponenten
Komponente Rolle Kernfähigkeit
MoonEP MoE-Kommunikationsbibliothek Temporäre Replikation überlasteter Experten; gleichmäßige Token-Verteilung pro Node
FlashKDA KDA-Operator auf NVIDIA CUTLASS Prefill auf H20 1,72–2,22× schneller als flash-linear-attention-Baseline
AgentEnv Agent-Sandbox mit KVCache.ai (Firecracker microVM) Paralleles Agent-RL-Training; Checkpoint 133 ms, Recovery 49 ms (Herstellerangabe, noch ohne unabhängige Reproduktion)

Moonshot liefert nicht nur Gewichte, sondern die Infrastruktur, die K3 trainierbar machte — ein seltenes Maß an Engineering-Transparenz in der 3T-Klasse.

03 Kimi K3 Benchmarks: SWE-bench, API-Preise und zwei kommerzielle Lizenz-Schwellen

Priorität: unabhängige Drittanbieter-Daten; Herstellerangaben separat gekennzeichnet.

SWE-bench Verified (Vals AI, Juli 2026)
Modell Score Release
Claude Opus 5 97 % 2026-07-24
GPT-5.6 Sol 96,2 % 2026-07-09
Claude Fable 5 95 % 2026-06-09
Kimi K3 93,4 % 2026-07-16
Qwen3.7-Max 79,4 % 2026-05-19
DeepSeek-V4 76,2 % 2026-04-23

Artificial Analysis Intelligence Index (max): K3 erreicht ~57 — global Platz 3, führend unter Open Weights. Kosten ~$0,95/Task vs. Fable 5 ~$2,4 — aber teurer als GLM-5.2 (~$0,47). Fähigkeitsobergrenze im Open-Camp, nicht Preis-Leistungs-Sieger. Arena.ai Frontend Code Arena: K3 führt.

Open Weight ≠ Open Source: OSI verlangt Trainingsdaten, Code und reproduzierbaren Prozess — K3 liefert Gewichte, Report und Inferenz-Infra. Custom License mit zwei Schwellen:

  • MaaS-Umsatz: Betreibt der Lizenznehmer Model-as-a-Service mit >$20 Mio. Umsatz in 12 Monaten, ist eine separate Vereinbarung mit Moonshot nötig.
  • Skalen-Anzeige: Bei >100 Mio. MAU oder >$20 Mio. Monatsumsatz muss „Kimi K3“ prominent angezeigt werden.
Kimi K3 API-Preise (pro 1M Token)
Token-Typ Preis
Input (Cache Hit) $0,30
Input (Cache Miss) $3,00
Output (inkl. Reasoning) $15,00

Mooncake-Architektur erreicht bei Coding-Workloads >90 % Cache-Hit — effektive Input-Kosten näher $0,30/M. Self-Hosting: 64+ GPU-Supernode empfohlen; für die meisten Teams API oder OpenRouter (7 Anbieter live).

04 Kimi K3 API-Anbindung und sechs Schritte zum Produktions-Rollout

Moonshot bietet OpenAI-kompatible Chat Completions — Model-ID kimi-k3, Base URL https://api.moonshot.ai/v1.

kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Analysiere diesen Code..."}]
)

Primärquellen — vor Zitaten erneut prüfen:

https://kimi.com/blog/kimi-k3

https://api.moonshot.ai/v1

https://huggingface.co/moonshotai

Sechs Schritte zum Produktions-Rollout:

  1. Lizenzgrenzen klären: Prüfen, ob MaaS-Umsatz >$20 Mio. oder MAU >100 Mio. realistisch — Legal früh einbinden.
  2. Route wählen: Direkte Moonshot-API oder OpenRouter moonshotai/kimi-k3 im bestehenden OpenAI-SDK-Stack.
  3. Prompt-Caching aktivieren: Cache-Keys für Repository-Skala und Agent-Loops — 90 %+ Hit-Raten anstreben, effektiv ~$0,30/M Input.
  4. Self-Hosting vs. API: 1,56 TB Gewichte und 64+ GPUs — ohne Cluster API oder Drittanbieter-Hosting wählen.
  5. Hybrid-Routing: Lange Coding-Sessions auf K3; schwierigste Repo-Bugfixes Fallback Claude Fable 5; terminal-lastige Agents behalten GPT-5.6 Sol.
  6. Infra-Repos evaluieren: MoonEP, FlashKDA, AgentEnv für MoE-Training oder Agent-RL — GitHub-Stand nach Release erneut prüfen.

05 Zitierbare Kennzahlen, FAQ, DSGVO und Fazit

Zitierbare Kennzahlen (EEAT):

  • Scale: 2,8T Gesamtparameter, 16/896 aktive Experten — erstes vollständig freigegebenes 3T-Modell (Moonshot Blog, 27.07.2026).
  • SWE-bench Verified: 93,4 % unabhängig gemessen — führend im Open-Weight-Camp (Vals AI, Juli 2026).
  • FlashKDA: Prefill auf H20 1,72–2,22× schneller als Baseline (Moonshot GitHub — Stand nach Release prüfen).

FAQ:

  • F1: Ist Kimi K3 Open Source? A: Nein — Open Weight: Gewichte und Infra öffentlich, Trainingsdaten und vollständiger Trainingscode fehlen (OSI-Definition nicht erfüllt).
  • F2: Kommerziell nutzbar? A: Für die meisten Szenarien ja; MaaS >$20 Mio./12 Monate oder MAU >100 Mio. löst Lizenzklauseln aus.
  • F3: Wie viele GPUs für Self-Hosting? A: Offiziell 64+ GPU-Supernode; API oder OpenRouter für die meisten Teams realistischer.
  • F4: Performance vs. Kosten? A: Stärkstes Open-Weight-Modell, aber teurer als GLM-5.2 — Fähigkeitsobergrenze, nicht Budget-Sieger.
  • F5: Unterschied zu K2? A: ~3× Parameter, AttnRes und Per-Head Muon neu, 1M Kontext, verschärfte MaaS-Lizenzklauseln.

DSGVO: Moonshot-API (api.moonshot.ai) verarbeitet Prompts in chinesischen Rechenzentren — Drittlandübermittlung nach Art. 44 ff. DSGVO für EU-Teams mit personenbezogenen Daten. Self-Hosting in EU reduziert Cloud-Exposition; Auftragsverarbeitung und Standardvertragsklauseln prüfen.

Fazit: Kimi K3 Open Weights markiert den Eintritt chinesischer Labs in den „3T-Club“ — Engineering (KDA, MoonEP) und Geopolitik überlagern sich, aber für Produktion gilt: Lizenz lesen, dann API oder Hosting wählen — nicht blind 1,56 TB laden.

K3-Agents auf schlafendem Laptop brechen lange SWE-Marathons; 64-GPU-Cluster sind für Einzelentwickler unrealistisch. Für Cursor Agent, Kimi Code oder OpenClaw Gateway 24/7 ist CALMVPS Bare-Metal Mac Mini Miete die stabilere Wahl: dediziertes Apple Silicon, Metal-native Beschleunigung, ~120 s Provisioning — schwere Agent-Runs in die Cloud, lokal nur Review. Preisseite.