Kimi K3 Review:
Das 2,8-Billionen-Parameter Open-Source-Modell vs Claude und GPT

Kurzfassung: Am 16. Juli 2026 veröffentlichte Moonshot AI Kimi K3 — mit 2,8 Billionen Parametern das größte Open-Source-Modell weltweit, 1M Token Kontext, native Vision und API-Preise $3/$15 pro Million Tokens. Vollständige Gewichte ab 27. Juli.

Dieser datengetriebene Report richtet sich an Teams, die API-Wechsel, Open-Weight-Timelines und Long-Horizon-Coding-Agents evaluieren. Enthalten: Spezifikationstabelle, drei Architektur-Innovationen (KDA, AttnRes, Stable LatentMoE), Benchmark-Tabellen vs Claude Fable 5 und GPT-5.6 Sol, Preisrechnung, sechs Integrationsschritte und Szenario-Matrix — damit Sie beantworten: Läuft es heute? Wie schneidet es ab? Lohnt der Wechsel?

01 Was ist Kimi K3? Spezifikationen, stille Veröffentlichung und Relevanz

Typische Fehlannahmen vor der Modellauswahl:

  • Parameterzahl allein irreführt: MoE-Modelle aktivieren pro Token nur einen Bruchteil der Experten — aktive Experten und Kontext-Effizienz prüfen.
  • Benchmark-Harnesses unterscheiden sich: Moonshot nutzt Kimi Code; GPT Codex; Claude Claude Code — Quervergleiche nur als Richtwert.
  • 1M Kontext ohne Architektur ist Marketing: KV-Cache-Kosten explodieren ohne Mechanismen wie KDA.
  • Warten auf Gewichte verzögert Produktion: Die API ist live; Self-Hosting kann bis 27. Juli warten.

Kimi K3 ist ein 2,8T-Parameter-MoE-Modell von Moonshot AI (Peking) — erstes Open-Modell in der 3T-Klasse, ~75 % über DeepSeek V4 Pro (1,6T). Pro Forward Pass werden 16 von 896 Experten aktiviert, echtes 1.048.576-Token-Kontextfenster, Eingabe: Text, Bild, Video. Model-ID: kimi-k3. Reasoning startet mit maximalem Aufwand.

Kimi K3 auf einen Blick
Spezifikation Detail
Gesamtparameter 2,8 Billionen
Architektur Kimi Delta Attention + Attention Residuals + Stable LatentMoE
Aktive Experten 16 / 896 (1,8 % Sparsity)
Kontextfenster 1M Tokens
API-Preise $3 Input / $15 Output pro 1M Tokens
Open Weights 27. Juli 2026 auf Hugging Face

In der Nacht zum 16. Juli schaltete Moonshot die API frei — Banner in der Doku, keine Pressekonferenz. Der stille Launch steht im Kontrast zur Größenordnung: das größte jemals veröffentlichte Open-Source-KI-Modell.

Warum die Veröffentlichung zählt: DeepSeek erodierte Moonshots Position über 18 Monate. K3 ist das Comeback — Kimi-Modelle hielten 9 der letzten 12 Monate den Open-Source-Größenrekord; ARR über $300M (Juni 2026); 6. Finanzierungsrunde bei $31,5B Pre-Money; API-Umsatz 70 %+ des Gesamtumsatzes, ausländische zahlende Nutzer +400 %. Timing: Vorabend der WAIC 2026 in Shanghai. Schnell wachsendes Geschäft mit technischer Aussage, kein reines Scale-Marketing.

02 Kimi K3 Architektur: KDA, AttnRes und Stable LatentMoE

Die meisten „größtes Modell“-Launches erhöhen nur Compute. K3 bringt drei Engineering-Fixes für Long Context und extreme MoE-Sparsity.

Kimi Delta Attention (KDA) wechselt günstige Linear-Attention-Layer mit Full-Attention-Layern im Verhältnis 3:1. Ergebnis: bis zu 75 % weniger KV-Cache-Speicher und bis zu 6,3× schnelleres Decoding bei 1M-Token-Kontext — auf Kurz-, Lang- und RL-Tasks gleichwertig oder besser als Full-Attention-Baselines, ohne Capability-Tradeoff. Deshalb ist das 1M-Fenster flat bepreist, nicht theoretisch.

Attention Residuals (AttnRes) ersetzen uniforme Tiefenakkumulation durch selektives Retrieval über Layer — ca. 25 % höhere Trainingseffizienz bei unter 2 % Extra-Compute.

Stable LatentMoE macht 1,8 % Sparsity (16/896 Experten) trainierbar via Quantile Balancing, Per-Head Muon, SiTU-Aktivierung und Gated MLA — ~2,5× bessere Scaling-Effizienz vs Kimi K2. Training mit MXFP4-Gewichten und MXFP8-Aktivierungen für quantization-aware Deployment.

03 Kimi K3 Benchmarks und API-Preise

Scores von Moonshot unten. Unabhängige Reproduktion läuft — als Richtwert behandeln.

Coding-Benchmarks
Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
DeepSWE 67,5 70,0 73,0 59,0
Program Bench 77,8 76,8 77,6 71,9
Terminal Bench 2.1 88,3 84,6 88,8 84,6
FrontierSWE 81,2 86,6 71,3 66,7
SWE Marathon 42,0 35,0 39,0 40,0
BrowseComp 91,2 88,0 90,4 84,3
OmniDocBench 91,1 89,8 85,8 87,9
HLE-Full 43,5 53,3 44,5

SWE Marathon — anhaltendes Long-Horizon-Coding — ist das Highlight: K3 führt mit 42,0, 7 Punkte Vorsprung vor Claude Fable 5. OmniDocBench-Führung passt zu native Vision plus 1M Kontext. Artificial Analysis Intelligence Index v4.1: K3 57,1 (Rang 4), nur 2,8 Punkte hinter #1 Fable 5 (59,9), deutlich vor den meisten Open Weights.

API-Preise ($/1M Tokens)
Modell Input Output Cache-Hit Input Kontext
Kimi K3 $3,00 $15,00 $0,30 1M
Claude Sonnet 5 $3,00 $15,00 200K
Claude Opus 4.8 $5,00 $25,00 200K
GPT-5.5 $5,00 $30,00 400K
DeepSeek V4 Pro $1,74 $3,48 $0,145 128K

K3 entspricht Claude Sonnet 5 Standardpreisen, bietet aber 5× Kontext. Mooncake Split-Inference liefert 90 %+ Cache-Hit-Raten in Kimi-Code-Workflows — effektive durchschnittliche Input-Kosten ca. $0,55/M (OpenRouter 7-Tage-gewichteter Durchschnitt). vs Opus 4.8: stärker in mehreren Benchmarks bei ~60 % Input- und ~40 % Output-Kosten.

04 Kimi K3 jetzt nutzen: vier Wege und sechs Produktionsschritte

  • Chat kostenlos: kimi.com — Google-Login, max Reasoning, keine Kreditkarte.
  • Offizielle API: OpenAI-kompatibel unter https://api.moonshot.ai/v1, Key von platform.kimi.ai.
  • OpenRouter: moonshotai/kimi-k3 — offizielle Preise, kein Aufschlag, volles 1M-Kontextfenster.
  • Self-Host ab 27. Juli: Vollständige Gewichte auf Hugging Face; Produktion braucht 64+ Accelerators, kein Laptop.
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Analysiere diese Codebase auf Engpässe..."}]
)
print(response.choices[0].message.content)

Primärquellen — Links vor Zitaten erneut prüfen:

https://kimi.com/blog/kimi-k3

https://platform.kimi.ai

Sechs Schritte zum Produktions-Rollout:

  1. API-Zugangsdaten anlegen: Registrierung auf platform.kimi.ai, Billing aktivieren, API-Key generieren.
  2. Route wählen: Direkte Moonshot-API oder OpenRouter moonshotai/kimi-k3 im bestehenden OpenAI-SDK-Stack.
  3. Prompt-Caching aktivieren: Cache-Keys für Repository-Skala und Agent-Loops konfigurieren — 90 %+ Hit-Raten anstreben.
  4. 1M-Kontext planen: Whole-Codebase-Analyse, Legal-/Research-Dokumente, Multi-Session-Agent-Memory — Flat-Pricing macht Vollfenster-Nutzung praktikabel.
  5. Hybrid-Routing: Lange Coding- und Dokumenten-Tasks auf K3; schwierigste Bugfixes in großen Repos Fallback auf Fable 5; terminal-lastige Agents behalten GPT-5.6 Sol.
  6. Kalender 27. Juli: Hugging-Face-MXFP4/NVFP4-Quant-Builds und vLLM/SGLang Day-0-Support verfolgen, falls Self-Hosting nötig.

05 Kimi K3 vs Wettbewerb, Open Weights, FAQ und DSGVO

Welches Modell für welchen Job
Use Case Empfehlung Begründung
Lange anhaltende Coding-Sessions Kimi K3 Führt SWE Marathon; 1M Kontext vermeidet Mid-Task-Verlust
Komplexe Bugfixes in großen Repos Claude Fable 5 FrontierSWE-Vorsprung signifikant
Terminal-/Tool-lastige Agent-Workflows GPT-5.6 Sol Terminal Bench und Agent-Index-Führung
Multimodale Dokumentenanalyse Kimi K3 Bester OmniDocBench; Vision + 1M Kontext
Kostensensitive Produktion DeepSeek V4 Pro Output $3,48/M, deutlich günstiger
Open-Source Self-Hosting (ab 27.07.) Kimi K3 Größte verfügbare Open Weights
Tiefstes Reasoning-Forschung Claude Fable 5 HLE-Full-Führung (53,3 vs 43,5)

Open-Weight-Release 27. Juli: K3 wird das größte herunterladbare Open-Modell, erstes über 2T Parameter, neue Fine-Tuning-Basis — MXFP4-Training ermöglicht effiziente Inferenz auf moderner Hardware. Day-0-Support in transformers, vLLM und SGLang erwartet.

Zitierbare Kennzahlen (EEAT):

  • Scale: 2,8T Gesamtparameter, 16/896 aktive Experten — ~75 % über DeepSeek V4 Pro (Moonshot Blog, 16.07.2026).
  • KDA-Effizienz: 75 % KV-Cache-Reduktion, bis 6,3× Decode-Speedup bei 1M Tokens (Moonshot Technical Docs).
  • Intelligence Index: 57,1 auf Artificial Analysis v4.1 — Top-Tier unter Open Modellen (Artificial Analysis, Juli 2026).

FAQ:

  • F1: Ist Kimi K3 kostenlos? A: Ja auf kimi.com mit Gratis-Konto; API pay-per-token ($3/$15 pro 1M).
  • F2: Lokal lauffähig? A: Erst ab Gewichten am 27. Juli; dann 64+ H100-Klasse-GPUs für Produktions-Inferenz.
  • F3: Kimi K3 vs DeepSeek V4 Pro? A: K3 hat fast 2× Parameter, 1M vs 128K Kontext, stärkere Coding-Scores — DeepSeek deutlich günstiger Output ($3,48/M).
  • F4: Ist 1M Kontext nutzbar? A: Ja für Whole-Codebase-Calls, End-to-End-Legal-/Research-Docs und Long-Memory-Agents — Flat-Pricing macht es praktikabel.
  • F5: Wann kommen Low/High-Reasoning-Modi? A: Moonshot kündigt Folge-Updates an; aktuell nur Max verfügbar.

DSGVO und China/US-Cloud-API: Die Moonshot-API (api.moonshot.ai) verarbeitet Prompts, Code-Snippets und Agent-Logs in chinesischen Rechenzentren; OpenRouter und US-Gateways können zusätzlich US-Infrastruktur einbinden. Für EU-Teams mit personenbezogenen Daten in Prompts ist das eine Drittlandübermittlung nach Art. 44 ff. DSGVO — Auftragsverarbeitung, Standardvertragsklauseln und Datenminimierung prüfen. Self-Hosting ab 27. Juli reduziert Cloud-Exposition, wenn Inferenz in der EU bleibt.

Fazit: Kimi K3 ist das bisher leistungsfähigste veröffentlichte Open-Source-KI-Modell. Es gewinnt nicht jeden Benchmark — Fable 5 und GPT-5.6 Sol führen in Einzeltasks — aber es ist breit wettbewerbsfähig, führt Long-Horizon-Coding und Dokumentenverständnis und liefert 1M Kontext zu Sonnet-Preisen. Die Gewichte am 27. Juli sind der Termin zum Merken.

Termine: Jetzt → kimi.com testen · 17.–20. Juli → WAIC Shanghai · 27. Juli → Hugging-Face-Gewichte.

Kimi-K3-Agents auf einem schlafenden Laptop brechen lange SWE-Marathon-Loops; parallele Repos konkurrieren um RAM und Bandbreite. Für Cursor Agent, Kimi Code oder OpenClaw Gateway 24/7 ist CALMVPS Bare-Metal Mac Mini Miete meist die stabilere Wahl: dediziertes Apple Silicon, Metal-native Beschleunigung, ~120 s Provisioning — schwere Agent-Runs in die Cloud, lokal nur Plan-Review. Preisseite.