Kurzfassung: Am 16. Juli 2026 veröffentlichte Moonshot AI Kimi K3 — mit 2,8 Billionen Parametern das größte Open-Source-Modell weltweit, 1M Token Kontext, native Vision und API-Preise $3/$15 pro Million Tokens. Vollständige Gewichte ab 27. Juli.
Dieser datengetriebene Report richtet sich an Teams, die API-Wechsel, Open-Weight-Timelines und Long-Horizon-Coding-Agents evaluieren. Enthalten: Spezifikationstabelle, drei Architektur-Innovationen (KDA, AttnRes, Stable LatentMoE), Benchmark-Tabellen vs Claude Fable 5 und GPT-5.6 Sol, Preisrechnung, sechs Integrationsschritte und Szenario-Matrix — damit Sie beantworten: Läuft es heute? Wie schneidet es ab? Lohnt der Wechsel?
01 Was ist Kimi K3? Spezifikationen, stille Veröffentlichung und Relevanz
Typische Fehlannahmen vor der Modellauswahl:
- Parameterzahl allein irreführt: MoE-Modelle aktivieren pro Token nur einen Bruchteil der Experten — aktive Experten und Kontext-Effizienz prüfen.
- Benchmark-Harnesses unterscheiden sich: Moonshot nutzt Kimi Code; GPT Codex; Claude Claude Code — Quervergleiche nur als Richtwert.
- 1M Kontext ohne Architektur ist Marketing: KV-Cache-Kosten explodieren ohne Mechanismen wie KDA.
- Warten auf Gewichte verzögert Produktion: Die API ist live; Self-Hosting kann bis 27. Juli warten.
Kimi K3 ist ein 2,8T-Parameter-MoE-Modell von Moonshot AI (Peking) — erstes Open-Modell in der 3T-Klasse, ~75 % über DeepSeek V4 Pro (1,6T). Pro Forward Pass werden 16 von 896 Experten aktiviert, echtes 1.048.576-Token-Kontextfenster, Eingabe: Text, Bild, Video. Model-ID: kimi-k3. Reasoning startet mit maximalem Aufwand.
| Spezifikation | Detail |
|---|---|
| Gesamtparameter | 2,8 Billionen |
| Architektur | Kimi Delta Attention + Attention Residuals + Stable LatentMoE |
| Aktive Experten | 16 / 896 (1,8 % Sparsity) |
| Kontextfenster | 1M Tokens |
| API-Preise | $3 Input / $15 Output pro 1M Tokens |
| Open Weights | 27. Juli 2026 auf Hugging Face |
In der Nacht zum 16. Juli schaltete Moonshot die API frei — Banner in der Doku, keine Pressekonferenz. Der stille Launch steht im Kontrast zur Größenordnung: das größte jemals veröffentlichte Open-Source-KI-Modell.
Warum die Veröffentlichung zählt: DeepSeek erodierte Moonshots Position über 18 Monate. K3 ist das Comeback — Kimi-Modelle hielten 9 der letzten 12 Monate den Open-Source-Größenrekord; ARR über $300M (Juni 2026); 6. Finanzierungsrunde bei $31,5B Pre-Money; API-Umsatz 70 %+ des Gesamtumsatzes, ausländische zahlende Nutzer +400 %. Timing: Vorabend der WAIC 2026 in Shanghai. Schnell wachsendes Geschäft mit technischer Aussage, kein reines Scale-Marketing.
02 Kimi K3 Architektur: KDA, AttnRes und Stable LatentMoE
Die meisten „größtes Modell“-Launches erhöhen nur Compute. K3 bringt drei Engineering-Fixes für Long Context und extreme MoE-Sparsity.
Kimi Delta Attention (KDA) wechselt günstige Linear-Attention-Layer mit Full-Attention-Layern im Verhältnis 3:1. Ergebnis: bis zu 75 % weniger KV-Cache-Speicher und bis zu 6,3× schnelleres Decoding bei 1M-Token-Kontext — auf Kurz-, Lang- und RL-Tasks gleichwertig oder besser als Full-Attention-Baselines, ohne Capability-Tradeoff. Deshalb ist das 1M-Fenster flat bepreist, nicht theoretisch.
Attention Residuals (AttnRes) ersetzen uniforme Tiefenakkumulation durch selektives Retrieval über Layer — ca. 25 % höhere Trainingseffizienz bei unter 2 % Extra-Compute.
Stable LatentMoE macht 1,8 % Sparsity (16/896 Experten) trainierbar via Quantile Balancing, Per-Head Muon, SiTU-Aktivierung und Gated MLA — ~2,5× bessere Scaling-Effizienz vs Kimi K2. Training mit MXFP4-Gewichten und MXFP8-Aktivierungen für quantization-aware Deployment.
03 Kimi K3 Benchmarks und API-Preise
Scores von Moonshot unten. Unabhängige Reproduktion läuft — als Richtwert behandeln.
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| DeepSWE | 67,5 | 70,0 | 73,0 | 59,0 |
| Program Bench | 77,8 | 76,8 | 77,6 | 71,9 |
| Terminal Bench 2.1 | 88,3 | 84,6 | 88,8 | 84,6 |
| FrontierSWE | 81,2 | 86,6 | 71,3 | 66,7 |
| SWE Marathon | 42,0 | 35,0 | 39,0 | 40,0 |
| BrowseComp | 91,2 | 88,0 | 90,4 | 84,3 |
| OmniDocBench | 91,1 | 89,8 | 85,8 | 87,9 |
| HLE-Full | 43,5 | 53,3 | 44,5 | — |
SWE Marathon — anhaltendes Long-Horizon-Coding — ist das Highlight: K3 führt mit 42,0, 7 Punkte Vorsprung vor Claude Fable 5. OmniDocBench-Führung passt zu native Vision plus 1M Kontext. Artificial Analysis Intelligence Index v4.1: K3 57,1 (Rang 4), nur 2,8 Punkte hinter #1 Fable 5 (59,9), deutlich vor den meisten Open Weights.
| Modell | Input | Output | Cache-Hit Input | Kontext |
|---|---|---|---|---|
| Kimi K3 | $3,00 | $15,00 | $0,30 | 1M |
| Claude Sonnet 5 | $3,00 | $15,00 | — | 200K |
| Claude Opus 4.8 | $5,00 | $25,00 | — | 200K |
| GPT-5.5 | $5,00 | $30,00 | — | 400K |
| DeepSeek V4 Pro | $1,74 | $3,48 | $0,145 | 128K |
K3 entspricht Claude Sonnet 5 Standardpreisen, bietet aber 5× Kontext. Mooncake Split-Inference liefert 90 %+ Cache-Hit-Raten in Kimi-Code-Workflows — effektive durchschnittliche Input-Kosten ca. $0,55/M (OpenRouter 7-Tage-gewichteter Durchschnitt). vs Opus 4.8: stärker in mehreren Benchmarks bei ~60 % Input- und ~40 % Output-Kosten.
04 Kimi K3 jetzt nutzen: vier Wege und sechs Produktionsschritte
- Chat kostenlos: kimi.com — Google-Login, max Reasoning, keine Kreditkarte.
- Offizielle API: OpenAI-kompatibel unter
https://api.moonshot.ai/v1, Key von platform.kimi.ai. - OpenRouter:
moonshotai/kimi-k3— offizielle Preise, kein Aufschlag, volles 1M-Kontextfenster. - Self-Host ab 27. Juli: Vollständige Gewichte auf Hugging Face; Produktion braucht 64+ Accelerators, kein Laptop.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Analysiere diese Codebase auf Engpässe..."}]
)
print(response.choices[0].message.content)
Primärquellen — Links vor Zitaten erneut prüfen:
Sechs Schritte zum Produktions-Rollout:
- API-Zugangsdaten anlegen: Registrierung auf platform.kimi.ai, Billing aktivieren, API-Key generieren.
- Route wählen: Direkte Moonshot-API oder OpenRouter
moonshotai/kimi-k3im bestehenden OpenAI-SDK-Stack. - Prompt-Caching aktivieren: Cache-Keys für Repository-Skala und Agent-Loops konfigurieren — 90 %+ Hit-Raten anstreben.
- 1M-Kontext planen: Whole-Codebase-Analyse, Legal-/Research-Dokumente, Multi-Session-Agent-Memory — Flat-Pricing macht Vollfenster-Nutzung praktikabel.
- Hybrid-Routing: Lange Coding- und Dokumenten-Tasks auf K3; schwierigste Bugfixes in großen Repos Fallback auf Fable 5; terminal-lastige Agents behalten GPT-5.6 Sol.
- Kalender 27. Juli: Hugging-Face-MXFP4/NVFP4-Quant-Builds und vLLM/SGLang Day-0-Support verfolgen, falls Self-Hosting nötig.
05 Kimi K3 vs Wettbewerb, Open Weights, FAQ und DSGVO
| Use Case | Empfehlung | Begründung |
|---|---|---|
| Lange anhaltende Coding-Sessions | Kimi K3 | Führt SWE Marathon; 1M Kontext vermeidet Mid-Task-Verlust |
| Komplexe Bugfixes in großen Repos | Claude Fable 5 | FrontierSWE-Vorsprung signifikant |
| Terminal-/Tool-lastige Agent-Workflows | GPT-5.6 Sol | Terminal Bench und Agent-Index-Führung |
| Multimodale Dokumentenanalyse | Kimi K3 | Bester OmniDocBench; Vision + 1M Kontext |
| Kostensensitive Produktion | DeepSeek V4 Pro | Output $3,48/M, deutlich günstiger |
| Open-Source Self-Hosting (ab 27.07.) | Kimi K3 | Größte verfügbare Open Weights |
| Tiefstes Reasoning-Forschung | Claude Fable 5 | HLE-Full-Führung (53,3 vs 43,5) |
Open-Weight-Release 27. Juli: K3 wird das größte herunterladbare Open-Modell, erstes über 2T Parameter, neue Fine-Tuning-Basis — MXFP4-Training ermöglicht effiziente Inferenz auf moderner Hardware. Day-0-Support in transformers, vLLM und SGLang erwartet.
Zitierbare Kennzahlen (EEAT):
- Scale: 2,8T Gesamtparameter, 16/896 aktive Experten — ~75 % über DeepSeek V4 Pro (Moonshot Blog, 16.07.2026).
- KDA-Effizienz: 75 % KV-Cache-Reduktion, bis 6,3× Decode-Speedup bei 1M Tokens (Moonshot Technical Docs).
- Intelligence Index: 57,1 auf Artificial Analysis v4.1 — Top-Tier unter Open Modellen (Artificial Analysis, Juli 2026).
FAQ:
- F1: Ist Kimi K3 kostenlos? A: Ja auf kimi.com mit Gratis-Konto; API pay-per-token ($3/$15 pro 1M).
- F2: Lokal lauffähig? A: Erst ab Gewichten am 27. Juli; dann 64+ H100-Klasse-GPUs für Produktions-Inferenz.
- F3: Kimi K3 vs DeepSeek V4 Pro? A: K3 hat fast 2× Parameter, 1M vs 128K Kontext, stärkere Coding-Scores — DeepSeek deutlich günstiger Output ($3,48/M).
- F4: Ist 1M Kontext nutzbar? A: Ja für Whole-Codebase-Calls, End-to-End-Legal-/Research-Docs und Long-Memory-Agents — Flat-Pricing macht es praktikabel.
- F5: Wann kommen Low/High-Reasoning-Modi? A: Moonshot kündigt Folge-Updates an; aktuell nur Max verfügbar.
DSGVO und China/US-Cloud-API: Die Moonshot-API (api.moonshot.ai) verarbeitet Prompts, Code-Snippets und Agent-Logs in chinesischen Rechenzentren; OpenRouter und US-Gateways können zusätzlich US-Infrastruktur einbinden. Für EU-Teams mit personenbezogenen Daten in Prompts ist das eine Drittlandübermittlung nach Art. 44 ff. DSGVO — Auftragsverarbeitung, Standardvertragsklauseln und Datenminimierung prüfen. Self-Hosting ab 27. Juli reduziert Cloud-Exposition, wenn Inferenz in der EU bleibt.
Fazit: Kimi K3 ist das bisher leistungsfähigste veröffentlichte Open-Source-KI-Modell. Es gewinnt nicht jeden Benchmark — Fable 5 und GPT-5.6 Sol führen in Einzeltasks — aber es ist breit wettbewerbsfähig, führt Long-Horizon-Coding und Dokumentenverständnis und liefert 1M Kontext zu Sonnet-Preisen. Die Gewichte am 27. Juli sind der Termin zum Merken.
Termine: Jetzt → kimi.com testen · 17.–20. Juli → WAIC Shanghai · 27. Juli → Hugging-Face-Gewichte.
Kimi-K3-Agents auf einem schlafenden Laptop brechen lange SWE-Marathon-Loops; parallele Repos konkurrieren um RAM und Bandbreite. Für Cursor Agent, Kimi Code oder OpenClaw Gateway 24/7 ist CALMVPS Bare-Metal Mac Mini Miete meist die stabilere Wahl: dediziertes Apple Silicon, Metal-native Beschleunigung, ~120 s Provisioning — schwere Agent-Runs in die Cloud, lokal nur Plan-Review. Preisseite.