TL;DR: 16 июля 2026 Moonshot AI выпустил Kimi K3 — крупнейшую open-source модель с 2,8 триллиона параметров, контекстом 1M tokens, native vision и API $3/$15 за 1M tokens. Полные weights — 27 июля.
Материал для разработчиков, которые оценивают switch API, timeline open weights и long-horizon coding agents. Внутри: spec sheet, три архитектурных фикса (KDA, AttnRes, Stable LatentMoE), полные таблицы vs Claude Fable 5 и GPT-5.6 Sol, pricing math, шесть шагов rollout и scenario matrix — чтобы ответить: можно ли гонять сегодня, как сравнивается, стоит ли переключаться.
01 Kimi K3: спеки, тихий релиз и зачем это важно
Типичные ошибки перед выбором модели:
- Считать только параметры: у MoE на token активируется крошечная доля experts — смотрите active experts и context efficiency.
- Сравнивать разные harness: Moonshot — Kimi Code; GPT — Codex; Claude — Claude Code; cross-vendor scores только directional.
- 1M context без архитектуры — маркетинг: KV cache cost взлетает без KDA и подобных механизмов.
- Ждать weights — задержка прода: API уже live; self-host можно отложить до 27 июля.
Kimi K3 — MoE 2,8T от Moonshot AI (Пекин), первый open model класса 3T, ~на 75 % больше DeepSeek V4 Pro (1,6T). На forward pass активируются 16 из 896 experts, реальный контекст 1 048 576 tokens, input: text, image, video. Model ID: kimi-k3. Reasoning на старте — max effort.
| Параметр | Значение |
|---|---|
| Всего параметров | 2,8 триллиона |
| Архитектура | Kimi Delta Attention + Attention Residuals + Stable LatentMoE |
| Active experts | 16 / 896 (sparsity 1,8 %) |
| Контекст | 1M tokens |
| API pricing | $3 input / $15 output за 1M tokens |
| Open weights | 27 июля 2026 на Hugging Face |
Ночью 16 июля Moonshot просто включил API — баннер в docs, без пресс-конференции. Тихий launch на фоне масштаба: крупнейшая open-source AI-модель в истории.
Почему релиз значим: за 18 месяцев DeepSeek съел позицию Moonshot. K3 — comeback: Kimi держал size record среди open models 9 из 12 последних месяцев; ARR > $300M к июню 2026; 6-й раунд при $31,5B pre-money; API revenue 70 %+ total, overseas paid users +400 %. Тайминг — канун WAIC 2026 в Шанхае. Быстрорастущий бизнес с техническим statement, не vanity scale.
02 Архитектура Kimi K3: KDA, AttnRes и Stable LatentMoE
Большинство «самая большая модель»-релизов просто накидывают compute. K3 приносит три engineering fix для long context и extreme MoE sparsity.
Kimi Delta Attention (KDA) чередует дешёвые linear-attention layers и full-attention в ratio 3:1. Итог: до −75 % KV cache memory и до 6,3× faster decoding на 1M-token context — parity или лучше full-attention baseline на short, long и RL tasks без capability tradeoff. Поэтому 1M window flat-priced, не теоретический.
Attention Residuals (AttnRes) заменяют uniform depth accumulation на selective retrieval между слоями — ~+25 % training efficiency при <2 % extra compute.
Stable LatentMoE делает trainable sparsity 1,8 % (16/896 experts) через Quantile Balancing, Per-Head Muon, SiTU activation и Gated MLA — ~2,5× scaling efficiency vs Kimi K2. Training: MXFP4 weights + MXFP8 activations для quantization-aware deploy.
03 Benchmarks Kimi K3 и API pricing
Ниже scores от Moonshot. Независимая reproduction in progress — treat as directional.
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 |
| OmniDocBench | 91.1 | 89.8 | 85.8 | 87.9 |
| HLE-Full | 43.5 | 53.3 | 44.5 | — |
SWE Marathon — sustained long-horizon coding — headline: K3 лидирует 42.0, +7 п.п. над Claude Fable 5. Лидерство на OmniDocBench стыкуется с native vision + 1M context. Artificial Analysis Intelligence Index v4.1: K3 57.1 (4-е место), −2.8 п.п. от #1 Fable 5 (59.9), с большим отрывом от большинства open weights.
| Модель | Input | Output | Cache-hit input | Контекст |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Sonnet 5 | $3.00 | $15.00 | — | 200K |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 200K |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
K3 совпадает с Claude Sonnet 5 по базовому pricing, но даёт 5× context. Mooncake split-inference — 90 %+ cache hit в Kimi Code workflows; effective avg input ~$0.55/M (OpenRouter 7-day weighted avg). vs Opus 4.8: сильнее на ряде benchmarks при ~60 % input и ~40 % output cost.
04 Kimi K3 сейчас: четыре пути и шесть шагов в прод
- Chat free: kimi.com — Google sign-in, max reasoning, без карты.
- Official API: OpenAI-compatible
https://api.moonshot.ai/v1, key с platform.kimi.ai. - OpenRouter:
moonshotai/kimi-k3— official pricing, без markup, full 1M context. - Self-host 27 июля: full weights на Hugging Face; прод требует 64+ accelerators, не ноутбук.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Проанализируй репозиторий на bottlenecks..."}]
)
print(response.choices[0].message.content)
Primary sources — перепроверьте links после upstream updates:
Шесть шагов production rollout:
- API credentials: регистрация platform.kimi.ai, billing, generate API key.
- Выбор route: direct Moonshot API или OpenRouter
moonshotai/kimi-k3в существующем OpenAI SDK stack. - Prompt caching: cache keys для repo-scale и agent loops — target 90 %+ hit rate.
- План 1M context: whole-codebase analysis, legal/research docs, multi-session agent memory — flat pricing делает full window практичным.
- Hybrid routing: long coding и documents на K3; hardest bugfixes в крупных репозиториях — fallback Fable 5; terminal-heavy agents — GPT-5.6 Sol.
- Календарь 27 июля: следить за Hugging Face MXFP4/NVFP4 quant builds и vLLM/SGLang day-0 support при необходимости self-host.
05 Kimi K3 vs конкуренты, open weights и FAQ
| Сценарий | Лучший pick | Почему |
|---|---|---|
| Длинные sustained coding sessions | Kimi K3 | Лидирует SWE Marathon; 1M context без mid-task loss |
| Сложные bugfixes в крупных репозиториях | Claude Fable 5 | Значимый lead на FrontierSWE |
| Terminal/tool-heavy agent workflows | GPT-5.6 Sol | Terminal Bench и agent index leadership |
| Multimodal document analysis | Kimi K3 | Лучший OmniDocBench; vision + 1M |
| Cost-sensitive production | DeepSeek V4 Pro | Output $3.48/M — сильно дешевле |
| Open-source self-hosting (после 27.07.) | Kimi K3 | Крупнейшие доступные open weights |
| Deepest reasoning research | Claude Fable 5 | HLE-Full lead (53.3 vs 43.5) |
Open weights 27 июля: K3 станет крупнейшей downloadable open model, первой выше 2T parameters, новой fine-tuning foundation — MXFP4 training для efficient inference на modern hardware. Day-0 support в transformers, vLLM, SGLang expected.
Цитируемые метрики (EEAT):
- Scale: 2.8T total, 16/896 active experts — ~+75 % vs DeepSeek V4 Pro (Moonshot blog, 2026-07-16).
- KDA efficiency: −75 % KV cache, до 6.3× decode speedup на 1M tokens (Moonshot technical docs).
- Intelligence index: 57.1 на Artificial Analysis v4.1 — top tier среди open models (Artificial Analysis, July 2026).
FAQ:
- Kimi K3 бесплатен? Да на kimi.com с free account; API — pay-per-token ($3/$15 за 1M).
- Можно локально? Нет до weights 27 июля; затем 64+ H100-class GPU для production inference.
- Kimi K3 vs DeepSeek V4 Pro? K3 — почти 2× parameters, 1M vs 128K context, сильнее coding scores; DeepSeek дешевле output ($3.48/M).
- 1M context реально полезен? Да для whole-codebase calls, end-to-end legal/research docs, long-memory agents — flat pricing делает это usable.
- Когда low/high reasoning modes? Moonshot обещает updates; сейчас только max.
Bottom line: Kimi K3 — самая capable open-source AI model на сегодня. Не побеждает каждый benchmark — Fable 5 и GPT-5.6 Sol лидируют в отдельных tasks — но competitive across the board, wins long-horizon coding и document understanding, отдаёт 1M context по Sonnet-tier pricing. Weights 27 июля — главная дата.
Dates: Сейчас → kimi.com · 17–20 июля → WAIC Shanghai · 27 июля → Hugging Face weights.
Kimi K3 agents на sleeping laptop рвут long SWE Marathon loops; parallel репозитории бьются за RAM и bandwidth. Для Cursor Agent, Kimi Code или OpenClaw Gateway 24/7 аренда bare-metal Mac Mini CALMVPS обычно разумнее: dedicated Apple Silicon, Metal-native acceleration, provisioning ~120 с — тяжёлые agent loops в облако, review планов локально. Страница цен.