27 июля 2026 около 23:00 Moonshot AI опубликовал полные веса Kimi K3 (~1,56 TB), technical report, а также MoonEP, FlashKDA и AgentEnv — первую полностью открытую модель класса 3T с контекстом 1 млн tokens.
Материал для инженеров, оценивающих лицензию open weight, стоимость self-hosting и выбор API. Внутри: таймлайн 11 дней, таблица спецификаций, разбор архитектуры (KDA, AttnRes, MoE routing), независимые бенчмарки Vals AI, два коммерческих порога лицензии, цены API и шесть шагов production rollout — чтобы ответить: open source или open weight? Стоит ли self-hosting? Где ловушки compliance?
01 Kimi K3 от API до open weights: таймлайн 11 дней и типичные ошибки оценки
Типичные ошибки перед скачиванием весов:
- Путать «open source» и «open weight»: Moonshot официально использует только «open weight», никогда «open source» — legal-команды по OSI-критериям недооценивают compliance-риски.
- Игнорировать пороги лицензии: Custom License вводит MaaS-порог $20M за 12 месяцев и обязательство отображения при 100M MAU — отличается от Modified MIT у K2.
- Считать параметры, не activation cost: 2,8T total, но 16 из 896 experts на token — self-hosting требует supernode 64+ GPU, consumer-железо не тянет inference pipeline.
- Смешивать геополитику и engineering: US-обвинения (22–23 июля) и китайский ответ (28 июля) на фоне WAIC 2026 — оценивать политику и архитектуру раздельно.
От API-релиза до полной публикации весов прошло 11 дней:
- 16 июля (канун WAIC): K3 на kimi.com, Kimi Work, Kimi Code и API — веса закрыты. Заголовок блога: «Kimi K3: Open Frontier Intelligence».
- 17 июля: Отраслевые разборы архитектуры; Xinhua — «крупнейшая опубликованная модель».
- 22–23 июля: Эскалация спора о дистилляции — Michael Kratsios обвиняет Moonshot; Scott Bessent рассматривает санкции.
- 27 июля (~23:00): Полные веса, technical report, MoonEP и AgentEnv (FlashKDA уже был open source).
- 28 июля: Ответ китайского Минторга; Alibaba анонсирует Qwen3.8-Max-Preview (24T) — конкуренция в «3T club».
| Параметр | Значение |
|---|---|
| Total parameters | 2,8 триллиона (2,8T) |
| Active parameters | ~104 млрд |
| Архитектура | Mixture-of-Experts (MoE) |
| Expert config | 896 routing experts, 16 active/token (+ shared experts) |
| Attention | Kimi Delta Attention (KDA) + Gated MLA |
| Context window | 1 048 576 tokens (1M) |
| Multimodal | Native vision (ViT-V2, 27 layers) |
| Weight format | MXFP4 weights + MXFP8 activation |
| Download size | ~1,56 TB (Hugging Face) |
| License | Custom License (open weight, не open source) |
02 Архитектура Kimi K3: KDA, AttnRes и три open-source infra-компонента
K3 перерабатывает три классических блока deep learning — attention mechanism, residual connections, optimizer — вместо простого масштабирования параметров.
Kimi Delta Attention (KDA): Per-channel decay rate вместо scalar forget gate; chunkwise DPLR-формула для linear-time recurrence. KDA чередуется с Gated MLA layers и держит KV cache низким при 1M context — критично для prefill/decode scheduling на длинных agent loops.
Attention Residuals (AttnRes): Selective input-dependent aggregation всех предыдущих layer outputs — ~25 % training efficiency, overhead <2 %. Один RMSNorm и pseudo-query vector на layer.
Per-Head Muon: Независимая оптимизация каждого attention head — чисто training-time техника, API не видит, но определяет performance per active parameter.
Stable LatentMoE: Sparsity 896→16 (~1,8 %), Quantile Balancing + MoonEP — доказанная верхняя граница redundant experts per compute node.
| Компонент | Роль | Ключевая capability |
|---|---|---|
| MoonEP | MoE communication library | Временная репликация overloaded experts; равномерное распределение tokens per node при load imbalance |
| FlashKDA | KDA operator на NVIDIA CUTLASS | Prefill на H20 быстрее flash-linear-attention baseline в 1,72–2,22×; drop-in backend через chunk_kda |
| AgentEnv | Agent sandbox с KVCache.ai (Firecracker microVM) | Parallel Agent RL training; checkpoint latency 133 ms, recovery 49 ms, memory oversubscription до 6,5× (vendor claim, independent repro pending) |
Moonshot отдаёт не только weight tensors, но и infra stack, который делал K3 trainable — редкий уровень engineering transparency в 3T-классе для команд, строящих custom inference pipeline.
03 Бенчмарки Kimi K3: SWE-bench, API pricing и два коммерческих порога лицензии
Приоритет — независимые third-party measurements; vendor numbers помечены отдельно.
| Модель | Score | Release |
|---|---|---|
| Claude Opus 5 | 97 % | 2026-07-24 |
| GPT-5.6 Sol | 96,2 % | 2026-07-09 |
| Claude Fable 5 | 95 % | 2026-06-09 |
| Kimi K3 | 93,4 % | 2026-07-16 |
| Qwen3.7-Max | 79,4 % | 2026-05-19 |
| DeepSeek-V4 | 76,2 % | 2026-04-23 |
Artificial Analysis Intelligence Index (max tier): K3 ~57 — global #3, #1 среди open weights. Cost ~$0,95/task vs Fable 5 ~$2,4 — но дороже GLM-5.2 (~$0,47). Capability ceiling open-weight camp, не price-performance winner. Arena.ai Frontend Code Arena: K3 #1.
Open weight ≠ open source: OSI требует training data, code и reproducible pipeline — K3 публикует weights, report и inference infra. Custom License с двумя порогами:
- MaaS revenue threshold: Model-as-a-Service с >$20M revenue за 12 месяцев — отдельное соглашение с Moonshot.
- Scale display obligation: >100M MAU или >$20M monthly revenue — prominent display «Kimi K3» обязателен.
| Token type | Price |
|---|---|
| Input (cache hit) | $0,30 |
| Input (cache miss) | $3,00 |
| Output (incl. reasoning) | $15,00 |
Mooncake disaggregated inference architecture даёт >90 % cache hit rate на coding workloads — effective input cost ближе к $0,30/M. Self-hosting: рекомендован supernode 64+ GPU; для большинства команд API или OpenRouter (7 providers live).
04 Kimi K3 API integration и шесть шагов production rollout
Moonshot предоставляет OpenAI-compatible Chat Completions — model ID kimi-k3, base URL https://api.moonshot.ai/v1.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Проанализируй этот код..."}]
)
Official sources — перепроверить перед цитированием:
https://huggingface.co/moonshotai
Шесть шагов production rollout:
- License boundaries: Проверить, realistic ли MaaS revenue >$20M или MAU >100M — legal early engagement.
- Route selection: Direct Moonshot API или OpenRouter
moonshotai/kimi-k3в существующем OpenAI SDK stack. - Prompt caching: Cache keys для repo-scale context и agent loops — target 90 %+ hit rate, effective ~$0,30/M input.
- Self-hosting vs API: 1,56 TB weights + 64+ GPU — без cluster API или third-party hosting.
- Hybrid model routing: Long coding sessions на K3; hardest repo bugfixes fallback Claude Fable 5; terminal-heavy agents на GPT-5.6 Sol.
- Infra repos evaluation: MoonEP, FlashKDA, AgentEnv для MoE training или Agent RL — GitHub state после release перепроверить.
05 Верифицируемые метрики, FAQ и production conclusion
Верифицируемые метрики (EEAT):
- Scale: 2,8T total parameters, 16/896 active experts — первый полностью открытый 3T-model (Moonshot blog, 27.07.2026).
- SWE-bench Verified: 93,4 % independent measurement — лидер open-weight camp (Vals AI, июль 2026).
- FlashKDA: Prefill на H20 1,72–2,22× faster vs baseline (Moonshot GitHub — verify post-release).
FAQ:
- Q: Kimi K3 — open source? A: Нет — open weight: weights и infra public, training data и full training code отсутствуют (OSI definition не выполнена).
- Q: Commercial use? A: Для большинства сценариев да; MaaS >$20M/12 months или MAU >100M trigger specific clauses.
- Q: Сколько GPU для self-hosting? A: Official recommendation — supernode 64+ GPU; API или OpenRouter realistic для большинства.
- Q: Performance vs cost? A: Strongest open-weight model, но дороже GLM-5.2 — capability ceiling, не budget winner.
- Q: Отличие от K2? A: ~3× parameters, AttnRes и Per-Head Muon new, 1M context, tightened MaaS license clauses.
Вывод: Kimi K3 open weights — milestone «3T club» для китайских labs. Engineering (KDA, MoonEP) и geopolitics пересекаются, но для production: прочитать license, затем выбрать API или hosting — не качать слепо 1,56 TB.
Ноутбук как 7×24 agent host ломается на sleep, memory pressure и shared file locks; 64-GPU cluster для solo developer нереалистичен. Для Kimi Code, Cursor Agent или OpenClaw Gateway без downtime аренда Mac Mini bare metal CALMVPS — рабочее решение: dedicated Apple Silicon, native Metal acceleration, provisioning 120 секунд — heavy agent loops в cloud, local review only. Цены.