Kimi K3 open weights:
2,8T MoE, 1M контекст — полный релиз весов Moonshot

27 июля 2026 около 23:00 Moonshot AI опубликовал полные веса Kimi K3 (~1,56 TB), technical report, а также MoonEP, FlashKDA и AgentEnv — первую полностью открытую модель класса 3T с контекстом 1 млн tokens.

Материал для инженеров, оценивающих лицензию open weight, стоимость self-hosting и выбор API. Внутри: таймлайн 11 дней, таблица спецификаций, разбор архитектуры (KDA, AttnRes, MoE routing), независимые бенчмарки Vals AI, два коммерческих порога лицензии, цены API и шесть шагов production rollout — чтобы ответить: open source или open weight? Стоит ли self-hosting? Где ловушки compliance?

01 Kimi K3 от API до open weights: таймлайн 11 дней и типичные ошибки оценки

Типичные ошибки перед скачиванием весов:

  • Путать «open source» и «open weight»: Moonshot официально использует только «open weight», никогда «open source» — legal-команды по OSI-критериям недооценивают compliance-риски.
  • Игнорировать пороги лицензии: Custom License вводит MaaS-порог $20M за 12 месяцев и обязательство отображения при 100M MAU — отличается от Modified MIT у K2.
  • Считать параметры, не activation cost: 2,8T total, но 16 из 896 experts на token — self-hosting требует supernode 64+ GPU, consumer-железо не тянет inference pipeline.
  • Смешивать геополитику и engineering: US-обвинения (22–23 июля) и китайский ответ (28 июля) на фоне WAIC 2026 — оценивать политику и архитектуру раздельно.

От API-релиза до полной публикации весов прошло 11 дней:

  • 16 июля (канун WAIC): K3 на kimi.com, Kimi Work, Kimi Code и API — веса закрыты. Заголовок блога: «Kimi K3: Open Frontier Intelligence».
  • 17 июля: Отраслевые разборы архитектуры; Xinhua — «крупнейшая опубликованная модель».
  • 22–23 июля: Эскалация спора о дистилляции — Michael Kratsios обвиняет Moonshot; Scott Bessent рассматривает санкции.
  • 27 июля (~23:00): Полные веса, technical report, MoonEP и AgentEnv (FlashKDA уже был open source).
  • 28 июля: Ответ китайского Минторга; Alibaba анонсирует Qwen3.8-Max-Preview (24T) — конкуренция в «3T club».
Ключевые параметры Kimi K3 (27.07.2026)
Параметр Значение
Total parameters 2,8 триллиона (2,8T)
Active parameters ~104 млрд
Архитектура Mixture-of-Experts (MoE)
Expert config 896 routing experts, 16 active/token (+ shared experts)
Attention Kimi Delta Attention (KDA) + Gated MLA
Context window 1 048 576 tokens (1M)
Multimodal Native vision (ViT-V2, 27 layers)
Weight format MXFP4 weights + MXFP8 activation
Download size ~1,56 TB (Hugging Face)
License Custom License (open weight, не open source)

02 Архитектура Kimi K3: KDA, AttnRes и три open-source infra-компонента

K3 перерабатывает три классических блока deep learning — attention mechanism, residual connections, optimizer — вместо простого масштабирования параметров.

Kimi Delta Attention (KDA): Per-channel decay rate вместо scalar forget gate; chunkwise DPLR-формула для linear-time recurrence. KDA чередуется с Gated MLA layers и держит KV cache низким при 1M context — критично для prefill/decode scheduling на длинных agent loops.

Attention Residuals (AttnRes): Selective input-dependent aggregation всех предыдущих layer outputs — ~25 % training efficiency, overhead <2 %. Один RMSNorm и pseudo-query vector на layer.

Per-Head Muon: Независимая оптимизация каждого attention head — чисто training-time техника, API не видит, но определяет performance per active parameter.

Stable LatentMoE: Sparsity 896→16 (~1,8 %), Quantile Balancing + MoonEP — доказанная верхняя граница redundant experts per compute node.

Три open-source infra-компонента
Компонент Роль Ключевая capability
MoonEP MoE communication library Временная репликация overloaded experts; равномерное распределение tokens per node при load imbalance
FlashKDA KDA operator на NVIDIA CUTLASS Prefill на H20 быстрее flash-linear-attention baseline в 1,72–2,22×; drop-in backend через chunk_kda
AgentEnv Agent sandbox с KVCache.ai (Firecracker microVM) Parallel Agent RL training; checkpoint latency 133 ms, recovery 49 ms, memory oversubscription до 6,5× (vendor claim, independent repro pending)

Moonshot отдаёт не только weight tensors, но и infra stack, который делал K3 trainable — редкий уровень engineering transparency в 3T-классе для команд, строящих custom inference pipeline.

03 Бенчмарки Kimi K3: SWE-bench, API pricing и два коммерческих порога лицензии

Приоритет — независимые third-party measurements; vendor numbers помечены отдельно.

SWE-bench Verified (Vals AI, июль 2026)
Модель Score Release
Claude Opus 5 97 % 2026-07-24
GPT-5.6 Sol 96,2 % 2026-07-09
Claude Fable 5 95 % 2026-06-09
Kimi K3 93,4 % 2026-07-16
Qwen3.7-Max 79,4 % 2026-05-19
DeepSeek-V4 76,2 % 2026-04-23

Artificial Analysis Intelligence Index (max tier): K3 ~57 — global #3, #1 среди open weights. Cost ~$0,95/task vs Fable 5 ~$2,4 — но дороже GLM-5.2 (~$0,47). Capability ceiling open-weight camp, не price-performance winner. Arena.ai Frontend Code Arena: K3 #1.

Open weight ≠ open source: OSI требует training data, code и reproducible pipeline — K3 публикует weights, report и inference infra. Custom License с двумя порогами:

  • MaaS revenue threshold: Model-as-a-Service с >$20M revenue за 12 месяцев — отдельное соглашение с Moonshot.
  • Scale display obligation: >100M MAU или >$20M monthly revenue — prominent display «Kimi K3» обязателен.
Kimi K3 API pricing (per 1M tokens)
Token type Price
Input (cache hit) $0,30
Input (cache miss) $3,00
Output (incl. reasoning) $15,00

Mooncake disaggregated inference architecture даёт >90 % cache hit rate на coding workloads — effective input cost ближе к $0,30/M. Self-hosting: рекомендован supernode 64+ GPU; для большинства команд API или OpenRouter (7 providers live).

04 Kimi K3 API integration и шесть шагов production rollout

Moonshot предоставляет OpenAI-compatible Chat Completions — model ID kimi-k3, base URL https://api.moonshot.ai/v1.

kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Проанализируй этот код..."}]
)

Official sources — перепроверить перед цитированием:

https://kimi.com/blog/kimi-k3

https://api.moonshot.ai/v1

https://huggingface.co/moonshotai

Шесть шагов production rollout:

  1. License boundaries: Проверить, realistic ли MaaS revenue >$20M или MAU >100M — legal early engagement.
  2. Route selection: Direct Moonshot API или OpenRouter moonshotai/kimi-k3 в существующем OpenAI SDK stack.
  3. Prompt caching: Cache keys для repo-scale context и agent loops — target 90 %+ hit rate, effective ~$0,30/M input.
  4. Self-hosting vs API: 1,56 TB weights + 64+ GPU — без cluster API или third-party hosting.
  5. Hybrid model routing: Long coding sessions на K3; hardest repo bugfixes fallback Claude Fable 5; terminal-heavy agents на GPT-5.6 Sol.
  6. Infra repos evaluation: MoonEP, FlashKDA, AgentEnv для MoE training или Agent RL — GitHub state после release перепроверить.

05 Верифицируемые метрики, FAQ и production conclusion

Верифицируемые метрики (EEAT):

  • Scale: 2,8T total parameters, 16/896 active experts — первый полностью открытый 3T-model (Moonshot blog, 27.07.2026).
  • SWE-bench Verified: 93,4 % independent measurement — лидер open-weight camp (Vals AI, июль 2026).
  • FlashKDA: Prefill на H20 1,72–2,22× faster vs baseline (Moonshot GitHub — verify post-release).

FAQ:

  • Q: Kimi K3 — open source? A: Нет — open weight: weights и infra public, training data и full training code отсутствуют (OSI definition не выполнена).
  • Q: Commercial use? A: Для большинства сценариев да; MaaS >$20M/12 months или MAU >100M trigger specific clauses.
  • Q: Сколько GPU для self-hosting? A: Official recommendation — supernode 64+ GPU; API или OpenRouter realistic для большинства.
  • Q: Performance vs cost? A: Strongest open-weight model, но дороже GLM-5.2 — capability ceiling, не budget winner.
  • Q: Отличие от K2? A: ~3× parameters, AttnRes и Per-Head Muon new, 1M context, tightened MaaS license clauses.

Вывод: Kimi K3 open weights — milestone «3T club» для китайских labs. Engineering (KDA, MoonEP) и geopolitics пересекаются, но для production: прочитать license, затем выбрать API или hosting — не качать слепо 1,56 TB.

Ноутбук как 7×24 agent host ломается на sleep, memory pressure и shared file locks; 64-GPU cluster для solo developer нереалистичен. Для Kimi Code, Cursor Agent или OpenClaw Gateway без downtime аренда Mac Mini bare metal CALMVPS — рабочее решение: dedicated Apple Silicon, native Metal acceleration, provisioning 120 секунд — heavy agent loops в cloud, local review only. Цены.