Kimi K3: технический разбор
Open-source модель на 2,8T параметров против Claude и GPT

TL;DR: 16 июля 2026 Moonshot AI выпустил Kimi K3 — крупнейшую open-source модель с 2,8 триллиона параметров, контекстом 1M tokens, native vision и API $3/$15 за 1M tokens. Полные weights — 27 июля.

Материал для разработчиков, которые оценивают switch API, timeline open weights и long-horizon coding agents. Внутри: spec sheet, три архитектурных фикса (KDA, AttnRes, Stable LatentMoE), полные таблицы vs Claude Fable 5 и GPT-5.6 Sol, pricing math, шесть шагов rollout и scenario matrix — чтобы ответить: можно ли гонять сегодня, как сравнивается, стоит ли переключаться.

01 Kimi K3: спеки, тихий релиз и зачем это важно

Типичные ошибки перед выбором модели:

  • Считать только параметры: у MoE на token активируется крошечная доля experts — смотрите active experts и context efficiency.
  • Сравнивать разные harness: Moonshot — Kimi Code; GPT — Codex; Claude — Claude Code; cross-vendor scores только directional.
  • 1M context без архитектуры — маркетинг: KV cache cost взлетает без KDA и подобных механизмов.
  • Ждать weights — задержка прода: API уже live; self-host можно отложить до 27 июля.

Kimi K3 — MoE 2,8T от Moonshot AI (Пекин), первый open model класса 3T, ~на 75 % больше DeepSeek V4 Pro (1,6T). На forward pass активируются 16 из 896 experts, реальный контекст 1 048 576 tokens, input: text, image, video. Model ID: kimi-k3. Reasoning на старте — max effort.

Kimi K3 — кратко
Параметр Значение
Всего параметров 2,8 триллиона
Архитектура Kimi Delta Attention + Attention Residuals + Stable LatentMoE
Active experts 16 / 896 (sparsity 1,8 %)
Контекст 1M tokens
API pricing $3 input / $15 output за 1M tokens
Open weights 27 июля 2026 на Hugging Face

Ночью 16 июля Moonshot просто включил API — баннер в docs, без пресс-конференции. Тихий launch на фоне масштаба: крупнейшая open-source AI-модель в истории.

Почему релиз значим: за 18 месяцев DeepSeek съел позицию Moonshot. K3 — comeback: Kimi держал size record среди open models 9 из 12 последних месяцев; ARR > $300M к июню 2026; 6-й раунд при $31,5B pre-money; API revenue 70 %+ total, overseas paid users +400 %. Тайминг — канун WAIC 2026 в Шанхае. Быстрорастущий бизнес с техническим statement, не vanity scale.

02 Архитектура Kimi K3: KDA, AttnRes и Stable LatentMoE

Большинство «самая большая модель»-релизов просто накидывают compute. K3 приносит три engineering fix для long context и extreme MoE sparsity.

Kimi Delta Attention (KDA) чередует дешёвые linear-attention layers и full-attention в ratio 3:1. Итог: до −75 % KV cache memory и до 6,3× faster decoding на 1M-token context — parity или лучше full-attention baseline на short, long и RL tasks без capability tradeoff. Поэтому 1M window flat-priced, не теоретический.

Attention Residuals (AttnRes) заменяют uniform depth accumulation на selective retrieval между слоями — ~+25 % training efficiency при <2 % extra compute.

Stable LatentMoE делает trainable sparsity 1,8 % (16/896 experts) через Quantile Balancing, Per-Head Muon, SiTU activation и Gated MLA — ~2,5× scaling efficiency vs Kimi K2. Training: MXFP4 weights + MXFP8 activations для quantization-aware deploy.

03 Benchmarks Kimi K3 и API pricing

Ниже scores от Moonshot. Независимая reproduction in progress — treat as directional.

Coding benchmarks
Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
DeepSWE 67.5 70.0 73.0 59.0
Program Bench 77.8 76.8 77.6 71.9
Terminal Bench 2.1 88.3 84.6 88.8 84.6
FrontierSWE 81.2 86.6 71.3 66.7
SWE Marathon 42.0 35.0 39.0 40.0
BrowseComp 91.2 88.0 90.4 84.3
OmniDocBench 91.1 89.8 85.8 87.9
HLE-Full 43.5 53.3 44.5

SWE Marathon — sustained long-horizon coding — headline: K3 лидирует 42.0, +7 п.п. над Claude Fable 5. Лидерство на OmniDocBench стыкуется с native vision + 1M context. Artificial Analysis Intelligence Index v4.1: K3 57.1 (4-е место), −2.8 п.п. от #1 Fable 5 (59.9), с большим отрывом от большинства open weights.

API pricing ($/1M tokens)
Модель Input Output Cache-hit input Контекст
Kimi K3 $3.00 $15.00 $0.30 1M
Claude Sonnet 5 $3.00 $15.00 200K
Claude Opus 4.8 $5.00 $25.00 200K
GPT-5.5 $5.00 $30.00 400K
DeepSeek V4 Pro $1.74 $3.48 $0.145 128K

K3 совпадает с Claude Sonnet 5 по базовому pricing, но даёт 5× context. Mooncake split-inference — 90 %+ cache hit в Kimi Code workflows; effective avg input ~$0.55/M (OpenRouter 7-day weighted avg). vs Opus 4.8: сильнее на ряде benchmarks при ~60 % input и ~40 % output cost.

04 Kimi K3 сейчас: четыре пути и шесть шагов в прод

  • Chat free: kimi.com — Google sign-in, max reasoning, без карты.
  • Official API: OpenAI-compatible https://api.moonshot.ai/v1, key с platform.kimi.ai.
  • OpenRouter: moonshotai/kimi-k3 — official pricing, без markup, full 1M context.
  • Self-host 27 июля: full weights на Hugging Face; прод требует 64+ accelerators, не ноутбук.
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Проанализируй репозиторий на bottlenecks..."}]
)
print(response.choices[0].message.content)

Primary sources — перепроверьте links после upstream updates:

https://kimi.com/blog/kimi-k3

https://platform.kimi.ai

Шесть шагов production rollout:

  1. API credentials: регистрация platform.kimi.ai, billing, generate API key.
  2. Выбор route: direct Moonshot API или OpenRouter moonshotai/kimi-k3 в существующем OpenAI SDK stack.
  3. Prompt caching: cache keys для repo-scale и agent loops — target 90 %+ hit rate.
  4. План 1M context: whole-codebase analysis, legal/research docs, multi-session agent memory — flat pricing делает full window практичным.
  5. Hybrid routing: long coding и documents на K3; hardest bugfixes в крупных репозиториях — fallback Fable 5; terminal-heavy agents — GPT-5.6 Sol.
  6. Календарь 27 июля: следить за Hugging Face MXFP4/NVFP4 quant builds и vLLM/SGLang day-0 support при необходимости self-host.

05 Kimi K3 vs конкуренты, open weights и FAQ

Какую модель под какую задачу
Сценарий Лучший pick Почему
Длинные sustained coding sessions Kimi K3 Лидирует SWE Marathon; 1M context без mid-task loss
Сложные bugfixes в крупных репозиториях Claude Fable 5 Значимый lead на FrontierSWE
Terminal/tool-heavy agent workflows GPT-5.6 Sol Terminal Bench и agent index leadership
Multimodal document analysis Kimi K3 Лучший OmniDocBench; vision + 1M
Cost-sensitive production DeepSeek V4 Pro Output $3.48/M — сильно дешевле
Open-source self-hosting (после 27.07.) Kimi K3 Крупнейшие доступные open weights
Deepest reasoning research Claude Fable 5 HLE-Full lead (53.3 vs 43.5)

Open weights 27 июля: K3 станет крупнейшей downloadable open model, первой выше 2T parameters, новой fine-tuning foundation — MXFP4 training для efficient inference на modern hardware. Day-0 support в transformers, vLLM, SGLang expected.

Цитируемые метрики (EEAT):

  • Scale: 2.8T total, 16/896 active experts — ~+75 % vs DeepSeek V4 Pro (Moonshot blog, 2026-07-16).
  • KDA efficiency: −75 % KV cache, до 6.3× decode speedup на 1M tokens (Moonshot technical docs).
  • Intelligence index: 57.1 на Artificial Analysis v4.1 — top tier среди open models (Artificial Analysis, July 2026).

FAQ:

  • Kimi K3 бесплатен? Да на kimi.com с free account; API — pay-per-token ($3/$15 за 1M).
  • Можно локально? Нет до weights 27 июля; затем 64+ H100-class GPU для production inference.
  • Kimi K3 vs DeepSeek V4 Pro? K3 — почти 2× parameters, 1M vs 128K context, сильнее coding scores; DeepSeek дешевле output ($3.48/M).
  • 1M context реально полезен? Да для whole-codebase calls, end-to-end legal/research docs, long-memory agents — flat pricing делает это usable.
  • Когда low/high reasoning modes? Moonshot обещает updates; сейчас только max.

Bottom line: Kimi K3 — самая capable open-source AI model на сегодня. Не побеждает каждый benchmark — Fable 5 и GPT-5.6 Sol лидируют в отдельных tasks — но competitive across the board, wins long-horizon coding и document understanding, отдаёт 1M context по Sonnet-tier pricing. Weights 27 июля — главная дата.

Dates: Сейчас → kimi.com · 17–20 июля → WAIC Shanghai · 27 июля → Hugging Face weights.

Kimi K3 agents на sleeping laptop рвут long SWE Marathon loops; parallel репозитории бьются за RAM и bandwidth. Для Cursor Agent, Kimi Code или OpenClaw Gateway 24/7 аренда bare-metal Mac Mini CALMVPS обычно разумнее: dedicated Apple Silicon, Metal-native acceleration, provisioning ~120 с — тяжёлые agent loops в облако, review планов локально. Страница цен.