Kimi K3 徹底レビュー:
2.8兆パラメータ、世界最大級オープンソース LLM

2026年7月16日深夜、月之暗面(Moonshot AI)が API ドキュメントに「Kimi K3 提供開始」のバナーを掲出しました。大型キックオフはありませんでしたが、2.8兆(2.8T)パラメータ100万 token コンテキスト、ネイティブ視覚理解を備えた、現時点で世界最大規模のオープンソース AI モデルが登場しました。完全ウェイトは 7月27日 に Hugging Face で公開予定です。

本稿は API 選定中の AI 開発者とプロダクトチーム を対象に、公式技術ブログと料金ページに基づき三つの問いに答えます。Kimi K3 のアーキテクチャ上の真の革新は何か、ベンチマークと料金は Claude Fable 5 / GPT-5.6 Sol と比べてどの位置か、そして今すぐどう使い始めるかです。

01 Kimi K3 とは何か — 仕様、背景、リリースの意味

選定前に陥りやすい誤り:

  • 総パラメータ数だけを見る:MoE ではスパース活性化のため、総数と推論コストは一致しません。活性エキスパート数とコンテキスト効率を必ず確認してください。
  • harness 差異を無視する:月之暗面は Kimi Code、GPT は Codex、Claude は Claude Code を使用します。横比較は出典を明記する必要があります。
  • 1M コンテキストをスペック競争と見る:KDA 等の設計がなければ、長コンテキストの KV キャッシュコストが料金優位を食い潰します。
  • オープンウェイト公開を待ってから評価する:7月27日以前でも API は利用可能です。本番統合は Hugging Face 公開を待つ必要はありません。

Kimi K3 は現時点で世界最大規模のオープンソース AI モデルです。2.8T パラメータは、従来記録保持者の DeepSeek V4 Pro(1.6T) を約 75% 上回り、小米のオープンソースモデル(1.02T)の約 2.7 倍、阿里(397B)の 7 倍以上です。896 個のエキスパートから 16 個を活性化するスパース MoE 構成で、100万 token の超長コンテキスト(『紅楼夢』全五巻を一度に読み込める相当)とネイティブ視覚理解により、複雑なプログラミング、長文書推論、ナレッジワーク向けに設計されています。

ひとことで言えば: Kimi K3 は画像・動画をネイティブ理解でき、超長記憶を持つオープンソースの重量級コーディング AI です。Claude Opus 4.8 より約 40% 安い料金設定で、7月27日に完全ウェイトが公開されます。

Kimi K3 コア仕様
項目
総パラメータ数 2.8 兆(2.8T)
アーキテクチャ Kimi Delta Attention + Attention Residuals + Stable LatentMoE
活性エキスパート 16 / 896(スパース度 1.8%)
コンテキストウィンドウ 1,048,576 tokens(1M)
入力モダリティ テキスト、画像、動画
API モデル ID kimi-k3
推論モード 現時点は max のみ(low/high は今後追加)
オープンウェイト 2026-07-27 Hugging Face

今回のリリースが重要な理由:月之暗面は過去 18 か月、DeepSeek 台頭の衝撃を受けてきました。K3 は技術的反撃です。過去 12 か月のうち Kimi シリーズは 9 か月 オープンソースモデルの規模上限を占めていました。公開タイミングは 2026 世界人工知能大会(WAIC) 開幕前夜です。2026年6月時点の ARR は 3 億ドル を突破し、今年第 6 ラウンドの資金調達を完了、Pre-money 評価額 315 億ドル です。API 収入は全体の 7 割超、海外有料ユーザーは 400% 増加しています。規模だけの見せかけではなく、商用化が加速する段階での技術主権の表明です。

02 Kimi K3 アーキテクチャ革新 — KDA、AttnRes、Stable LatentMoE

多くの「最大モデル」発表は算力追加に留まります。K3 はエンジニアリング面で三つの検証可能な革新を導入し、長コンテキストと超スパース MoE 学習の課題に対処しています。

3.1 Kimi Delta Attention(KDA)— ハイブリッド線形 Attention

従来の Full Attention では長コンテキストで KV キャッシュメモリが二乗級に増大します。KDA は 3:1 の比率 で線形 Attention 層と全 Attention 層を交互に配置します。3 層の線形 Attention が局所構造を低コストで処理し、1 層の全 Attention がグローバルな情報流を保持します。効果として KV キャッシュメモリは最大 75% 削減、100万 token コンテキストではデコード速度が最大 6.3 倍 向上します。短コンテキスト、長コンテキスト、強化学習拡張の各シナリオで純粋な Full Attention ベースラインを上回ります。

3.2 Attention Residuals(AttnRes)— 深度選択的リトリーバル

標準的な残差接続は深度方向に均等に蓄積し、浅い層の重要な表現が深層で薄まります。AttnRes は選択的リトリーバルを導入し、モデルが深度を跨いでより浅い層の高価値表現を直接引き出せます。月之暗面は約 25% の学習効率向上 を報告し、追加計算コストは 2% 未満です。

3.3 Stable LatentMoE — 1.8% スパース度の安定学習

Stable LatentMoE 関連技術
技術 役割
Quantile Balancing ルーター得点の分位数からエキスパート割当を導出し、ヒューリスティック超参を排除
Per-Head Muon 各 Attention ヘッドを独立最適化し、大規模学習をより適応的に
Sigmoid Tanh Unit(SiTU) 活性化関数の制御を改善
Gated MLA Attention の選択性を向上

以上の革新により、Kimi K3 は Kimi K2 比で全体のスケーリング効率が約 2.5 倍向上しました。同等の算力からより強い知能を引き出します。モデルは MXFP4 ウェイトと MXFP8 活性化で学習され、vLLM や SGLang 等のフレームワークが Day-0 対応できる量子化設計です。

03 Kimi K3 ベンチマークと API 料金 — Claude / GPT との位置関係

以下は月之暗面が公表したコアベンチマークです(各モデルは独自の推論 harness を使用)。独立した第三者再現は進行中のため、方向性の参考としてお読みください。

プログラミング・Agent ベンチマーク比較
ベンチマーク Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GLM-5.2
DeepSWE 67.5 70.0 73.0 59.0 46.2
Program Bench 77.8 76.8 77.6 71.9 63.7
Terminal Bench 2.1 88.3 84.6 88.8 84.6 82.7
FrontierSWE 81.2 86.6 71.3 66.7 67.3
SWE Marathon 42.0 35.0 39.0 40.0 13.0
BrowseComp 91.2 88.0 90.4 84.3
Automation Bench 30.8 29.1 29.7 27.2 12.9
GPQA-Diamond 93.5 92.6 94.1 91.0 91.2
MMMU-Pro(視覚) 81.6 81.2 83.0 78.9
OmniDocBench(文書理解) 91.1 89.8 85.8 87.9
HLE-Full 43.5 53.3 44.5

読み取りポイント: SWE Marathon(持続的な長時間コーディング)で K3 は 42.0 と大きくリードします。Program Bench でも 77.8 でわずかに首位です。FrontierSWE は Claude Fable 5 が 86.6 で先行しますが、K3 は GPT-5.6 Sol(71.3)を大きく上回ります。OmniDocBench 首位は視覚と長コンテキストの相乗効果を示します。Artificial Analysis Intelligence Index v4.1 では K3 は 57.1 点で 4 位、Fable 5(59.9)と GPT-5.6 Sol(58.9)に続き、1 位と 4 位の差は 2.8 点のみです。

API 料金比較($/M tokens)
モデル 入力 出力 キャッシュヒット入力 コンテキスト
Kimi K3 $3.00 $15.00 $0.30 1M
Claude Sonnet 5 $3.00(プロモ $2) $15.00(プロモ $10) 200K
Claude Opus 4.8 $5.00 $25.00 200K
GPT-5.5 $5.00 $30.00 400K
DeepSeek V4 Pro $1.74 $3.48 $0.145 128K
Kimi K2.6 $0.95 $4.00 $0.16 256K

K3 の標準料金は Claude Sonnet 5 と同水準($3/$15)ですが、コンテキストは 5 倍です。キャッシュヒットは $0.30/M まで下がり、プログラミングシーンではキャッシュヒット率が 90% 超 となり、実効入力コストは極めて低くなります。中国国内 API は入力 ¥20/M、出力 ¥100/M、キャッシュヒット ¥2/M です。kimi.com の無料アカウントでも K3 が利用でき、プリペイドプランは ¥199 から(割引は 8月11日まで)。Opus 4.8 と比べ、K3 は複数ベンチマークで優位か同等であり、入力コストは約 60%、出力は約 40% です。

04 Kimi K3 の使い方 — 四つの接続経路と六ステップ本番導入

今すぐ使える四つの方法:

  • Kimi Web / App:kimi.com にアクセス。Google アカウントで登録可能。K3 はデフォルトで最大推論強度で動作し、クレジットカード不要です。
  • 公式 API:OpenAI 互換インターフェース。platform.kimi.ai で Key を取得します。
  • OpenRouter:モデル ID moonshotai/kimi-k3。公式料金にマークアップなし、完全 1M コンテキスト対応です。
  • 7月27日のウェイト待ち:Hugging Face で完全ウェイトが公開されます。本番級ローカルデプロイには 64 枚以上の加速カード超ノードが必要で、ノート PC 向けではありません。
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "このコードを分析してください..."}]
)

主要な公式ソースです。発版やページ更新後はリンクを再確認してください。

https://kimi.com/blog/kimi-k3

https://platform.kimi.ai

https://kimi.com

六ステップ本番導入:

  1. API 登録と開通:platform.kimi.ai でアカウント作成、チャージ、API Key 発行。請求リージョンとコンプライアンス要件を確認します。
  2. 接続経路の選択:Moonshot API 直結か OpenRouter(moonshotai/kimi-k3)経由かを決定し、既存 OpenAI SDK から移行します。
  3. Prompt キャッシュの有効化:長いコードベースと Agent ループでキャッシュキーを設定し、90% 超のヒット率で実効入力コストを約 $0.55/M まで圧縮します(OpenRouter 7 日加重で検証可能)。
  4. 1M コンテキストの設計:リポジトリ全体分析、長法務・研究文書、マルチターン Agent メモリなど、flat 料金でウィンドウを使い切る設計にします。
  5. ハイブリッドモデルルーティング:長時間プログラミングと文書理解は K3、複雑な Repo 級バグ修正は Claude Fable 5 に fallback、ターミナル集約 Agent は GPT-5.6 Sol を残す構成が現実的です。
  6. 7月27日ウェイト公開の追跡:自ホストやファインチューニングが必要な場合、Hugging Face の MXFP4/NVFP4 量子化版と vLLM/SGLang 対応アナウンスをフォローします。

05 どう選ぶか — 選定マトリクス、オープンソース、FAQ

シナリオ別選定マトリクス
シナリオ 推奨モデル 理由
持続的な長時間コーディング(SWE Marathon 系) Kimi K3 ベンチマーク首位、最長コンテキスト
複雑な Repo 級バグ修正 Claude Fable 5 FrontierSWE / SWE-bench Pro で大幅リード
ターミナル・ツールチェーン集約 Agent GPT-5.6 Sol Terminal Bench と Coding Agent Index で先行
超長文書・マルチモーダル文書理解 Kimi K3 OmniDocBench 首位、ネイティブ視覚 + 1M コンテキスト
コスト重視 DeepSeek V4 Pro 出力 $3.48/M と K3 より大幅に安い
オープンソース自ホスト(7/27 以降) Kimi K3 最強のオープンウェイト、初の 2T 超クラス
最深推論研究 Claude Fable 5 HLE-Full で大幅リード(53.3 vs 43.5)

7月27日オープンソース約束:月之暗面は公式アナウンスで 7月27日に完全モデルウェイトを公開すると明言しています。公開後、K3 はダウンロード可能な最大規模のオープンソースモデル、初の 2 兆パラメータ超クラスのオープンウェイト、オープンコミュニティの学習・ファインチューニング新基盤となります。Hugging Face には MXFP4/NVFP4 量子化版が登場し、vLLM や SGLang 等が初日から対応する見込みです。

引用可能データ(EEAT):

  • パラメータ規模:2.8T 総パラメータ、896 エキスパート中 16 活性化、DeepSeek V4 Pro(1.6T)比約 75% 上(出典:Moonshot AI 公式ブログ、2026-07-16)。
  • KDA 効率:100万 token コンテキストで KV キャッシュ 75% 削減、デコード最大 6.3 倍加速(出典:Moonshot 技術文書、2026-07-16)。
  • 総合知能:Artificial Analysis Intelligence Index v4.1 スコア 57.1、オープンソースモデルで世界トップティア(出典:Artificial Analysis、2026-07)。

FAQ:

  • Q: Kimi K3 は無料ですか? A: kimi.com の無料アカウントで利用できます。API は $3/$15 per 1M tokens で課金されます。
  • Q: ローカルで動かせますか? A: 7月27日のウェイト公開までは不可です。公開後も 64 枚以上の加速カード超ノードが必要で、コンシューマー向けハードウェアではありません。
  • Q: DeepSeek V4 Pro との比較は? A: K3 はパラメータ約 2 倍、コンテキスト 1M vs 128K、複数ベンチマークで優位ですが、DeepSeek の出力 $3.48/M の方が安いです。
  • Q: 1M コンテキストは実用的ですか? A: リポジトリ全体分析、長文書のエンドツーエンド処理、多セッション Agent の長期記憶に適しています。flat 料金により全ウィンドウ利用が現実的です。
  • Q: low/high 推論モードはいつ来ますか? A: Moonshot は low/high モードを今後追加すると述べています。現時点は max のみです。

まとめ:Kimi K3 はパラメータ数だけを積み上げた見せかけではありません。KDA、AttnRes、Stable LatentMoE は実在するエンジニアリング革新であり、プログラミング長タスクと文書理解で一部クローズド旗艦に匹敵か上回ります。料金は妥当で、完全オープンソースが約束されています。中国 AI オープンエコシステムが「低価格で市場獲得」から真の知能フロンティアへの挑戦へ移行した象徴です。注目タイムライン:7月17–20日 WAIC → 7月27日 K3 完全ウェイトのオープンソース公開。

Kimi K3 API をローカルの OpenClaw / Cursor Agent に接続すると、個人 Mac のスリープで長時間 SWE Marathon 系タスクが中断され、複数リポジトリの並列処理がメモリとネットワークを奪い合います。AI プログラミング Agent、Kimi Code ワークフロー、OpenClaw Gateway の 7×24 安定運用が必要な本番環境では、CALMVPS 裸金属 Mac Mini レンタルが通常より適しています。専用 Apple Silicon、Metal ネイティブ加速、月額柔軟課金、約 120 秒プロビジョニングで、重い Agent ループをクラウドにオフロードしローカルはレビューに集中できます。料金ページをご覧ください。