Kimi K3 全面開源權重:
2.8 兆參數、百萬上下文,月之暗面這次放了什麼大招

7 月 27 日晚 23 點左右,月之暗面(Moonshot AI)正式釋出 Kimi K3 完整模型權重與技術報告,並同步開源 MoonEPFlashKDAAgentEnv 三項核心基礎設施——這是全球首個被完整公開的 3 兆參數級別模型,權重約 1.56TB,上線半小時內登頂 Hugging Face 趨勢榜第一。

本文面向正在評估 Kimi K3 商用許可、自部署門檻與 API 選型的 AI 開發者與技術決策者,嚴格依據官方發布與第三方複測資料,回答三件事:K3 到底是「開源」還是「開放權重」、架構與 Infra 創新值不值得跟進、以及現在該怎麼接入或規避許可證紅線。

01 Kimi K3 從 API 首發到全面開源:11 天時間軸與選型痛點

權重落地前的真實痛點:

  • 混淆「開源」與「開放權重」:媒體普遍寫「開源」,但月之暗面官方從未使用 open source,只稱 open weight——企業法務若按 OSI 標準評估會誤判合規風險。
  • 忽視許可證兩道商業門檻:K3 自訂許可新增 Model-as-a-Service 年收入 2000 萬美元門檻與 1 億月活展示義務,與 K2 時代的 Modified MIT 不同。
  • 只看參數量不看啟用成本:2.8T 總參數、896 專家僅啟用 16 個,自部署需 64 卡以上超節點,消費級硬體不現實。
  • 把蒸餾爭議當雜訊:7 月 22–23 日美方指控與 7 月 28 日商務部回應疊加 WAIC 2026 視窗,選型須把地緣政治與工程細節分開評估。

這次全面開源距 Kimi K3 在 kimi.com 與 API 端首發,只過去了 11 天

  • 7 月 16 日夜(WAIC 2026 前夜):K3 在 kimi.com、Kimi Work、Kimi Code 及 Kimi API 首發,權重尚未公開。官方技術部落格標題為《Kimi K3: Open Frontier Intelligence》。
  • 7 月 17 日:業界密集分析架構,新華社報導稱其為「目前全球參數最大的開源模型」。
  • 7 月 22–23 日:中美「模型蒸餾」爭端升級。白宮科技顧問 Michael Kratsios 指控月之暗面對 Anthropic Fable 模型進行「大規模、隱蔽的工業化蒸餾」;美國財政部長 Scott Bessent 表示將考慮制裁及實體清單限制。
  • 7 月 27 日晚 23 點:正式發布 K3 完整權重、技術報告,開源 MoonEP、AgentEnv(FlashKDA 此前已開源)。
  • 7 月 28 日:中國商務部公開回應,指責美方「AI 霸權主義」;國內媒體跟進報導開源細節。三天後阿里巴巴發布 24 兆參數的 Qwen3.8-Max-Preview,國產大模型競爭進入「3T 俱樂部」階段。
Kimi K3 核心參數一覽
項目 參數
總參數量 2.8 兆(2.8T)
啟用參數量 約 1040 億
架構類型 混合專家模型(MoE)
專家配置 896 個路由專家,每 token 啟用 16 個(另有共享專家)
注意力機制 Kimi Delta Attention(KDA)+ 門控多頭潛在注意力(Gated MLA)
上下文視窗 100 萬 token
多模態能力 原生視覺理解(ViT-V2,27 層)
權重格式 MXFP4 權重 + MXFP8 啟用(SFT 階段起量化感知訓練)
權重體積 約 1.56TB(Hugging Face)
License 自訂許可證(官方稱 open weight,非 open source)

02 Kimi K3 架構創新:KDA、AttnRes 與三大 Infra 開源

Kimi K3 重構了深度學習沿用多年的三大傳統元件——注意力機制、殘差連接、最佳化器,這也是它區別於「簡單堆參數」的關鍵。

Kimi Delta Attention(KDA):傳統 Gated DeltaNet 使用純量級遺忘門;KDA 改為逐通道門控,每個特徵維度擁有獨立衰減率。採用 chunkwise Diagonal-Plus-Low-Rank(DPLR)公式實現線性時間遞迴,K3 將 KDA 與少量 Gated MLA 全域注意力層交替混合,支撐 100 萬 token 上下文同時把 KV Cache 開銷壓到極低。

Attention Residuals(AttnRes):傳統殘差連接逐層均勻累加,深層易稀釋早期資訊。AttnRes 改為選擇性、依輸入動態聚合前面所有層輸出,每層僅新增一個 RMSNorm 和一個偽查詢向量,帶來約 25% 訓練效率提升,代價不到 2%。

Per-Head Muon:讓每個注意力頭獨立最佳化,自適應收斂路徑;純訓練期技術,API 呼叫無感知,但堆疊細節讓 K3 以更少啟用參數打出接近頂尖閉源模型的效果。

Stable LatentMoE:896 選 16 的稀疏藝術(稀疏度約 1.8%),配合 Quantile Balancing 均衡策略與 MoonEP,從數學上證明每個運算節點冗餘專家數的理論上界。

月之暗面沒有只發權重檔案,而是把支撐 K3 訓練效率的三項關鍵基礎設施一併開源:

三大開源 Infra 技術
技術 定位 關鍵能力
MoonEP 超大規模細粒度 MoE 高效能通訊函式庫 暫時複製過載專家,保證每節點均等 token 數;證明冗餘專家數理論上界,負載不均衡時仍維持高通訊效率
FlashKDA 基於 NVIDIA CUTLASS 的 KDA 高效能算子(此前已開源) NVIDIA H20 上 prefill 較 flash-linear-attention 基線快 1.72–2.22 倍;可作為 chunk_kda 直接替代後端
AgentEnv 與 KVCache.ai 聯合開發的 Agent 沙箱(Firecracker microVM) 面向大規模並行 Agent RL 訓練;官方披露 checkpoint 延遲低至 133ms、恢復 49ms、記憶體超分最高 6.5 倍(尚未經第三方獨立複現)

綜合架構與 Infra 開源,月之暗面此次發布在開發者社群獲得較高評價——不只是釋出權重,而是整套工程能力對外開放。

03 Kimi K3 跑分如何?開放權重許可證的兩道商業門檻

以下優先引用獨立第三方複測資料,廠商自報資料單獨標註。

SWE-bench Verified(獨立複測,Vals AI,截至 2026 年 7 月)
模型 分數 發布日期
Claude Opus 5 97% 2026-07-24
GPT-5.6 Sol 96.2% 2026-07-09
Claude Fable 5 95% 2026-06-09
Kimi K3 93.4% 2026-07-16
Qwen3.7-Max 79.4% 2026-05-19
DeepSeek-V4 76.2% 2026-04-23

Artificial Analysis 智能指數(max 推理檔):Claude Fable 5(max + fallback)60;GPT-5.6 Sol(max)59;Kimi K3(max)約 57,全球第 3、開源模型第 1;GLM-5.2(max)51;DeepSeek V4 Pro(max)44。K3 每任務成本約 $0.95,比 Claude Fable 5(約 $2.4/任務)便宜約 60%,但比 GLM-5.2(約 $0.47/任務)更貴——開源陣營能力天花板最高,而非性價比最優。K3 目前在 Arena.ai Frontend Code Arena 榜單排名第一。

開放權重 vs 開源:按 OSI 標準,真正開源需公開訓練資料、訓練程式碼與完整可複現流程;K3 只公開權重、技術報告與推理 Infra,訓練資料與完整訓練程式碼未公開。許可證也不再自稱 Modified MIT,而是一份完全自訂檔案,含兩道商業門檻:

  • Model-as-a-Service 收入門檻:若被許可方營運「模型即服務」業務,且連續 12 個月累計收入超過 2000 萬美元,須與月之暗面另行簽署商業協議。
  • 規模展示門檻:若產品月活超過 1 億,或月收入超過 2000 萬美元,須在介面顯著展示「Kimi K3」字樣。

對絕大多數中小團隊,兩道門檻幾乎不會觸發;但若商業計畫是「拿 K3 開與月之暗面競爭的模型服務」,第一道門檻是法務重點紅線。

Kimi K3 API 定價(每百萬 token)
Token 類型 價格
輸入(快取命中) $0.30
輸入(快取未命中) $3.00
輸出(含推理過程) $15.00

Mooncake 分離式推理架構在典型程式設計工作負載上快取命中率可達 90% 以上,實際成本更接近 $0.30 檔。自部署方面,官方建議 64 卡及以上超節點;個人與中小團隊更現實的路徑是官方 API 或 OpenRouter(目前已有 7 家服務商上線)。

04 Kimi K3 怎麼用?API 接入與六步生產落地

月之暗面提供 OpenAI SDK 相容的 Chat Completions API,模型 ID 為 kimi-k3,大部分現有專案只需改 base URL 和金鑰即可接入。

kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "分析這段程式碼..."}]
)

以下為主要官方來源,發版或頁面更新後請再次開啟連結核對:

https://kimi.com/blog/kimi-k3

https://api.moonshot.ai/v1

https://huggingface.co/moonshotai

六步生產落地:

  1. 釐清許可邊界:確認業務不屬於 MaaS 年收入超 2000 萬美元或月活超 1 億場景;若接近閾值,提前與法務評估自訂許可條款。
  2. 選擇接入路徑:直連 Moonshot API(https://api.moonshot.ai/v1)或經 OpenRouter(moonshotai/kimi-k3)統一路由,按 OpenAI SDK 遷移。
  3. 啟用 Prompt 快取:長程式碼庫與 Agent 迴圈場景設定快取鍵,利用 90%+ 命中率將有效輸入成本壓至約 $0.30/M。
  4. 評估自部署 vs API:1.56TB 權重需 64 卡超節點;除非有現成叢集,否則 API 或第三方託管更現實。
  5. 混合模型路由:長時程式設計與文件理解走 K3;複雜 Repo 修 Bug 可 fallback Claude Fable 5;終端密集型 Agent 可保留 GPT-5.6 Sol。
  6. 跟進 Infra 開源:若做 MoE 訓練或 Agent RL,評估 MoonEP、FlashKDA、AgentEnv 與現有堆疊的整合;發版後請再次核對 GitHub 儲存庫。

05 可引用資料、FAQ 與總結

可引用關鍵資料(EEAT):

  • 參數規模:2.8T 總參數、896 專家啟用 16 個,全球首個完整開放的 3T 級模型(來源:Moonshot AI 官方部落格,2026-07-27)。
  • SWE-bench Verified:獨立複測 93.4%,開源模型陣營領先,僅次於 Claude Opus 5 / GPT-5.6 Sol / Claude Fable 5(來源:Vals AI,2026-07)。
  • FlashKDA 加速:NVIDIA H20 上 prefill 較基線快 1.72–2.22 倍(來源:Moonshot GitHub FlashKDA,發版後請核對)。

常見問題 FAQ:

  • Q: Kimi K3 真的是開源模型嗎? A: 嚴格來說不是。屬於「開放權重」:權重、技術報告與部分 Infra 公開,訓練資料與完整訓練程式碼未公開,不符合 OSI「開源」定義。
  • Q: Kimi K3 可以免費商用嗎? A: 絕大多數商業場景不受限制;MaaS 年收入超 2000 萬美元或月活超 1 億/月收入超 2000 萬美元須滿足許可特定條款。
  • Q: 需要多少顯卡才能自部署? A: 官方建議 64 卡及以上超節點;個人與大部分企業更現實的方式是 API 或 OpenRouter。
  • Q: 效能到底強不強? A: 開源陣營綜合能力最強,AA 指數全球第 3;但成本高於 GLM-5.2,屬能力天花板而非性價比最優。
  • Q: 和 Kimi K2 有什麼區別? A: K3 參數約為 K2.5 的 3 倍,新增 AttnRes 與 Per-Head Muon,上下文與多模態大幅提升;許可新增 MaaS 收入門檻,商業限制更細化。

總結:Kimi K3 全面開放權重是國產大模型「3T 俱樂部」的里程碑——工程細節(KDA、AttnRes、MoonEP)與地緣政治背景交織,但對企業使用者而言,先讀懂開放權重許可、再選 API 或託管路徑,比盲目下載 1.56TB 權重更務實。

把 Kimi K3 接到本地 Agent 工作流時,個人 Mac 休眠會中斷長時程式設計任務,自部署 64 卡叢集成本對個人開發者更不現實。對於需要 AI 程式設計 Agent、Kimi Code 工作流或 OpenClaw Gateway 7×24 穩定運行的生產環境,CALMVPS 裸金屬 Mac Mini 租賃通常是更優解:獨占 Apple Silicon、Metal 原生加速、按月彈性下單,約 120 秒交付,將重 Agent 迴圈卸載雲端而本地僅做審核。詳見 定價頁