Kimi K3 深度評測:
2.8 萬億參數,國產開源大模型新紀錄

2026 年 7 月 16 日深夜,月之暗面(Moonshot AI)在 API 文件頂部悄然掛出橫幅「Kimi K3 已上線!」——沒有大型發布會,卻發布了目前全球參數規模最大的開源 AI 模型2.8 萬億(2.8T)參數100 萬 token 上下文、原生視覺理解,完整權重將於 7 月 27 日 開放。

本文面向正在評估 API 選型、關注開源權重與程式設計 Agent 能力的 AI 開發者與產品團隊,嚴格依據官方技術部落格與定價頁,回答三件事:Kimi K3 架構上做了什麼真創新、基準與定價相對 Claude Fable 5 / GPT-5.6 Sol 處於什麼位置、以及現在就能怎麼用起來。

01 Kimi K3 是什麼?規格、背景與發布意義

選型前的真實痛點:

  • 只看參數量:MoE 稀疏啟用下,總參數不等於推理成本,須看啟用專家數與上下文效率。
  • 忽視 harness 差異:月之暗面自報基準使用 Kimi Code,GPT 用 Codex、Claude 用 Claude Code,橫向對比須標註來源。
  • 把 1M 上下文當噱頭:無 KDA 等架構支撐時,長上下文 KV 快取成本會吞噬定價優勢。
  • 等權重開源再評估:7 月 27 日前 API 已可用,生產整合不必等到 Hugging Face 放權重。

Kimi K3 是目前全球參數規模最大的開源 AI 模型——2.8T 參數,超越此前紀錄保持者 DeepSeek V4 Pro(1.6T) 近 75%,約為小米開源模型(1.02T)的 2.7 倍、阿里(397B)的 7 倍有餘。它採用稀疏 MoE 架構,推理時從 896 個專家中啟用 16 個;配合 100 萬 token 超長上下文(約等於一次性讀完 5 本《紅樓夢》全文)與原生視覺理解,專為複雜程式設計、長文件推理與知識工作設計。

一句話總結: Kimi K3 是開源的、可原生理解影像與影片的、擁有超長記憶的重量級程式設計 AI,定價比 Claude Opus 4.8 便宜約 40%,完整權重將於 7 月 27 日對外開源。

Kimi K3 核心規格
參數 數值
總參數量 2.8 萬億(2.8T)
架構 Kimi Delta Attention + Attention Residuals + Stable LatentMoE
啟用專家 16 / 896(稀疏度 1.8%)
上下文視窗 1,048,576 tokens(1M)
輸入模態 文字、影像、影片
API 模型 ID kimi-k3
推理模式 目前僅 max(低/高模式後續更新)
開源權重 2026-07-27 Hugging Face

為什麼這次發布意義重大:月之暗面在過去 18 個月經歷 DeepSeek 崛起帶來的衝擊,K3 是一次技術反擊——過去 12 個月 Kimi 系列有 9 個月 佔據開源模型規模上限;發布時點恰在 2026 世界人工智慧大會(WAIC) 開幕前夜;截至 2026 年 6 月 ARR 已突破 3 億美元,今年完成第 6 輪融資,投前估值 315 億美元;API 收入佔七成以上,海外付費使用者成長 400%。這不是情懷堆規模,而是商業化爆發期的技術主權宣示。

02 Kimi K3 架構創新:KDA、AttnRes 與 Stable LatentMoE

多數「最大模型」公告只是加算力;K3 在工程層面引入三項可驗證創新,解決長上下文與超稀疏 MoE 訓練難題。

3.1 Kimi Delta Attention(KDA)—— 混合線性注意力

傳統 Full Attention 在長上下文下 KV 快取記憶體呈平方級成長。KDA 以 3:1 比例 交替線性注意力層與全注意力層:3 個線性層處理局部結構(計算廉價),1 個全注意力層保留全域資訊流。效果:KV 快取記憶體減少高達 75%;百萬 token 上下文下解碼速度提升高達 6.3 倍;短上下文、長上下文與強化學習擴展場景均超越純全注意力基線。類比:全注意力像同時記住所有對話細節,KDA 更像高效秘書——平時快速索引,關鍵時刻精準回憶。

3.2 Attention Residuals(AttnRes)—— 深度選擇性檢索

標準殘差連接沿深度均勻累積,早期層關鍵表徵在深層被稀釋。AttnRes 引入選擇性檢索,模型可跨越深度直接拉取更早層的高價值表徵。月之暗面報告約 25% 訓練效率提升,額外計算開銷不足 2%。

3.3 Stable LatentMoE —— 1.8% 稀疏度穩定訓練

Stable LatentMoE 配套技術
技術 作用
Quantile Balancing 從路由器得分分位數推導專家分配,消除啟發式超參
Per-Head Muon 針對每個注意力頭獨立最佳化,大規模訓練更自適應
Sigmoid Tanh Unit(SiTU) 改進啟用函數控制
Gated MLA 提升注意力選擇性

綜合以上創新,Kimi K3 相較 Kimi K2 整體擴展效率提升約 2.5 倍——相同算力轉化出更強智慧。模型以 MXFP4 權重與 MXFP8 啟用訓練,量化感知設計便於 vLLM、SGLang 等框架 Day-0 支援。

03 Kimi K3 基準測試與 API 定價格局

以下為月之暗面自報核心基準(不同模型使用各自推理 harness)。獨立第三方複現仍在進行中,請作方向性參考。

程式設計與 Agent 基準對比
基準測試 Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GLM-5.2
DeepSWE 67.5 70.0 73.0 59.0 46.2
Program Bench 77.8 76.8 77.6 71.9 63.7
Terminal Bench 2.1 88.3 84.6 88.8 84.6 82.7
FrontierSWE 81.2 86.6 71.3 66.7 67.3
SWE Marathon 42.0 35.0 39.0 40.0 13.0
BrowseComp 91.2 88.0 90.4 84.3
Automation Bench 30.8 29.1 29.7 27.2 12.9
GPQA-Diamond 93.5 92.6 94.1 91.0 91.2
MMMU-Pro(視覺) 81.6 81.2 83.0 78.9
OmniDocBench(文件理解) 91.1 89.8 85.8 87.9
HLE-Full 43.5 53.3 44.5

解讀要點: SWE Marathon(持續性長程式碼工作)K3 以 42.0 大幅領先;Program Bench 微幅第一(77.8);FrontierSWE 由 Claude Fable 5 領跑(86.6),K3 仍大幅超越 GPT-5.6 Sol(71.3);OmniDocBench 第一體現視覺+長上下文協同。Artificial Analysis Intelligence Index v4.1 中 K3 以 57.1 分排名第四,緊隨 Fable 5(59.9)與 GPT-5.6 Sol(58.9),#1 與 #4 差距僅 2.8 分。

API 定價對比($/M tokens)
模型 輸入 輸出 快取命中輸入 上下文
Kimi K3 $3.00 $15.00 $0.30 1M
Claude Sonnet 5 $3.00(促銷 $2) $15.00(促銷 $10) 200K
Claude Opus 4.8 $5.00 $25.00 200K
GPT-5.5 $5.00 $30.00 400K
DeepSeek V4 Pro $1.74 $3.48 $0.145 128K
Kimi K2.6 $0.95 $4.00 $0.16 256K

K3 標準價與 Claude Sonnet 5 持平($3/$15),上下文為 5 倍;快取命中低至 $0.30/M,程式設計場景快取命中率超 90%,有效輸入成本極低。中國大陸 API:¥20/M 輸入、¥100/M 輸出、快取命中 ¥2/M;Kimi.com 免費帳號可用 K3,預付費套餐 ¥199 起(優惠截至 8 月 11 日)。相對 Opus 4.8,K3 在多項基準上更優且輸入成本約 60%、輸出約 40%。

04 Kimi K3 怎麼用?四渠道接入與六步落地

四種立即使用方式:

  • Kimi 網頁/App:造訪 kimi.com,支援 Google 帳號註冊,K3 預設以最大推理力度執行,無需信用卡。
  • 官方 API:OpenAI 相容介面,在 platform.kimi.ai 取得 Key。
  • OpenRouter:模型 ID moonshotai/kimi-k3,官方定價無加價,完整 1M 上下文。
  • 等 7 月 27 日權重:Hugging Face 開放完整權重;生產級本地部署需 64 張以上加速卡超節點,非筆電級任務。
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "幫我分析這段程式碼..."}]
)

以下為主要官方來源,發版或頁面更新後請再次開啟連結核對:

https://kimi.com/blog/kimi-k3

https://platform.kimi.ai

https://kimi.com

六步生產落地:

  1. 註冊並開通 API:在 platform.kimi.ai 建立帳號、儲值並產生 API Key,確認帳單區域與合規要求。
  2. 選擇接入路徑:直連 Moonshot API 或經 OpenRouter(moonshotai/kimi-k3)統一路由,按現有 OpenAI SDK 遷移。
  3. 啟用 Prompt 快取:長程式碼庫與 Agent 迴圈場景設定快取鍵,利用 90%+ 命中率將有效輸入成本壓至約 $0.55/M(OpenRouter 7 日加權可驗證)。
  4. 規劃 1M 上下文用法:整庫分析、長法律/研究文件、多輪 Agent 記憶——利用 flat 定價實際吃滿視窗,而非截斷。
  5. 混合模型路由:長時程式設計與文件理解走 K3;複雜 Repo 級修 Bug 可 fallback Claude Fable 5;終端機密集型 Agent 可保留 GPT-5.6 Sol。
  6. 標記 7 月 27 日權重發布:若需自託管或微調,跟進 Hugging Face MXFP4/NVFP4 量化版與 vLLM/SGLang 適配公告。

05 怎麼選?開源承諾、FAQ 與總結

場景選型矩陣
場景 推薦模型 原因
持續性長程式碼任務(SWE Marathon 類) Kimi K3 基準第一,上下文最長
複雜 Repo 級別修 Bug Claude Fable 5 FrontierSWE / SWE-bench Pro 大幅領先
終端機/工具鏈密集型 Agent GPT-5.6 Sol Terminal Bench 與 Coding Agent Index 領先
超長文件/多模態文件理解 Kimi K3 OmniDocBench 第一,原生視覺 + 1M 上下文
成本敏感場景 DeepSeek V4 Pro 輸出僅 $3.48/M,遠低於 K3
開源自部署(7/27 後) Kimi K3 最強開源權重,首個超 2T 參數級別
最深推理研究 Claude Fable 5 HLE-Full 大幅領先(53.3 vs 43.5)

7 月 27 日開源承諾:月之暗面在官方公告中明確 7 月 27 日開放完整模型權重。屆時 K3 將成為迄今參數最大的可下載開源模型、首個超 2 萬億參數級別開源權重,以及開源社群訓練/微調新基座;Hugging Face 預計出現 MXFP4/NVFP4 量化版,vLLM、SGLang 等框架第一時間支援。

可引用關鍵資料(EEAT):

  • 參數規模:2.8T 總參數,896 專家啟用 16 個,超越 DeepSeek V4 Pro(1.6T)約 75%(來源:Moonshot AI 官方部落格,2026-07-16)。
  • KDA 效率:百萬 token 上下文 KV 快取減 75%、解碼加速最高 6.3×(來源:Moonshot 技術文件,2026-07-16)。
  • 綜合智慧:Artificial Analysis Intelligence Index v4.1 得分 57.1,開源模型中位列全球第一梯隊(來源:Artificial Analysis,2026-07)。

常見問題 FAQ:

  • Q: Kimi K3 免費嗎? A: kimi.com 免費帳號可用;API 按 $3/$15 per 1M tokens 計費。
  • Q: 能本地跑嗎? A: 7 月 27 日權重發布前不行;發布後需 64+ 加速卡超節點,非消費級硬體。
  • Q: 與 DeepSeek V4 Pro 比? A: K3 參數近 2 倍、上下文 1M vs 128K、多項基準更強,但 DeepSeek 輸出僅 $3.48/M 更便宜。
  • Q: 1M 上下文實用嗎? A: 適合整庫分析、長文件端到端處理、多會話 Agent 長記憶;flat 定價使全視窗使用可行。
  • Q: 低/高推理模式何時來? A: Moonshot 稱 low/high 模式將在後續更新;目前僅 max。

總結:Kimi K3 不是參數堆砌的面子工程——KDA、AttnRes、Stable LatentMoE 是真實工程創新,在程式設計長任務與文件理解等賽道對標乃至超越部分閉源旗艦,定價合理且承諾完整開源。這代表中國 AI 開源生態從「低價換市場」轉向真正挑戰智慧前沿。關注時間節點:7 月 17–20 日 WAIC → 7 月 27 日 K3 完整權重開源。

把 Kimi K3 API 接到本地 OpenClaw / Cursor Agent 時,個人 Mac 休眠會中斷長時 SWE Marathon 類任務,多儲存庫並行也易搶占記憶體與頻寬。對於需要 AI 程式設計 Agent、Kimi Code 工作流或 OpenClaw Gateway 7×24 穩定執行的生產環境,CALMVPS 裸機 Mac Mini 租賃通常是較優解:獨占 Apple Silicon、Metal 原生加速、按月彈性下單,約 120 秒交付,可將重 Agent 迴圈卸載雲端而本機僅做審核。詳見 定價頁