2026 年 7 月 16 日深夜,月之暗面(Moonshot AI)在 API 文件頂部悄然掛出橫幅「Kimi K3 已上線!」——沒有大型發布會,卻發布了目前全球參數規模最大的開源 AI 模型:2.8 萬億(2.8T)參數、100 萬 token 上下文、原生視覺理解,完整權重將於 7 月 27 日 開放。
本文面向正在評估 API 選型、關注開源權重與程式設計 Agent 能力的 AI 開發者與產品團隊,嚴格依據官方技術部落格與定價頁,回答三件事:Kimi K3 架構上做了什麼真創新、基準與定價相對 Claude Fable 5 / GPT-5.6 Sol 處於什麼位置、以及現在就能怎麼用起來。
01 Kimi K3 是什麼?規格、背景與發布意義
選型前的真實痛點:
- 只看參數量:MoE 稀疏啟用下,總參數不等於推理成本,須看啟用專家數與上下文效率。
- 忽視 harness 差異:月之暗面自報基準使用 Kimi Code,GPT 用 Codex、Claude 用 Claude Code,橫向對比須標註來源。
- 把 1M 上下文當噱頭:無 KDA 等架構支撐時,長上下文 KV 快取成本會吞噬定價優勢。
- 等權重開源再評估:7 月 27 日前 API 已可用,生產整合不必等到 Hugging Face 放權重。
Kimi K3 是目前全球參數規模最大的開源 AI 模型——2.8T 參數,超越此前紀錄保持者 DeepSeek V4 Pro(1.6T) 近 75%,約為小米開源模型(1.02T)的 2.7 倍、阿里(397B)的 7 倍有餘。它採用稀疏 MoE 架構,推理時從 896 個專家中啟用 16 個;配合 100 萬 token 超長上下文(約等於一次性讀完 5 本《紅樓夢》全文)與原生視覺理解,專為複雜程式設計、長文件推理與知識工作設計。
一句話總結: Kimi K3 是開源的、可原生理解影像與影片的、擁有超長記憶的重量級程式設計 AI,定價比 Claude Opus 4.8 便宜約 40%,完整權重將於 7 月 27 日對外開源。
| 參數 | 數值 |
|---|---|
| 總參數量 | 2.8 萬億(2.8T) |
| 架構 | Kimi Delta Attention + Attention Residuals + Stable LatentMoE |
| 啟用專家 | 16 / 896(稀疏度 1.8%) |
| 上下文視窗 | 1,048,576 tokens(1M) |
| 輸入模態 | 文字、影像、影片 |
| API 模型 ID | kimi-k3 |
| 推理模式 | 目前僅 max(低/高模式後續更新) |
| 開源權重 | 2026-07-27 Hugging Face |
為什麼這次發布意義重大:月之暗面在過去 18 個月經歷 DeepSeek 崛起帶來的衝擊,K3 是一次技術反擊——過去 12 個月 Kimi 系列有 9 個月 佔據開源模型規模上限;發布時點恰在 2026 世界人工智慧大會(WAIC) 開幕前夜;截至 2026 年 6 月 ARR 已突破 3 億美元,今年完成第 6 輪融資,投前估值 315 億美元;API 收入佔七成以上,海外付費使用者成長 400%。這不是情懷堆規模,而是商業化爆發期的技術主權宣示。
02 Kimi K3 架構創新:KDA、AttnRes 與 Stable LatentMoE
多數「最大模型」公告只是加算力;K3 在工程層面引入三項可驗證創新,解決長上下文與超稀疏 MoE 訓練難題。
3.1 Kimi Delta Attention(KDA)—— 混合線性注意力
傳統 Full Attention 在長上下文下 KV 快取記憶體呈平方級成長。KDA 以 3:1 比例 交替線性注意力層與全注意力層:3 個線性層處理局部結構(計算廉價),1 個全注意力層保留全域資訊流。效果:KV 快取記憶體減少高達 75%;百萬 token 上下文下解碼速度提升高達 6.3 倍;短上下文、長上下文與強化學習擴展場景均超越純全注意力基線。類比:全注意力像同時記住所有對話細節,KDA 更像高效秘書——平時快速索引,關鍵時刻精準回憶。
3.2 Attention Residuals(AttnRes)—— 深度選擇性檢索
標準殘差連接沿深度均勻累積,早期層關鍵表徵在深層被稀釋。AttnRes 引入選擇性檢索,模型可跨越深度直接拉取更早層的高價值表徵。月之暗面報告約 25% 訓練效率提升,額外計算開銷不足 2%。
3.3 Stable LatentMoE —— 1.8% 稀疏度穩定訓練
| 技術 | 作用 |
|---|---|
| Quantile Balancing | 從路由器得分分位數推導專家分配,消除啟發式超參 |
| Per-Head Muon | 針對每個注意力頭獨立最佳化,大規模訓練更自適應 |
| Sigmoid Tanh Unit(SiTU) | 改進啟用函數控制 |
| Gated MLA | 提升注意力選擇性 |
綜合以上創新,Kimi K3 相較 Kimi K2 整體擴展效率提升約 2.5 倍——相同算力轉化出更強智慧。模型以 MXFP4 權重與 MXFP8 啟用訓練,量化感知設計便於 vLLM、SGLang 等框架 Day-0 支援。
03 Kimi K3 基準測試與 API 定價格局
以下為月之暗面自報核心基準(不同模型使用各自推理 harness)。獨立第三方複現仍在進行中,請作方向性參考。
| 基準測試 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 13.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | — |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 12.9 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 91.2 |
| MMMU-Pro(視覺) | 81.6 | 81.2 | 83.0 | 78.9 | — |
| OmniDocBench(文件理解) | 91.1 | 89.8 | 85.8 | 87.9 | — |
| HLE-Full | 43.5 | 53.3 | 44.5 | — | — |
解讀要點: SWE Marathon(持續性長程式碼工作)K3 以 42.0 大幅領先;Program Bench 微幅第一(77.8);FrontierSWE 由 Claude Fable 5 領跑(86.6),K3 仍大幅超越 GPT-5.6 Sol(71.3);OmniDocBench 第一體現視覺+長上下文協同。Artificial Analysis Intelligence Index v4.1 中 K3 以 57.1 分排名第四,緊隨 Fable 5(59.9)與 GPT-5.6 Sol(58.9),#1 與 #4 差距僅 2.8 分。
| 模型 | 輸入 | 輸出 | 快取命中輸入 | 上下文 |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Sonnet 5 | $3.00(促銷 $2) | $15.00(促銷 $10) | — | 200K |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 200K |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
K3 標準價與 Claude Sonnet 5 持平($3/$15),上下文為 5 倍;快取命中低至 $0.30/M,程式設計場景快取命中率超 90%,有效輸入成本極低。中國大陸 API:¥20/M 輸入、¥100/M 輸出、快取命中 ¥2/M;Kimi.com 免費帳號可用 K3,預付費套餐 ¥199 起(優惠截至 8 月 11 日)。相對 Opus 4.8,K3 在多項基準上更優且輸入成本約 60%、輸出約 40%。
04 Kimi K3 怎麼用?四渠道接入與六步落地
四種立即使用方式:
- Kimi 網頁/App:造訪 kimi.com,支援 Google 帳號註冊,K3 預設以最大推理力度執行,無需信用卡。
- 官方 API:OpenAI 相容介面,在 platform.kimi.ai 取得 Key。
- OpenRouter:模型 ID
moonshotai/kimi-k3,官方定價無加價,完整 1M 上下文。 - 等 7 月 27 日權重:Hugging Face 開放完整權重;生產級本地部署需 64 張以上加速卡超節點,非筆電級任務。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "幫我分析這段程式碼..."}]
)
以下為主要官方來源,發版或頁面更新後請再次開啟連結核對:
六步生產落地:
- 註冊並開通 API:在 platform.kimi.ai 建立帳號、儲值並產生 API Key,確認帳單區域與合規要求。
- 選擇接入路徑:直連 Moonshot API 或經 OpenRouter(
moonshotai/kimi-k3)統一路由,按現有 OpenAI SDK 遷移。 - 啟用 Prompt 快取:長程式碼庫與 Agent 迴圈場景設定快取鍵,利用 90%+ 命中率將有效輸入成本壓至約 $0.55/M(OpenRouter 7 日加權可驗證)。
- 規劃 1M 上下文用法:整庫分析、長法律/研究文件、多輪 Agent 記憶——利用 flat 定價實際吃滿視窗,而非截斷。
- 混合模型路由:長時程式設計與文件理解走 K3;複雜 Repo 級修 Bug 可 fallback Claude Fable 5;終端機密集型 Agent 可保留 GPT-5.6 Sol。
- 標記 7 月 27 日權重發布:若需自託管或微調,跟進 Hugging Face MXFP4/NVFP4 量化版與 vLLM/SGLang 適配公告。
05 怎麼選?開源承諾、FAQ 與總結
| 場景 | 推薦模型 | 原因 |
|---|---|---|
| 持續性長程式碼任務(SWE Marathon 類) | Kimi K3 | 基準第一,上下文最長 |
| 複雜 Repo 級別修 Bug | Claude Fable 5 | FrontierSWE / SWE-bench Pro 大幅領先 |
| 終端機/工具鏈密集型 Agent | GPT-5.6 Sol | Terminal Bench 與 Coding Agent Index 領先 |
| 超長文件/多模態文件理解 | Kimi K3 | OmniDocBench 第一,原生視覺 + 1M 上下文 |
| 成本敏感場景 | DeepSeek V4 Pro | 輸出僅 $3.48/M,遠低於 K3 |
| 開源自部署(7/27 後) | Kimi K3 | 最強開源權重,首個超 2T 參數級別 |
| 最深推理研究 | Claude Fable 5 | HLE-Full 大幅領先(53.3 vs 43.5) |
7 月 27 日開源承諾:月之暗面在官方公告中明確 7 月 27 日開放完整模型權重。屆時 K3 將成為迄今參數最大的可下載開源模型、首個超 2 萬億參數級別開源權重,以及開源社群訓練/微調新基座;Hugging Face 預計出現 MXFP4/NVFP4 量化版,vLLM、SGLang 等框架第一時間支援。
可引用關鍵資料(EEAT):
- 參數規模:2.8T 總參數,896 專家啟用 16 個,超越 DeepSeek V4 Pro(1.6T)約 75%(來源:Moonshot AI 官方部落格,2026-07-16)。
- KDA 效率:百萬 token 上下文 KV 快取減 75%、解碼加速最高 6.3×(來源:Moonshot 技術文件,2026-07-16)。
- 綜合智慧:Artificial Analysis Intelligence Index v4.1 得分 57.1,開源模型中位列全球第一梯隊(來源:Artificial Analysis,2026-07)。
常見問題 FAQ:
- Q: Kimi K3 免費嗎? A: kimi.com 免費帳號可用;API 按 $3/$15 per 1M tokens 計費。
- Q: 能本地跑嗎? A: 7 月 27 日權重發布前不行;發布後需 64+ 加速卡超節點,非消費級硬體。
- Q: 與 DeepSeek V4 Pro 比? A: K3 參數近 2 倍、上下文 1M vs 128K、多項基準更強,但 DeepSeek 輸出僅 $3.48/M 更便宜。
- Q: 1M 上下文實用嗎? A: 適合整庫分析、長文件端到端處理、多會話 Agent 長記憶;flat 定價使全視窗使用可行。
- Q: 低/高推理模式何時來? A: Moonshot 稱 low/high 模式將在後續更新;目前僅 max。
總結:Kimi K3 不是參數堆砌的面子工程——KDA、AttnRes、Stable LatentMoE 是真實工程創新,在程式設計長任務與文件理解等賽道對標乃至超越部分閉源旗艦,定價合理且承諾完整開源。這代表中國 AI 開源生態從「低價換市場」轉向真正挑戰智慧前沿。關注時間節點:7 月 17–20 日 WAIC → 7 月 27 日 K3 完整權重開源。
把 Kimi K3 API 接到本地 OpenClaw / Cursor Agent 時,個人 Mac 休眠會中斷長時 SWE Marathon 類任務,多儲存庫並行也易搶占記憶體與頻寬。對於需要 AI 程式設計 Agent、Kimi Code 工作流或 OpenClaw Gateway 7×24 穩定執行的生產環境,CALMVPS 裸機 Mac Mini 租賃通常是較優解:獨占 Apple Silicon、Metal 原生加速、按月彈性下單,約 120 秒交付,可將重 Agent 迴圈卸載雲端而本機僅做審核。詳見 定價頁。