Kimi K3 深度评测:
2.8 万亿参数,国产开源大模型新纪录

2026 年 7 月 16 日深夜,月之暗面(Moonshot AI)在 API 文档顶部悄然挂出横幅「🎉 Kimi K3 已上线!」——没有大型发布会,却发布了目前全球参数规模最大的开源 AI 模型2.8 万亿(2.8T)参数100 万 token 上下文、原生视觉理解,完整权重将于 7 月 27 日 开放。

本文面向正在评估 API 选型、关注开源权重与编程 Agent 能力的 AI 开发者与产品团队,严格依据官方技术博客与定价页,回答三件事:Kimi K3 架构上做了什么真创新、基准与定价相对 Claude Fable 5 / GPT-5.6 Sol 处于什么位置、以及现在就能怎么用起来。

01 Kimi K3 是什么?规格、背景与发布意义

选型前的真实痛点:

  • 只看参数量:MoE 稀疏激活下,总参数不等于推理成本,须看激活专家数与上下文效率。
  • 忽视 harness 差异:月之暗面自报基准使用 Kimi Code,GPT 用 Codex、Claude 用 Claude Code,横向对比须标注来源。
  • 把 1M 上下文当噱头:无 KDA 等架构支撑时,长上下文 KV 缓存成本会吞噬定价优势。
  • 等权重开源再评估:7 月 27 日前 API 已可用,生产集成不必等到 Hugging Face 放权重。

Kimi K3 是目前全球参数规模最大的开源 AI 模型——2.8T 参数,超越此前纪录保持者 DeepSeek V4 Pro(1.6T) 近 75%,约为小米开源模型(1.02T)的 2.7 倍、阿里(397B)的 7 倍有余。它采用稀疏 MoE 架构,推理时从 896 个专家中激活 16 个;配合 100 万 token 超长上下文(约等于一次性读完 5 本《红楼梦》全文)与原生视觉理解,专为复杂编程、长文档推理与知识工作设计。

一句话总结: Kimi K3 是开源的、可原生理解图像与视频的、拥有超长记忆的重量级编程 AI,定价比 Claude Opus 4.8 便宜约 40%,完整权重将于 7 月 27 日对外开源。

Kimi K3 核心规格
参数 数值
总参数量 2.8 万亿(2.8T)
架构 Kimi Delta Attention + Attention Residuals + Stable LatentMoE
激活专家 16 / 896(稀疏度 1.8%)
上下文窗口 1,048,576 tokens(1M)
输入模态 文本、图像、视频
API 模型 ID kimi-k3
推理模式 当前仅 max(低/高模式后续更新)
开源权重 2026-07-27 Hugging Face

为什么这次发布意义重大:月之暗面在过去 18 个月经历 DeepSeek 崛起带来的冲击,K3 是一次技术反击——过去 12 个月 Kimi 系列有 9 个月 占据开源模型规模上限;发布时点恰在 2026 世界人工智能大会(WAIC) 开幕前夜;截至 2026 年 6 月 ARR 已突破 3 亿美元,今年完成第 6 轮融资,投前估值 315 亿美元;API 收入占七成以上,海外付费用户增长 400%。这不是情怀堆规模,而是商业化爆发期的技术主权宣示。

02 Kimi K3 架构创新:KDA、AttnRes 与 Stable LatentMoE

多数「最大模型」公告只是加算力;K3 在工程层面引入三项可验证创新,解决长上下文与超稀疏 MoE 训练难题。

3.1 Kimi Delta Attention(KDA)—— 混合线性注意力

传统 Full Attention 在长上下文下 KV 缓存内存呈平方级增长。KDA 以 3:1 比例 交替线性注意力层与全注意力层:3 个线性层处理局部结构(计算廉价),1 个全注意力层保留全局信息流。效果:KV 缓存内存减少高达 75%;百万 token 上下文下解码速度提升高达 6.3 倍;短上下文、长上下文与强化学习扩展场景均超越纯全注意力基线。类比:全注意力像同时记住所有对话细节,KDA 更像高效秘书——平时快速索引,关键时刻精准回忆。

3.2 Attention Residuals(AttnRes)—— 深度选择性检索

标准残差连接沿深度均匀积累,早期层关键表征在深层被稀释。AttnRes 引入选择性检索,模型可跨越深度直接拉取更早层的高价值表征。月之暗面报告约 25% 训练效率提升,额外计算开销不足 2%。

3.3 Stable LatentMoE —— 1.8% 稀疏度稳定训练

Stable LatentMoE 配套技术
技术 作用
Quantile Balancing 从路由器得分分位数推导专家分配,消除启发式超参
Per-Head Muon 针对每个注意力头独立优化,大规模训练更自适应
Sigmoid Tanh Unit(SiTU) 改进激活函数控制
Gated MLA 提升注意力选择性

综合以上创新,Kimi K3 相较 Kimi K2 整体扩展效率提升约 2.5 倍——相同算力转化出更强智能。模型以 MXFP4 权重与 MXFP8 激活训练,量化感知设计便于 vLLM、SGLang 等框架 Day-0 支持。

03 Kimi K3 基准测试与 API 定价格局

以下为月之暗面自报核心基准(不同模型使用各自推理 harness)。独立第三方复现仍在进行中,请作方向性参考。

编程与 Agent 基准对比
基准测试 Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GLM-5.2
DeepSWE 67.5 70.0 73.0 59.0 46.2
Program Bench 77.8 76.8 77.6 71.9 63.7
Terminal Bench 2.1 88.3 84.6 88.8 84.6 82.7
FrontierSWE 81.2 86.6 71.3 66.7 67.3
SWE Marathon 42.0 35.0 39.0 40.0 13.0
BrowseComp 91.2 88.0 90.4 84.3
Automation Bench 30.8 29.1 29.7 27.2 12.9
GPQA-Diamond 93.5 92.6 94.1 91.0 91.2
MMMU-Pro(视觉) 81.6 81.2 83.0 78.9
OmniDocBench(文档理解) 91.1 89.8 85.8 87.9
HLE-Full 43.5 53.3 44.5

解读要点: SWE Marathon(持续性长代码工作)K3 以 42.0 大幅领先;Program Bench 微幅第一(77.8);FrontierSWE 由 Claude Fable 5 领跑(86.6),K3 仍大幅超越 GPT-5.6 Sol(71.3);OmniDocBench 第一体现视觉+长上下文协同。Artificial Analysis Intelligence Index v4.1 中 K3 以 57.1 分排名第四,紧随 Fable 5(59.9)与 GPT-5.6 Sol(58.9),#1 与 #4 差距仅 2.8 分。

API 定价对比($/M tokens)
模型 输入 输出 缓存命中输入 上下文
Kimi K3 $3.00 $15.00 $0.30 1M
Claude Sonnet 5 $3.00(促销 $2) $15.00(促销 $10) 200K
Claude Opus 4.8 $5.00 $25.00 200K
GPT-5.5 $5.00 $30.00 400K
DeepSeek V4 Pro $1.74 $3.48 $0.145 128K
Kimi K2.6 $0.95 $4.00 $0.16 256K

K3 标准价与 Claude Sonnet 5 持平($3/$15),上下文为 5 倍;缓存命中低至 $0.30/M,编程场景缓存命中率超 90%,有效输入成本极低。国内 API:¥20/M 输入、¥100/M 输出、缓存命中 ¥2/M;Kimi.com 免费账号可用 K3,预付费套餐 ¥199 起(优惠截至 8 月 11 日)。相对 Opus 4.8,K3 在多项基准上更优且输入成本约 60%、输出约 40%。

04 Kimi K3 怎么用?四渠道接入与六步落地

四种立即使用方式:

  • Kimi 网页/App:访问 kimi.com,支持 Google 账号注册,K3 默认以最大推理力度运行,无需信用卡。
  • 官方 API:OpenAI 兼容接口,在 platform.kimi.ai 获取 Key。
  • OpenRouter:模型 ID moonshotai/kimi-k3,官方定价无加价,完整 1M 上下文。
  • 等 7 月 27 日权重:Hugging Face 开放完整权重;生产级本地部署需 64 张以上加速卡超节点,非笔记本级任务。
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "帮我分析这段代码..."}]
)

以下为主要官方来源,发版或页面更新后请再次打开链接核对:

https://kimi.com/blog/kimi-k3

https://platform.kimi.ai

https://kimi.com

六步生产落地:

  1. 注册并开通 API:在 platform.kimi.ai 创建账号、充值并生成 API Key,确认账单区域与合规要求。
  2. 选择接入路径:直连 Moonshot API 或经 OpenRouter(moonshotai/kimi-k3)统一路由,按现有 OpenAI SDK 迁移。
  3. 启用 Prompt 缓存:长代码库与 Agent 循环场景配置缓存键,利用 90%+ 命中率将有效输入成本压至约 $0.55/M(OpenRouter 7 日加权可验证)。
  4. 规划 1M 上下文用法:整库分析、长法律/研究文档、多轮 Agent 记忆——利用 flat 定价实际吃满窗口,而非截断。
  5. 混合模型路由:长时编程与文档理解走 K3;复杂 Repo 级修 Bug 可 fallback Claude Fable 5;终端密集型 Agent 可保留 GPT-5.6 Sol。
  6. 标记 7 月 27 日权重发布:若需自托管或微调,跟进 Hugging Face MXFP4/NVFP4 量化版与 vLLM/SGLang 适配公告。

05 怎么选?开源承诺、FAQ 与总结

场景选型矩阵
场景 推荐模型 原因
持续性长代码任务(SWE Marathon 类) Kimi K3 基准第一,上下文最长
复杂 Repo 级别修 Bug Claude Fable 5 FrontierSWE / SWE-bench Pro 大幅领先
终端/工具链密集型 Agent GPT-5.6 Sol Terminal Bench 与 Coding Agent Index 领先
超长文档/多模态文档理解 Kimi K3 OmniDocBench 第一,原生视觉 + 1M 上下文
成本敏感场景 DeepSeek V4 Pro 输出仅 $3.48/M,远低于 K3
开源自部署(7/27 后) Kimi K3 最强开源权重,首个超 2T 参数级别
最深推理研究 Claude Fable 5 HLE-Full 大幅领先(53.3 vs 43.5)

7 月 27 日开源承诺:月之暗面在官方公告中明确 7 月 27 日开放完整模型权重。届时 K3 将成为迄今参数最大的可下载开源模型、首个超 2 万亿参数级别开源权重,以及开源社区训练/微调新基座;Hugging Face 预计出现 MXFP4/NVFP4 量化版,vLLM、SGLang 等框架第一时间支持。

可引用关键数据(EEAT):

  • 参数规模:2.8T 总参数,896 专家激活 16 个,超越 DeepSeek V4 Pro(1.6T)约 75%(来源:Moonshot AI 官方博客,2026-07-16)。
  • KDA 效率:百万 token 上下文 KV 缓存减 75%、解码加速最高 6.3×(来源:Moonshot 技术文档,2026-07-16)。
  • 综合智能:Artificial Analysis Intelligence Index v4.1 得分 57.1,开源模型中位列全球第一梯队(来源:Artificial Analysis,2026-07)。

常见问题 FAQ:

  • Q: Kimi K3 免费吗? A: kimi.com 免费账号可用;API 按 $3/$15 per 1M tokens 计费。
  • Q: 能本地跑吗? A: 7 月 27 日权重发布前不行;发布后需 64+ 加速卡超节点,非消费级硬件。
  • Q: 与 DeepSeek V4 Pro 比? A: K3 参数近 2 倍、上下文 1M vs 128K、多项基准更强,但 DeepSeek 输出仅 $3.48/M 更便宜。
  • Q: 1M 上下文实用吗? A: 适合整库分析、长文档端到端处理、多会话 Agent 长记忆;flat 定价使全窗口使用可行。
  • Q: 低/高推理模式何时来? A: Moonshot 称 low/high 模式将在后续更新;当前仅 max。

总结:Kimi K3 不是参数堆砌的面子工程——KDA、AttnRes、Stable LatentMoE 是真实工程创新,在编程长任务与文档理解等赛道对标乃至超越部分闭源旗舰,定价合理且承诺完整开源。这代表中国 AI 开源生态从「低价换市场」转向真正挑战智能前沿。关注时间节点:7 月 17–20 日 WAIC → 7 月 27 日 K3 完整权重开源。

把 Kimi K3 API 接到本地 OpenClaw / Cursor Agent 时,个人 Mac 休眠会中断长时 SWE Marathon 类任务,多仓库并行也易争抢内存与网络。对于需要 AI 编程 Agent、Kimi Code 工作流或 OpenClaw Gateway 7×24 稳定运行的生产环境,CALMVPS 裸金属 Mac Mini 租赁通常是更优解:独占 Apple Silicon、Metal 原生加速、按月弹性下单,约 120 秒交付,可将重 Agent 循环卸载云端而本地仅做审核。详见 定价页