Kimi K3 全面开源:
2.8万亿参数、百万上下文,月之暗面这次放了什么大招

7 月 27 日晚 23 点左右,月之暗面(Moonshot AI)正式发布 Kimi K3 完整模型权重与技术报告,并同步开源 MoonEPFlashKDAAgentEnv 三项核心基础设施——这是全球首个被完整开放的 3 万亿参数级别模型,权重约 1.56TB,上线半小时内登顶 Hugging Face 趋势榜第一。

本文面向正在评估 Kimi K3 商用许可、自部署门槛与 API 选型的 AI 开发者与技术决策者,严格依据官方发布与第三方复测数据,回答三件事:K3 到底是「开源」还是「开放权重」、架构与 Infra 创新值不值得跟进、以及现在该怎么接入或规避许可证红线。

01 Kimi K3 从 API 首发到全面开源:11 天时间线与选型痛点

权重落地前的真实痛点:

  • 混淆「开源」与「开放权重」:国内媒体普遍写「开源」,但月之暗面官方从未使用 open source,只称 open weight——企业法务若按 OSI 标准评估会误判合规风险。
  • 忽视许可证两道商业门槛:K3 自定义许可新增 Model-as-a-Service 年收入 2000 万美元门槛与 1 亿月活展示义务,与 K2 时代的 Modified MIT 不同。
  • 只看参数量不看激活成本:2.8T 总参数、896 专家仅激活 16 个,自部署需 64 卡以上超节点,消费级硬件不现实。
  • 把蒸馏争议当噪音:7 月 22–23 日美方指控与 7 月 28 日商务部回应叠加 WAIC 2026 窗口,选型须把地缘政治与工程细节分开评估。

这次全面开源距离 Kimi K3 在 kimi.com 和 API 端首发,只过去了 11 天

  • 7 月 16 日夜(WAIC 2026 前夜):K3 在 kimi.com、Kimi Work、Kimi Code 及 Kimi API 首发,权重尚未公开。官方技术博客标题为《Kimi K3: Open Frontier Intelligence》。
  • 7 月 17 日:行业密集分析架构,新华社报道称其为「目前全球参数最大的开源模型」。
  • 7 月 22–23 日:中美「模型蒸馏」争端升级。白宫科技顾问 Michael Kratsios 指控月之暗面对 Anthropic Fable 模型进行「大规模、隐蔽的工业化蒸馏」;美国财政部长 Scott Bessent 表示将考虑制裁及实体清单限制。
  • 7 月 27 日晚 23 点:正式发布 K3 完整权重、技术报告,开源 MoonEP、AgentEnv(FlashKDA 此前已开源)。
  • 7 月 28 日:中国商务部公开回应,指责美方「AI 霸权主义」;国内媒体跟进报道开源细节。三天后阿里巴巴发布 24 万亿参数的 Qwen3.8-Max-Preview,国产大模型竞争进入「3T 俱乐部」阶段。
Kimi K3 核心参数一览
项目 参数
总参数量 2.8 万亿(2.8T)
激活参数量 约 1040 亿
架构类型 混合专家模型(MoE)
专家配置 896 个路由专家,每 token 激活 16 个(另有共享专家)
注意力机制 Kimi Delta Attention(KDA)+ 门控多头潜在注意力(Gated MLA)
上下文窗口 100 万 token
多模态能力 原生视觉理解(ViT-V2,27 层)
权重格式 MXFP4 权重 + MXFP8 激活(SFT 阶段起量化感知训练)
权重体积 约 1.56TB(Hugging Face)
License 自定义许可证(官方称 open weight,非 open source)

02 Kimi K3 架构创新:KDA、AttnRes 与三大 Infra 开源

Kimi K3 重构了深度学习沿用多年的三大传统组件——注意力机制、残差连接、优化器,这也是它区别于「简单堆参数」的关键。

Kimi Delta Attention(KDA):传统 Gated DeltaNet 使用标量级遗忘门;KDA 改为逐通道门控,每个特征维度拥有独立衰减率。采用 chunkwise Diagonal-Plus-Low-Rank(DPLR)公式实现线性时间递归,K3 将 KDA 与少量 Gated MLA 全局注意力层交替混合,支撑 100 万 token 上下文同时把 KV Cache 开销压到极低。

Attention Residuals(AttnRes):传统残差连接逐层均匀累加,深层易稀释早期信息。AttnRes 改为选择性、依据输入动态聚合前面所有层输出,每层仅新增一个 RMSNorm 和一个伪查询向量,带来约 25% 训练效率提升,代价不到 2%。

Per-Head Muon:让每个注意力头独立优化,自适应收敛路径;纯训练期技术,API 调用无感知,但堆叠细节让 K3 以更少激活参数打出接近顶尖闭源模型的效果。

Stable LatentMoE:896 选 16 的稀疏艺术(稀疏度约 1.8%),配合 Quantile Balancing 均衡策略与 MoonEP,从数学上证明每个计算节点冗余专家数的理论上界。

月之暗面没有只发权重文件,而是把支撑 K3 训练效率的三项关键基础设施一并开源:

三大开源 Infra 技术
技术 定位 关键能力
MoonEP 超大规模细粒度 MoE 高性能通信库 临时复制过载专家,保证每节点均等 token 数;证明冗余专家数理论上界,负载不均衡时仍维持高通信效率
FlashKDA 基于 NVIDIA CUTLASS 的 KDA 高性能算子(此前已开源) NVIDIA H20 上 prefill 较 flash-linear-attention 基线快 1.72–2.22 倍;可作为 chunk_kda 直接替代后端
AgentEnv 与 KVCache.ai 联合开发的 Agent 沙箱(Firecracker microVM) 面向大规模并行 Agent RL 训练;官方披露 checkpoint 延迟低至 133ms、恢复 49ms、内存超分最高 6.5 倍(尚未经第三方独立复现)

综合架构与 Infra 开源,月之暗面此次发布在开发者社区获得较高评价——不只是甩权重,而是整套工程能力对外开放。

03 Kimi K3 跑分怎么样?开放权重许可证的两道商业门槛

以下优先引用独立第三方复测数据,厂商自报数据单独标注。

SWE-bench Verified(独立复测,Vals AI,截至 2026 年 7 月)
模型 分数 发布日期
Claude Opus 5 97% 2026-07-24
GPT-5.6 Sol 96.2% 2026-07-09
Claude Fable 5 95% 2026-06-09
Kimi K3 93.4% 2026-07-16
Qwen3.7-Max 79.4% 2026-05-19
DeepSeek-V4 76.2% 2026-04-23

Artificial Analysis 智能指数(max 推理档):Claude Fable 5(max + fallback)60;GPT-5.6 Sol(max)59;Kimi K3(max)约 57,全球第 3、开源模型第 1;GLM-5.2(max)51;DeepSeek V4 Pro(max)44。K3 每任务成本约 $0.95,比 Claude Fable 5(约 $2.4/任务)便宜约 60%,但比 GLM-5.2(约 $0.47/任务)更贵——开源阵营能力天花板最高,而非性价比最优。K3 目前在 Arena.ai Frontend Code Arena 榜单排名第一。

开放权重 vs 开源:按 OSI 标准,真正开源需公开训练数据、训练代码与完整可复现流程;K3 只公开权重、技术报告与推理 Infra,训练数据与完整训练代码未公开。许可证也不再自称 Modified MIT,而是一份完全自定义文件,含两道商业门槛:

  • Model-as-a-Service 收入门槛:若被许可方运营「模型即服务」业务,且连续 12 个月累计收入超过 2000 万美元,须与月之暗面另行签署商业协议。
  • 规模展示门槛:若产品月活超过 1 亿,或月收入超过 2000 万美元,须在界面显著展示「Kimi K3」字样。

对绝大多数中小团队,两道门槛几乎不会触发;但若商业计划是「拿 K3 开与月之暗面竞争的模型服务」,第一道门槛是法务重点红线。

Kimi K3 API 定价(每百万 token)
Token 类型 价格
输入(缓存命中) $0.30
输入(缓存未命中) $3.00
输出(含推理过程) $15.00

Mooncake 分离式推理架构在典型编程工作负载上缓存命中率可达 90% 以上,实际成本更接近 $0.30 档。自部署方面,官方建议 64 卡及以上超节点;个人与中小团队更现实的路径是官方 API 或 OpenRouter(目前已有 7 家服务商上线)。

04 Kimi K3 怎么用?API 接入与六步生产落地

月之暗面提供 OpenAI SDK 兼容的 Chat Completions API,模型 ID 为 kimi-k3,大部分现有项目只需改 base URL 和密钥即可接入。

kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "分析这段代码..."}]
)

以下为主要官方来源,发版或页面更新后请再次打开链接核对:

https://kimi.com/blog/kimi-k3

https://api.moonshot.ai/v1

https://huggingface.co/moonshotai

六步生产落地:

  1. 厘清许可边界:确认业务不属于 MaaS 年收入超 2000 万美元或月活超 1 亿场景;若接近阈值,提前与法务评估自定义许可条款。
  2. 选择接入路径:直连 Moonshot API(https://api.moonshot.ai/v1)或经 OpenRouter(moonshotai/kimi-k3)统一路由,按 OpenAI SDK 迁移。
  3. 启用 Prompt 缓存:长代码库与 Agent 循环场景配置缓存键,利用 90%+ 命中率将有效输入成本压至约 $0.30/M。
  4. 评估自部署 vs API:1.56TB 权重需 64 卡超节点;除非有现成集群,否则 API 或第三方托管更现实。
  5. 混合模型路由:长时编程与文档理解走 K3;复杂 Repo 修 Bug 可 fallback Claude Fable 5;终端密集型 Agent 可保留 GPT-5.6 Sol。
  6. 跟进 Infra 开源:若做 MoE 训练或 Agent RL,评估 MoonEP、FlashKDA、AgentEnv 与现有栈的集成;发版后请再次核对 GitHub 仓库。

05 可引用数据、FAQ 与总结

可引用关键数据(EEAT):

  • 参数规模:2.8T 总参数、896 专家激活 16 个,全球首个完整开放的 3T 级模型(来源:Moonshot AI 官方博客,2026-07-27)。
  • SWE-bench Verified:独立复测 93.4%,开源模型阵营领先,仅次于 Claude Opus 5 / GPT-5.6 Sol / Claude Fable 5(来源:Vals AI,2026-07)。
  • FlashKDA 加速:NVIDIA H20 上 prefill 较基线快 1.72–2.22 倍(来源:Moonshot GitHub FlashKDA,发版后请核对)。

常见问题 FAQ:

  • Q: Kimi K3 真的是开源模型吗? A: 严格来说不是。属于「开放权重」:权重、技术报告与部分 Infra 公开,训练数据与完整训练代码未公开,不符合 OSI「开源」定义。
  • Q: Kimi K3 可以免费商用吗? A: 绝大多数商业场景不受限制;MaaS 年收入超 2000 万美元或月活超 1 亿/月收入超 2000 万美元须满足许可特定条款。
  • Q: 需要多少显卡才能自部署? A: 官方建议 64 卡及以上超节点;个人与大部分企业更现实的方式是 API 或 OpenRouter。
  • Q: 性能到底强不强? A: 开源阵营综合能力最强,AA 指数全球第 3;但成本高于 GLM-5.2,属能力天花板而非性价比最优。
  • Q: 和 Kimi K2 有什么区别? A: K3 参数约为 K2.5 的 3 倍,新增 AttnRes 与 Per-Head Muon,上下文与多模态大幅提升;许可新增 MaaS 收入门槛,商业限制更细化。

总结:Kimi K3 全面开放权重是国产大模型「3T 俱乐部」的里程碑——工程细节(KDA、AttnRes、MoonEP)与 geopolitics 背景交织,但对企业用户而言,先读懂开放权重许可、再选 API 或托管路径,比盲目下载 1.56TB 权重更务实。

把 Kimi K3 接到本地 Agent 工作流时,个人 Mac 休眠会中断长时编程任务,自部署 64 卡集群成本对个人开发者更不现实。对于需要 AI 编程 Agent、Kimi Code 工作流或 OpenClaw Gateway 7×24 稳定运行的生产环境,CALMVPS 裸金属 Mac Mini 租赁通常是更优解:独占 Apple Silicon、Metal 原生加速、按月弹性下单,约 120 秒交付,将重 Agent 循环卸载云端而本地仅做审核。详见 定价页