2026 年 7 月 16 日深夜,月之暗面(Moonshot AI)在 API 文档顶部悄然挂出横幅「🎉 Kimi K3 已上线!」——没有大型发布会,却发布了目前全球参数规模最大的开源 AI 模型:2.8 万亿(2.8T)参数、100 万 token 上下文、原生视觉理解,完整权重将于 7 月 27 日 开放。
本文面向正在评估 API 选型、关注开源权重与编程 Agent 能力的 AI 开发者与产品团队,严格依据官方技术博客与定价页,回答三件事:Kimi K3 架构上做了什么真创新、基准与定价相对 Claude Fable 5 / GPT-5.6 Sol 处于什么位置、以及现在就能怎么用起来。
01 Kimi K3 是什么?规格、背景与发布意义
选型前的真实痛点:
- 只看参数量:MoE 稀疏激活下,总参数不等于推理成本,须看激活专家数与上下文效率。
- 忽视 harness 差异:月之暗面自报基准使用 Kimi Code,GPT 用 Codex、Claude 用 Claude Code,横向对比须标注来源。
- 把 1M 上下文当噱头:无 KDA 等架构支撑时,长上下文 KV 缓存成本会吞噬定价优势。
- 等权重开源再评估:7 月 27 日前 API 已可用,生产集成不必等到 Hugging Face 放权重。
Kimi K3 是目前全球参数规模最大的开源 AI 模型——2.8T 参数,超越此前纪录保持者 DeepSeek V4 Pro(1.6T) 近 75%,约为小米开源模型(1.02T)的 2.7 倍、阿里(397B)的 7 倍有余。它采用稀疏 MoE 架构,推理时从 896 个专家中激活 16 个;配合 100 万 token 超长上下文(约等于一次性读完 5 本《红楼梦》全文)与原生视觉理解,专为复杂编程、长文档推理与知识工作设计。
一句话总结: Kimi K3 是开源的、可原生理解图像与视频的、拥有超长记忆的重量级编程 AI,定价比 Claude Opus 4.8 便宜约 40%,完整权重将于 7 月 27 日对外开源。
| 参数 | 数值 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T) |
| 架构 | Kimi Delta Attention + Attention Residuals + Stable LatentMoE |
| 激活专家 | 16 / 896(稀疏度 1.8%) |
| 上下文窗口 | 1,048,576 tokens(1M) |
| 输入模态 | 文本、图像、视频 |
| API 模型 ID | kimi-k3 |
| 推理模式 | 当前仅 max(低/高模式后续更新) |
| 开源权重 | 2026-07-27 Hugging Face |
为什么这次发布意义重大:月之暗面在过去 18 个月经历 DeepSeek 崛起带来的冲击,K3 是一次技术反击——过去 12 个月 Kimi 系列有 9 个月 占据开源模型规模上限;发布时点恰在 2026 世界人工智能大会(WAIC) 开幕前夜;截至 2026 年 6 月 ARR 已突破 3 亿美元,今年完成第 6 轮融资,投前估值 315 亿美元;API 收入占七成以上,海外付费用户增长 400%。这不是情怀堆规模,而是商业化爆发期的技术主权宣示。
02 Kimi K3 架构创新:KDA、AttnRes 与 Stable LatentMoE
多数「最大模型」公告只是加算力;K3 在工程层面引入三项可验证创新,解决长上下文与超稀疏 MoE 训练难题。
3.1 Kimi Delta Attention(KDA)—— 混合线性注意力
传统 Full Attention 在长上下文下 KV 缓存内存呈平方级增长。KDA 以 3:1 比例 交替线性注意力层与全注意力层:3 个线性层处理局部结构(计算廉价),1 个全注意力层保留全局信息流。效果:KV 缓存内存减少高达 75%;百万 token 上下文下解码速度提升高达 6.3 倍;短上下文、长上下文与强化学习扩展场景均超越纯全注意力基线。类比:全注意力像同时记住所有对话细节,KDA 更像高效秘书——平时快速索引,关键时刻精准回忆。
3.2 Attention Residuals(AttnRes)—— 深度选择性检索
标准残差连接沿深度均匀积累,早期层关键表征在深层被稀释。AttnRes 引入选择性检索,模型可跨越深度直接拉取更早层的高价值表征。月之暗面报告约 25% 训练效率提升,额外计算开销不足 2%。
3.3 Stable LatentMoE —— 1.8% 稀疏度稳定训练
| 技术 | 作用 |
|---|---|
| Quantile Balancing | 从路由器得分分位数推导专家分配,消除启发式超参 |
| Per-Head Muon | 针对每个注意力头独立优化,大规模训练更自适应 |
| Sigmoid Tanh Unit(SiTU) | 改进激活函数控制 |
| Gated MLA | 提升注意力选择性 |
综合以上创新,Kimi K3 相较 Kimi K2 整体扩展效率提升约 2.5 倍——相同算力转化出更强智能。模型以 MXFP4 权重与 MXFP8 激活训练,量化感知设计便于 vLLM、SGLang 等框架 Day-0 支持。
03 Kimi K3 基准测试与 API 定价格局
以下为月之暗面自报核心基准(不同模型使用各自推理 harness)。独立第三方复现仍在进行中,请作方向性参考。
| 基准测试 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 13.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | — |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 12.9 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 91.2 |
| MMMU-Pro(视觉) | 81.6 | 81.2 | 83.0 | 78.9 | — |
| OmniDocBench(文档理解) | 91.1 | 89.8 | 85.8 | 87.9 | — |
| HLE-Full | 43.5 | 53.3 | 44.5 | — | — |
解读要点: SWE Marathon(持续性长代码工作)K3 以 42.0 大幅领先;Program Bench 微幅第一(77.8);FrontierSWE 由 Claude Fable 5 领跑(86.6),K3 仍大幅超越 GPT-5.6 Sol(71.3);OmniDocBench 第一体现视觉+长上下文协同。Artificial Analysis Intelligence Index v4.1 中 K3 以 57.1 分排名第四,紧随 Fable 5(59.9)与 GPT-5.6 Sol(58.9),#1 与 #4 差距仅 2.8 分。
| 模型 | 输入 | 输出 | 缓存命中输入 | 上下文 |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Sonnet 5 | $3.00(促销 $2) | $15.00(促销 $10) | — | 200K |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 200K |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
K3 标准价与 Claude Sonnet 5 持平($3/$15),上下文为 5 倍;缓存命中低至 $0.30/M,编程场景缓存命中率超 90%,有效输入成本极低。国内 API:¥20/M 输入、¥100/M 输出、缓存命中 ¥2/M;Kimi.com 免费账号可用 K3,预付费套餐 ¥199 起(优惠截至 8 月 11 日)。相对 Opus 4.8,K3 在多项基准上更优且输入成本约 60%、输出约 40%。
04 Kimi K3 怎么用?四渠道接入与六步落地
四种立即使用方式:
- Kimi 网页/App:访问 kimi.com,支持 Google 账号注册,K3 默认以最大推理力度运行,无需信用卡。
- 官方 API:OpenAI 兼容接口,在 platform.kimi.ai 获取 Key。
- OpenRouter:模型 ID
moonshotai/kimi-k3,官方定价无加价,完整 1M 上下文。 - 等 7 月 27 日权重:Hugging Face 开放完整权重;生产级本地部署需 64 张以上加速卡超节点,非笔记本级任务。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "帮我分析这段代码..."}]
)
以下为主要官方来源,发版或页面更新后请再次打开链接核对:
六步生产落地:
- 注册并开通 API:在 platform.kimi.ai 创建账号、充值并生成 API Key,确认账单区域与合规要求。
- 选择接入路径:直连 Moonshot API 或经 OpenRouter(
moonshotai/kimi-k3)统一路由,按现有 OpenAI SDK 迁移。 - 启用 Prompt 缓存:长代码库与 Agent 循环场景配置缓存键,利用 90%+ 命中率将有效输入成本压至约 $0.55/M(OpenRouter 7 日加权可验证)。
- 规划 1M 上下文用法:整库分析、长法律/研究文档、多轮 Agent 记忆——利用 flat 定价实际吃满窗口,而非截断。
- 混合模型路由:长时编程与文档理解走 K3;复杂 Repo 级修 Bug 可 fallback Claude Fable 5;终端密集型 Agent 可保留 GPT-5.6 Sol。
- 标记 7 月 27 日权重发布:若需自托管或微调,跟进 Hugging Face MXFP4/NVFP4 量化版与 vLLM/SGLang 适配公告。
05 怎么选?开源承诺、FAQ 与总结
| 场景 | 推荐模型 | 原因 |
|---|---|---|
| 持续性长代码任务(SWE Marathon 类) | Kimi K3 | 基准第一,上下文最长 |
| 复杂 Repo 级别修 Bug | Claude Fable 5 | FrontierSWE / SWE-bench Pro 大幅领先 |
| 终端/工具链密集型 Agent | GPT-5.6 Sol | Terminal Bench 与 Coding Agent Index 领先 |
| 超长文档/多模态文档理解 | Kimi K3 | OmniDocBench 第一,原生视觉 + 1M 上下文 |
| 成本敏感场景 | DeepSeek V4 Pro | 输出仅 $3.48/M,远低于 K3 |
| 开源自部署(7/27 后) | Kimi K3 | 最强开源权重,首个超 2T 参数级别 |
| 最深推理研究 | Claude Fable 5 | HLE-Full 大幅领先(53.3 vs 43.5) |
7 月 27 日开源承诺:月之暗面在官方公告中明确 7 月 27 日开放完整模型权重。届时 K3 将成为迄今参数最大的可下载开源模型、首个超 2 万亿参数级别开源权重,以及开源社区训练/微调新基座;Hugging Face 预计出现 MXFP4/NVFP4 量化版,vLLM、SGLang 等框架第一时间支持。
可引用关键数据(EEAT):
- 参数规模:2.8T 总参数,896 专家激活 16 个,超越 DeepSeek V4 Pro(1.6T)约 75%(来源:Moonshot AI 官方博客,2026-07-16)。
- KDA 效率:百万 token 上下文 KV 缓存减 75%、解码加速最高 6.3×(来源:Moonshot 技术文档,2026-07-16)。
- 综合智能:Artificial Analysis Intelligence Index v4.1 得分 57.1,开源模型中位列全球第一梯队(来源:Artificial Analysis,2026-07)。
常见问题 FAQ:
- Q: Kimi K3 免费吗? A: kimi.com 免费账号可用;API 按 $3/$15 per 1M tokens 计费。
- Q: 能本地跑吗? A: 7 月 27 日权重发布前不行;发布后需 64+ 加速卡超节点,非消费级硬件。
- Q: 与 DeepSeek V4 Pro 比? A: K3 参数近 2 倍、上下文 1M vs 128K、多项基准更强,但 DeepSeek 输出仅 $3.48/M 更便宜。
- Q: 1M 上下文实用吗? A: 适合整库分析、长文档端到端处理、多会话 Agent 长记忆;flat 定价使全窗口使用可行。
- Q: 低/高推理模式何时来? A: Moonshot 称 low/high 模式将在后续更新;当前仅 max。
总结:Kimi K3 不是参数堆砌的面子工程——KDA、AttnRes、Stable LatentMoE 是真实工程创新,在编程长任务与文档理解等赛道对标乃至超越部分闭源旗舰,定价合理且承诺完整开源。这代表中国 AI 开源生态从「低价换市场」转向真正挑战智能前沿。关注时间节点:7 月 17–20 日 WAIC → 7 月 27 日 K3 完整权重开源。
把 Kimi K3 API 接到本地 OpenClaw / Cursor Agent 时,个人 Mac 休眠会中断长时 SWE Marathon 类任务,多仓库并行也易争抢内存与网络。对于需要 AI 编程 Agent、Kimi Code 工作流或 OpenClaw Gateway 7×24 稳定运行的生产环境,CALMVPS 裸金属 Mac Mini 租赁通常是更优解:独占 Apple Silicon、Metal 原生加速、按月弹性下单,约 120 秒交付,可将重 Agent 循环卸载云端而本地仅做审核。详见 定价页。