马斯克7月28日在X上回复 Vercel CEO Guillermo Rauch 时透露,xAI 将于8月7日前后发布参数规模达1.5万亿的 Grok 4.6,随后几周内还会推出 2.1 万亿参数的 Grok 4.7。这距离上一代 Grok 4.5 发布仅一个月,意味着 xAI 在今年夏天要连续推出三款前沿模型。
本文面向正在评估 Agent 编程工具、关注 xAI 路线图的技术团队,严格依据马斯克公开表态与行业报道整理时间线、参数对比与争议点,并明确标注未证实信息。读完后你将弄清:Grok 4.6/4.7 各自定位、与 Kimi K3 的竞争关系,以及发布前该如何做选型准备。
01 从 Grok 4.5 到 4.6、4.7:时间线有多快?
发布前的真实痛点:
- 信息源单一:目前 Grok 4.6/4.7 细节仅来自马斯克一条 X 回复,xAI 官方博客尚未同步公告。
- 「Musk time」弹性:马斯克历史时间表常延后数天至两周,不能把「约8月7日」当硬承诺。
- 竞品节奏压缩选型窗口:Kimi K3 7月26日全面开源后,Grok 4.6 目标发布仅隔约10天,上一代旗舰可能刚上线就要面对新一代。
- 基准与定价全空白:与 Grok 4.5 发布时详尽的模型卡不同,4.6 目前没有任何独立测评佐证。
- 2026年7月8日:xAI 正式发布 Grok 4.5,定位为「专为编程与智能体任务打造」的旗舰模型,与 Cursor 合作、使用真实开发者会话数据训练,支持 50 万 token 上下文,定价为每百万 token 输入 $2 / 输出 $6。
- 2026年7月16日:竞品 Moonshot AI 的 Kimi K3 以托管服务形式上线,随后在 7 月 26 日提前一天放出完整开源权重,2.8 万亿参数、100 万 token 上下文。
- 2026年7月28日:马斯克在回复 Rauch 的帖子中首次公开 Grok 4.6 和 4.7 的路线图与大致时间表——这也是本文信息的主要来源。同一天,OpenAI、Anthropic 等公司 1200 余名员工联署「Pacing the Frontier」公开信,呼吁建立主动放缓前沿 AI 发展的治理工具。
- 2026年8月7日前后(目标):Grok 4.6 计划发布,1.5 万亿参数,重点在 SFT(监督微调)和 RL(强化学习)层面的升级,而非单纯堆参数。
- 2026年8月末至9月初(预估):Grok 4.7 计划跟进,2.1 万亿参数,马斯克称其「除了推理速度稍慢外,其他方面全面优于 4.6,且 token 效率更高」。
需要提醒的是,马斯克给出的时间表历来存在弹性——业内常称之为「Musk time」,实际发布日期比预告晚几天到两周并不罕见,发布前建议以 xAI 官方账号或官网公告为准。
02 核心数据一览与横向竞品对比
| 模型 | 发布/目标时间 | 参数规模 | 定位重点 | 状态 |
|---|---|---|---|---|
| Grok 4.3 Beta | 2026年4月17日 | 未公开 | 上一代基线 | 已发布 |
| Grok 4.5 | 2026年7月8日 | 未公开(非 MoE 单一 SKU) | 编程与智能体任务,与 Cursor 联合训练 | 已发布 |
| Grok 4.6 | 约2026年8月7日 | 1.5万亿 | SFT/RL 大幅升级 | 官方预告,未发布 |
| Grok 4.7 | 约8月末-9月初 | 2.1万亿 | 全面优于 4.6,token 效率更高 | 官方预告,未发布 |
注:参数规模、定价、基准分数均为厂商/马斯克自述,Grok 4.6 与 4.7 目前均未有第三方独立评测数据,表中「官方预告」信息务必以正式发布为准。
| 模型 | 厂商 | 参数规模 | 上下文窗口 | 定价(输入/输出,每百万 token) |
|---|---|---|---|---|
| Grok 4.5 | xAI | 未公开 | 50万 token | $2 / $6 |
| Grok 4.6(预告) | xAI | 1.5万亿 | 未公开 | 未公开 |
| Kimi K3 | 月之暗面 | 2.8万亿(MoE,激活约16/896专家) | 100万 token | $0.30(缓存命中)/$3 输入,$15 输出 |
| Claude Fable 5.1(传闻) | Anthropic | 未公开 | 未公开 | 传闻维持 Fable 5 定价($10/$50) |
| GPT-5.6 Sol | OpenAI | 未公开 | 未公开 | 未公开 |
表格中 Grok 4.6、Claude Fable 5.1 相关数据均为预告或传闻,不构成正式基准对比,仅供参考发布节奏和大致定位。
03 深度拆解:这次升级的重点不是「更大」,而是「更会学」
SFT 和 RL 到底在解决什么问题
监督微调(SFT)是用人工标注或精选的高质量样本去纠正模型的输出习惯;强化学习(RL)则是用奖励信号让模型在真实任务链路中学会「怎么做才对」,尤其是多步骤的智能体任务。马斯克特意强调 Grok 4.6 的升级重点在「SFT & RL」而非参数规模本身,这与 Grok 4.5 的打法是延续的——Grok 4.5 当时凭借与 Cursor 合作获取的真实开发者会话数据,在保持较小输出 token 消耗的情况下拿到了 Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7% 的成绩,处理同类任务所用的输出 token 数量远低于 Claude Opus 4.8(约 1.9 万 token 对 6.7 万 token)。
为什么 xAI 选择「参数堆量 + 后训练精修」两条腿走路
Grok 4.6 的 1.5 万亿参数相比 Grok 4.5 是明显的规模跃升,但马斯克没有回避「参数不是唯一变量」这一点——他随后补充说 Grok 4.7 会更大(2.1 万亿)却「推理稍慢」,暗示 xAI 内部很清楚参数规模和推理速度之间存在权衡,未来会用两款不同定位的模型分别满足「更强」和「更快」的需求,而不是用一个模型通吃所有场景。
与 Kimi K3 同期竞争带来的现实压力
Grok 4.6 的发布时间表恰好卡在 Kimi K3 全面开源引发行业震动之后的第 10 天左右。Kimi K3 在 Frontend Code Arena 编程榜单上以 1679 分登顶,成为首个超越所有闭源模型的开源模型,Artificial Analysis 智能指数综合排名全球第三。马斯克本人也在 Kimi K3 相关评测下留言称「令人印象深刻」。业内普遍解读,xAI 加快 Grok 4.6/4.7 发布节奏,与 OpenAI、Anthropic 及中国厂商的竞争烈度上升直接相关。
争议点与需要注意的细节
- 时间表本身未经第三方验证:目前唯一信息源是马斯克在 X 上的一条回复贴,xAI 官方博客和产品页尚未同步公告。
- 基准分数与定价全部空白:「1.5 万亿参数」和「SFT/RL 大幅升级」目前都是厂商单方面说法。
- xAI 近期的内容安全争议:7 月 xAI 对一名用户提起诉讼,指控其利用 Grok 绕过安全限制生成 CSAM,这也是 xAI 首次就 AI 生成的深度伪造内容起诉用户。今年 1 月,Common Sense Media 的报告曾将 Grok 评为「未成年人保护最差的 AI 产品之一」。
- 与行业「减速」呼吁的错位:7 月 28 日马斯克发布路线图同一天,「Pacing the Frontier」公开信获 OpenAI 与 Anthropic 公司背书,xAI 未出现在签署名单中。
如果马斯克的时间表成立,Grok 4.6、Grok 4.7 将与传闻中的 Claude Fable 5.1(据 36kr、WinCentral 等多方爆料指向 8 月)在同一个月内相继登场,叠加 7 月已经开源的 Kimi K3 带来的冲击,2026 年 8 月很可能成为大模型发布密度最高的月份之一。对开发者和企业用户而言,性价比和 token 效率(而非单纯的参数规模或跑分)会是更实际的决策依据。
04 Grok 4.6 发布前怎么做?六步落地准备
在 Grok 4.6 正式公布模型卡与定价之前,工程团队可以先把基础设施与选型框架搭好,避免发布当周被动追热点。
curl -s https://api.x.ai/v1/models \
-H "Authorization: Bearer $XAI_API_KEY" \
| jq '.data[].id'
以下为主要官方来源,发版或页面更新后请再次打开链接核对:
https://docs.x.ai/developers/models
六步落地准备:
- 锁定官方信息源:关注 xAI 官方 X 账号(@xai)、x.ai/blog 与 console.x.ai 公告页;马斯克个人表态仅作参考,以 xAI 正式模型卡为准。
- 建立 Grok 4.5 成本基线:统计当前 Agent 工作流在 Grok 4.5 上的每任务 Token 消耗与美元成本(参考 $2/$6 定价),为 4.6 涨价或降价留出对比空间。
- 更新竞品选型矩阵:将 Kimi K3(2.8T 开放权重)、Claude Fable 5.1(传闻)、GPT-5.6 Sol 纳入同一张对照表,按编程、长上下文、定价三维度打分。
- 在 Cursor / Grok Build 预留路由位:在 LiteLLM 或 Cursor 模型列表中预留
grok-4.6槽位,发布当日只需改 model ID 即可 A/B 测试。 - 制定发布日验证清单:模型卡到手后逐项核对——上下文窗口、SWE-Bench/Terminal-Bench 分数、输入输出定价、是否支持 Responses API 缓存。
- 准备 7×24 Agent 基础设施:长时编程 Agent 与 OpenClaw Gateway 需要不休眠的常驻节点;本地 Mac 休眠会中断 Grok API 长循环,提前规划云端裸金属方案。
05 可引用数据、FAQ 与总结
可引用关键数据(EEAT):
- Grok 4.6 目标参数:1.5 万亿,重点 SFT/RL 后训练升级(来源:马斯克 2026-07-28 X 回复 @rauchg,未经 xAI 官方模型卡验证)。
- Grok 4.7 目标参数:2.1 万亿,马斯克称其全面优于 4.6 但推理稍慢、token 效率更高(来源:同上,预估 8 月末至 9 月初)。
- Grok 4.5 Token 效率参照:SWE-Bench Pro 单次输出约 15,954 token vs Opus 4.8 约 67,020 token,差距 4.2×(来源:xAI Grok 4.5 模型卡,2026-07-08)。
常见问题 FAQ:
- Q:Grok 4.6 具体是哪天发布? A:马斯克表示「大约 8 月 7 日」,但这是非正式表态,并非 xAI 官方确认的发布日期,实际时间可能提前或延后。
- Q:Grok 4.6 和 Grok 4.7 有什么区别? A:Grok 4.6 为 1.5 万亿参数,重点是 SFT 与 RL 后训练升级;Grok 4.7 为 2.1 万亿参数,预计在 4.6 发布后「几周」跟进,马斯克称其能力全面优于 4.6,但推理速度略慢,token 效率更高。
- Q:Grok 4.6 会比 Kimi K3 或 Claude Fable 5.1 更强吗? A:目前无法判断。Grok 4.6 没有任何公开基准分数,Kimi K3 已有实测数据且在部分编程榜单上表现突出,Claude Fable 5.1 本身尚未被 Anthropic 官方确认发布,三者暂无法直接对比。
- Q:Grok 4.6 大概会怎么定价? A:官方未公布。可参考 Grok 4.5 的定价(输入 $2/输出 $6,每百万 token)作为大致区间,但新一代模型定价可能调整,务必以正式发布信息为准。
- Q:普通用户届时能在哪里用上 Grok 4.6? A:按 Grok 4.5 的分发路径推测,大概率会先上线 Grok Build、xAI 官方 API 和控制台,随后逐步接入更多第三方平台,但具体入口以正式发布公告为准。
总结:Grok 4.6 是 xAI 在 Kimi K3 开源冲击后加速迭代的信号——1.5 万亿参数 + SFT/RL 精修的双轨策略值得跟踪,但在官方模型卡落地前,任何性能判断都应标注「未证实」。8 月扎堆发布意味着选型窗口极短,提前搭好成本基线与路由框架比追逐参数数字更务实。
以下为主要来源,发版或页面更新后请再次打开链接核对:
https://github.com/moonshotai/Kimi-K3
把 Grok Agent 工作流跑在个人 Mac 上仍有硬伤:休眠中断长循环、多仓库并行争抢本地资源、难以 7×24 常驻。对于需要 Cursor Agent、Grok Build 或 OpenClaw Gateway 稳定运行的生产环境,CALMVPS 裸金属 Mac Mini 租赁通常是更优解:独占 Apple Silicon、Metal 原生加速、按月弹性下单,约 120 秒交付,将重 Agent 循环卸载云端而本地仅做审核。详见 定价页。