2026 年 7 月 8 日,马斯克旗下 SpaceXAI 正式发布 Grok 4.5——上市后推出的第一款旗舰产品。马斯克在 X 上喊话:「这是一款 Opus 级别的模型,但速度更快、Token 效率更高、成本更低。」
本文面向正在评估 AI 编程助手、Cursor 用户与预算敏感的工程团队,严格梳理公开 benchmark、TryAI 独立测评、API 定价与平台接入方式,回答三件事:Grok 4.5 到底强在哪、弱在哪、以及「便宜 4 倍」是不是算术而非营销。
01 Grok 4.5 是什么?Cursor 联合训练与核心规格一览
选型前的真实痛点:
- 只看 benchmark 排名:官方 harness 与中立 harness 分数可差 17 个百分点,单看一张表容易误判。
- 只看 API 单价:输出 Token 消耗差 4.2 倍时,标价便宜不等于任务便宜。
- 忽视训练数据争议:CursorBench 因数据污染被撤除,Cursor 相关宣称需独立重测。
- 幻觉率被忽略:AA-Omniscience Index 显示 Grok 4.5 幻觉率 54%,生产环境须加强校验。
Grok 4.5 是 SpaceXAI 迄今为止最强的模型,专为以下场景深度优化:
- 编程与代码 Agent:修 bug、大型代码库重构、端到端应用开发
- 自主工作流(Agentic Tasks):跨工具、跨应用的多步骤自动化任务
- 知识密集型工作:法律、医疗、教育、数据分析等专业场景
与以往不同,这款模型不是单打独斗研发——它与 AI 编程工具 Cursor 联合训练,注入了数万亿 Token 的真实开发者交互数据(代码审查、调试流程、Agent 与代码库的互动记录)。SpaceX 在 2026 年 6 月已完成对 Cursor 母公司 Anysphere 的收购,此次联合训练是收购后的首批成果之一。背景可参考 SpaceX 收购 Cursor 深度解析。
| 参数 | 数值 |
|---|---|
| 架构 | Mixture of Experts(MoE,混合专家) |
| 上下文窗口 | 500,000 Tokens(50 万) |
| 推理模式 | 低 / 中 / 高(默认:高) |
| 推理速度 | 官方 80 TPS,实测约 90 TPS |
| 训练硬件 | 数万块 NVIDIA GB300 GPU(孟菲斯数据中心) |
| 参数量 | 未公开(MoE 架构) |
02 Grok 4.5 定价多少?API 单价与真实任务成本对比
定价是 Grok 4.5 最核心的卖点。先看 API 单价,再看把 Token 效率折算进去后的「每任务实际成本」。
| 模型 | 输入 | 输出 |
|---|---|---|
| Grok 4.5 | $2.00 | $6.00 |
| Grok 4.5(缓存命中) | $0.50 | — |
| Grok 4.5 Fast 版 | $4.00 | $18.00 |
| Claude Opus 4.7 | $5.00 | $25.00 |
| Claude Fable 5 | 更高 | 更高 |
| GPT-5.6 Sol(旗舰) | $5.00 | $30.00 |
| GPT-5.6 Luna(经济档) | $1.00 | $6.00 |
| 模型 / 平台 | 每任务平均 Token 消耗 | 每任务实际成本 |
|---|---|---|
| Grok 4.5 / Grok Build | ~1.9M tokens | $2.49 |
| GPT-5.5 / Codex | ~6.2M tokens | $5.07 |
| Claude Fable 5 / Claude Code | ~7.2M tokens | $11.80 |
在 SWE-Bench Pro 编程任务上,Grok 4.5 平均每次只消耗 15,954 个输出 Token,而 Claude Opus 4.8 同任务消耗 67,020 个——差距 4.2 倍。按 500 任务/天估算,Grok 约 $1,245/天 vs Claude Code 约 $5,900/天,效率优势在高频调用场景下会被指数级放大。
03 Grok 4.5 benchmark 怎么样?编程、Agent 与综合智能指数
SpaceXAI 官方公布了 4 项编程评测。我们汇总官方数据与第三方独立测试,并标注 CursorBench 撤除原因。
| 评测项目 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| DeepSWE 1.0(官方 harness) | 62.0% | 66.1% | 55.75% | 64.31% |
| DeepSWE 1.1(中立 harness) | 53% | 70% | 59% | 67% |
| Terminal Bench 2.1 | 83.3% | 84.3% | 78.9% | 83.4% |
| SWE-Bench Pro(解决率) | 64.7% | 80.4% | 69.2% | 58.6% |
解读要点:
- DeepSWE 1.0(各厂商自有 harness):Grok 4.5 排第三,差距不大。
- DeepSWE 1.1(中立 harness):Grok 4.5 跌至第四,Fable 5 领先 17 个百分点——这是最诚实的横向对比。
- Terminal Bench 2.1:四款顶级模型差距在 5.4 个百分点以内,几乎是平局。
- SWE-Bench Pro:最严苛测试,Grok 4.5 排第三,落后 Fable 5 约 16 个点。
CursorBench 撤除说明:发布时 CursorBench(Cursor 自有评测集)被临时撤除——Cursor 自身代码库的部分快照意外混入了 Grok 4.5 的训练数据,存在数据污染风险。这是本次发布的一个明显瑕疵,相关性能数字需等待独立重测。
| 评测项目 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| AutomationBench-AA(657 个企业工作流) | 51.4% | 48.6% | 48.5% |
| Snorkel GDPVal+(专业工作场景) | 29% | — | 21% |
AutomationBench-AA 涵盖 Gmail、Slack、Salesforce、HubSpot 等 40 个模拟企业应用,Grok 4.5 是首个在不违反业务约束的前提下完成超过一半工作流目标的模型。Snorkel 专业场景评测中,Grok 4.5 在法律(40% vs 27–28%)、教育(58% vs 35–42%)、医疗(35% vs 23–25%)等领域大幅领先。
Artificial Analysis 综合智能指数:Grok 4.5 得 54 分(第四名),排在 Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)之后,但比上一代 Grok 大幅提升 16 分。
04 Grok 4.5 真实编程对比与 Cursor / API 六步接入
独立测评机构 TryAI 让 Grok 4.5、GPT-5.5、Claude Opus 4.8、Claude Fable 5 用相同提示词从零构建相同的交互应用:
| 模型 | 结果 |
|---|---|
| Opus 4.8 / Fable 5 | 一次成功 |
| Grok 4.5 | 第一次仅渲染标题和按钮,无立方体;第二次重试成功 |
| GPT-5.5 | 失败 |
速度与成本:Grok 4.5 首 Token 出现时间 <0.5 秒,流速约 110 tokens/秒(约是竞品的 2 倍);GPT-5.5 短回答最快;Fable 5 最慢、最贵。结论:高频重复性编程任务 Grok 4.5 的速度与成本优势碾压;需要一次搞定复杂状态管理的高精度任务,Claude 系列仍然更可靠。
可用平台(欧盟预计 7 月中旬开放):
- Grok Build:SpaceXAI 自家 Coding Agent 平台,Grok 4.5 为默认模型
- Cursor:所有订阅计划可用(桌面端、Web、iOS、CLI、SDK),首周使用量加倍
- SpaceXAI Console API:Chat Completions 与 Responses API
- Office 插件:Word、PowerPoint、Excel 默认模型
- 第三方网关:OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic
API 区域:us-east-1、us-west-2;速率限制 150 请求/秒、50M tokens/分钟。
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "帮我找出这段代码的 bug 并修复:function median(a){a.sort();return a[a.length/2]}"
}'
六步落地接入:
- 注册 SpaceXAI Console:在 console.x.ai 创建账号并生成 API Key,确认账单区域为 us-east-1 或 us-west-2。
- Cursor 内切换模型:打开 Cursor → 模型选择 → 选 Grok 4.5;首周用量加倍,适合压测真实工作流。
- 配置缓存键:Responses API 设置
prompt_cache_key,或 Chat Completions 加x-grok-conv-idHeader,命中缓存后输入价降至 $0.50/M tokens。 - 长 Agent 循环开启 Context Compaction:减少 Token 累积,控制高频任务总成本。
- 混合模型路由:常规子任务走 Grok 4.5,复杂架构决策留给 Claude Fable 5,在 Cursor 或 LiteLLM 层配置 fallback。
- 生产输出校验:对 SWE-Bench Pro 类高精度任务与幻觉敏感场景,加 CI 测试门与人工审核,勿盲信首次输出。
05 Grok 4.5 值不值得切换?选型矩阵、FAQ 与总结
| 场景 | 建议 | 原因 |
|---|---|---|
| 高频 Agent 任务(数百–数千次/天) | ✅ 优先考虑 | 每任务 ~$2.49 vs $11.80,成本节省立竿见影 |
| 终端类任务与工具调用 | ✅ 优先考虑 | Terminal Bench 2.1、AutomationBench 顶级表现 |
| 已深度集成 Cursor 的团队 | ✅ 优先考虑 | 联合训练、原生支持、无缝切换 |
| 混合模型策略 | ✅ 推荐 | 常规子任务 Grok,最难架构决策 Claude Fable 5 |
| SWE-Bench Pro 类高精度代码 | ⚠️ 谨慎 | Fable 5 领先约 16 个百分点,差距真实 |
| 幻觉率敏感生产系统 | ⚠️ 谨慎 | AA-Omniscience 幻觉率 54%,须加强验证 |
| 欧盟用户 | ⚠️ 等待 | API 暂仅 us-east-1 / us-west-2,EU 尚未开放 |
| CursorBench 相关宣称 | ⚠️ 暂缓采信 | 训练数据污染,结果已撤除 |
可引用关键数据(EEAT):
- Token 效率比:SWE-Bench Pro 单次输出 Token Grok 4.5 为 15,954 vs Opus 4.8 为 67,020,差距 4.2×(来源:SpaceXAI 官方发布数据,2026-07-08)。
- 推理速度:首 Token <500ms,实测流速 ~110 tokens/s,约为竞品 2 倍(来源:TryAI 独立测评)。
- 综合智能指数:Artificial Analysis 54 分,较上一代 Grok 提升 16 分,仍列第四(来源:Artificial Analysis,2026-07)。
常见问题 FAQ:
- Q: Grok 4.5 比 Claude Opus 4.8 更好吗? A: 取决于指标。Opus 4.8 在 SWE-Bench Pro 准确率更高(69.2% vs 64.7%);Grok 4.5 在速度、Token 效率、每任务成本上常领先 4×;Agent 工作流完成率 Grok 4.5 在独立 benchmark 上略胜 Opus 4.8。
- Q: Grok 4.5 免费吗? A: Grok Build 与 Cursor 曾有限时免费额度;API 正式价为 $2/M 输入、$6/M 输出。Cursor 订阅计划已包含在模型池中。
- Q: Cursor 里怎么用 Grok 4.5? A: 所有 Cursor 计划自动可用,模型选择器选 Grok 4.5 即可;发布后首周用量加倍。
- Q: 上下文窗口多大? A: 500,000 tokens(500K),足以覆盖多数大型代码库任务。
- Q: CursorBench 为什么被撤除? A: Cursor 代码库快照意外进入训练数据,污染该 benchmark;SpaceXAI 已撤回相关结果,等待独立重测。
- Q: 能通过 OpenRouter 用吗? A: 可以,亦支持 Vercel AI Gateway、Cloudflare、Snowflake、Databricks Mosaic。
总结:Grok 4.5 不是「最强的编程模型」,但它是性价比最高的 Opus 级编程 Agent——把 Token 效率与 API 定价折算成实际任务成本时,可在主流 Agent 工作流上以七八折甚至更低价格完成与 Opus 4.8 相近质量的工作。金融代码、安全关键系统仍建议 Claude Fable 5。
以下为主要来源,发版或页面更新后请再次打开链接核对:
https://cursor.com/blog/grok-4-5
https://docs.x.ai/developers/models/grok-4.5
把 Grok 4.5 跑在个人笔记本上仍有硬伤:休眠中断长 Agent 循环、多仓库并行争抢本地资源、企业难以统一审计与 7×24 常驻。对于需要 Cursor Agent、Codex CI 或 OpenClaw Gateway 稳定 7×24 运行的生产环境,CALMVPS 裸金属 Mac Mini 租赁通常是更优解:独占 Apple Silicon、Metal 原生加速、按月弹性下单,约 120 秒交付,可将重计算 Agent 卸载到云端而本地仅做 Plan 审核。详见 定价页。