Grok 4.5 全面评测:
SpaceXAI 最强编程模型,「Opus 级智能 + 四分之一价格」是噱头还是实力?

2026 年 7 月 8 日,马斯克旗下 SpaceXAI 正式发布 Grok 4.5——上市后推出的第一款旗舰产品。马斯克在 X 上喊话:「这是一款 Opus 级别的模型,但速度更快、Token 效率更高、成本更低。」

本文面向正在评估 AI 编程助手、Cursor 用户与预算敏感的工程团队,严格梳理公开 benchmark、TryAI 独立测评、API 定价与平台接入方式,回答三件事:Grok 4.5 到底强在哪、弱在哪、以及「便宜 4 倍」是不是算术而非营销。

01 Grok 4.5 是什么?Cursor 联合训练与核心规格一览

选型前的真实痛点:

  • 只看 benchmark 排名:官方 harness 与中立 harness 分数可差 17 个百分点,单看一张表容易误判。
  • 只看 API 单价:输出 Token 消耗差 4.2 倍时,标价便宜不等于任务便宜。
  • 忽视训练数据争议:CursorBench 因数据污染被撤除,Cursor 相关宣称需独立重测。
  • 幻觉率被忽略:AA-Omniscience Index 显示 Grok 4.5 幻觉率 54%,生产环境须加强校验。

Grok 4.5 是 SpaceXAI 迄今为止最强的模型,专为以下场景深度优化:

  • 编程与代码 Agent:修 bug、大型代码库重构、端到端应用开发
  • 自主工作流(Agentic Tasks):跨工具、跨应用的多步骤自动化任务
  • 知识密集型工作:法律、医疗、教育、数据分析等专业场景

与以往不同,这款模型不是单打独斗研发——它与 AI 编程工具 Cursor 联合训练,注入了数万亿 Token 的真实开发者交互数据(代码审查、调试流程、Agent 与代码库的互动记录)。SpaceX 在 2026 年 6 月已完成对 Cursor 母公司 Anysphere 的收购,此次联合训练是收购后的首批成果之一。背景可参考 SpaceX 收购 Cursor 深度解析

Grok 4.5 核心规格
参数 数值
架构 Mixture of Experts(MoE,混合专家)
上下文窗口 500,000 Tokens(50 万)
推理模式 低 / 中 / 高(默认:高)
推理速度 官方 80 TPS,实测约 90 TPS
训练硬件 数万块 NVIDIA GB300 GPU(孟菲斯数据中心)
参数量 未公开(MoE 架构)

02 Grok 4.5 定价多少?API 单价与真实任务成本对比

定价是 Grok 4.5 最核心的卖点。先看 API 单价,再看把 Token 效率折算进去后的「每任务实际成本」。

API 单价对比(per 1M tokens)
模型 输入 输出
Grok 4.5 $2.00 $6.00
Grok 4.5(缓存命中) $0.50
Grok 4.5 Fast 版 $4.00 $18.00
Claude Opus 4.7 $5.00 $25.00
Claude Fable 5 更高 更高
GPT-5.6 Sol(旗舰) $5.00 $30.00
GPT-5.6 Luna(经济档) $1.00 $6.00
编程 Agent 任务真实成本对比
模型 / 平台 每任务平均 Token 消耗 每任务实际成本
Grok 4.5 / Grok Build ~1.9M tokens $2.49
GPT-5.5 / Codex ~6.2M tokens $5.07
Claude Fable 5 / Claude Code ~7.2M tokens $11.80

在 SWE-Bench Pro 编程任务上,Grok 4.5 平均每次只消耗 15,954 个输出 Token,而 Claude Opus 4.8 同任务消耗 67,020 个——差距 4.2 倍。按 500 任务/天估算,Grok 约 $1,245/天 vs Claude Code 约 $5,900/天,效率优势在高频调用场景下会被指数级放大。

03 Grok 4.5 benchmark 怎么样?编程、Agent 与综合智能指数

SpaceXAI 官方公布了 4 项编程评测。我们汇总官方数据与第三方独立测试,并标注 CursorBench 撤除原因。

编程 Benchmark 对比
评测项目 Grok 4.5 Claude Fable 5 Claude Opus 4.8 GPT-5.5
DeepSWE 1.0(官方 harness) 62.0% 66.1% 55.75% 64.31%
DeepSWE 1.1(中立 harness) 53% 70% 59% 67%
Terminal Bench 2.1 83.3% 84.3% 78.9% 83.4%
SWE-Bench Pro(解决率) 64.7% 80.4% 69.2% 58.6%

解读要点:

  • DeepSWE 1.0(各厂商自有 harness):Grok 4.5 排第三,差距不大。
  • DeepSWE 1.1(中立 harness):Grok 4.5 跌至第四,Fable 5 领先 17 个百分点——这是最诚实的横向对比。
  • Terminal Bench 2.1:四款顶级模型差距在 5.4 个百分点以内,几乎是平局。
  • SWE-Bench Pro:最严苛测试,Grok 4.5 排第三,落后 Fable 5 约 16 个点。

CursorBench 撤除说明:发布时 CursorBench(Cursor 自有评测集)被临时撤除——Cursor 自身代码库的部分快照意外混入了 Grok 4.5 的训练数据,存在数据污染风险。这是本次发布的一个明显瑕疵,相关性能数字需等待独立重测。

Agent 任务 Benchmark(Grok 4.5 高光舞台)
评测项目 Grok 4.5 Claude Fable 5 Claude Opus 4.8
AutomationBench-AA(657 个企业工作流) 51.4% 48.6% 48.5%
Snorkel GDPVal+(专业工作场景) 29% 21%

AutomationBench-AA 涵盖 Gmail、Slack、Salesforce、HubSpot 等 40 个模拟企业应用,Grok 4.5 是首个在不违反业务约束的前提下完成超过一半工作流目标的模型。Snorkel 专业场景评测中,Grok 4.5 在法律(40% vs 27–28%)、教育(58% vs 35–42%)、医疗(35% vs 23–25%)等领域大幅领先。

Artificial Analysis 综合智能指数:Grok 4.5 得 54 分(第四名),排在 Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)之后,但比上一代 Grok 大幅提升 16 分。

04 Grok 4.5 真实编程对比与 Cursor / API 六步接入

独立测评机构 TryAI 让 Grok 4.5、GPT-5.5、Claude Opus 4.8、Claude Fable 5 用相同提示词从零构建相同的交互应用:

TryAI 3D 立方体渲染任务(最难项)
模型 结果
Opus 4.8 / Fable 5 一次成功
Grok 4.5 第一次仅渲染标题和按钮,无立方体;第二次重试成功
GPT-5.5 失败

速度与成本:Grok 4.5 首 Token 出现时间 <0.5 秒,流速约 110 tokens/秒(约是竞品的 2 倍);GPT-5.5 短回答最快;Fable 5 最慢、最贵。结论:高频重复性编程任务 Grok 4.5 的速度与成本优势碾压;需要一次搞定复杂状态管理的高精度任务,Claude 系列仍然更可靠。

可用平台(欧盟预计 7 月中旬开放):

  • Grok Build:SpaceXAI 自家 Coding Agent 平台,Grok 4.5 为默认模型
  • Cursor:所有订阅计划可用(桌面端、Web、iOS、CLI、SDK),首周使用量加倍
  • SpaceXAI Console API:Chat Completions 与 Responses API
  • Office 插件:Word、PowerPoint、Excel 默认模型
  • 第三方网关:OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic

API 区域:us-east-1us-west-2;速率限制 150 请求/秒、50M tokens/分钟。

api-quickstart.sh
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "帮我找出这段代码的 bug 并修复:function median(a){a.sort();return a[a.length/2]}"
  }'

六步落地接入:

  1. 注册 SpaceXAI Console:在 console.x.ai 创建账号并生成 API Key,确认账单区域为 us-east-1 或 us-west-2。
  2. Cursor 内切换模型:打开 Cursor → 模型选择 → 选 Grok 4.5;首周用量加倍,适合压测真实工作流。
  3. 配置缓存键:Responses API 设置 prompt_cache_key,或 Chat Completions 加 x-grok-conv-id Header,命中缓存后输入价降至 $0.50/M tokens。
  4. 长 Agent 循环开启 Context Compaction:减少 Token 累积,控制高频任务总成本。
  5. 混合模型路由:常规子任务走 Grok 4.5,复杂架构决策留给 Claude Fable 5,在 Cursor 或 LiteLLM 层配置 fallback。
  6. 生产输出校验:对 SWE-Bench Pro 类高精度任务与幻觉敏感场景,加 CI 测试门与人工审核,勿盲信首次输出。

05 Grok 4.5 值不值得切换?选型矩阵、FAQ 与总结

适合 vs 谨慎场景
场景 建议 原因
高频 Agent 任务(数百–数千次/天) ✅ 优先考虑 每任务 ~$2.49 vs $11.80,成本节省立竿见影
终端类任务与工具调用 ✅ 优先考虑 Terminal Bench 2.1、AutomationBench 顶级表现
已深度集成 Cursor 的团队 ✅ 优先考虑 联合训练、原生支持、无缝切换
混合模型策略 ✅ 推荐 常规子任务 Grok,最难架构决策 Claude Fable 5
SWE-Bench Pro 类高精度代码 ⚠️ 谨慎 Fable 5 领先约 16 个百分点,差距真实
幻觉率敏感生产系统 ⚠️ 谨慎 AA-Omniscience 幻觉率 54%,须加强验证
欧盟用户 ⚠️ 等待 API 暂仅 us-east-1 / us-west-2,EU 尚未开放
CursorBench 相关宣称 ⚠️ 暂缓采信 训练数据污染,结果已撤除

可引用关键数据(EEAT):

  • Token 效率比:SWE-Bench Pro 单次输出 Token Grok 4.5 为 15,954 vs Opus 4.8 为 67,020,差距 4.2×(来源:SpaceXAI 官方发布数据,2026-07-08)。
  • 推理速度:首 Token <500ms,实测流速 ~110 tokens/s,约为竞品 2 倍(来源:TryAI 独立测评)。
  • 综合智能指数:Artificial Analysis 54 分,较上一代 Grok 提升 16 分,仍列第四(来源:Artificial Analysis,2026-07)。

常见问题 FAQ:

  • Q: Grok 4.5 比 Claude Opus 4.8 更好吗? A: 取决于指标。Opus 4.8 在 SWE-Bench Pro 准确率更高(69.2% vs 64.7%);Grok 4.5 在速度、Token 效率、每任务成本上常领先 4×;Agent 工作流完成率 Grok 4.5 在独立 benchmark 上略胜 Opus 4.8。
  • Q: Grok 4.5 免费吗? A: Grok Build 与 Cursor 曾有限时免费额度;API 正式价为 $2/M 输入、$6/M 输出。Cursor 订阅计划已包含在模型池中。
  • Q: Cursor 里怎么用 Grok 4.5? A: 所有 Cursor 计划自动可用,模型选择器选 Grok 4.5 即可;发布后首周用量加倍。
  • Q: 上下文窗口多大? A: 500,000 tokens(500K),足以覆盖多数大型代码库任务。
  • Q: CursorBench 为什么被撤除? A: Cursor 代码库快照意外进入训练数据,污染该 benchmark;SpaceXAI 已撤回相关结果,等待独立重测。
  • Q: 能通过 OpenRouter 用吗? A: 可以,亦支持 Vercel AI Gateway、Cloudflare、Snowflake、Databricks Mosaic。

总结:Grok 4.5 不是「最强的编程模型」,但它是性价比最高的 Opus 级编程 Agent——把 Token 效率与 API 定价折算成实际任务成本时,可在主流 Agent 工作流上以七八折甚至更低价格完成与 Opus 4.8 相近质量的工作。金融代码、安全关键系统仍建议 Claude Fable 5。

以下为主要来源,发版或页面更新后请再次打开链接核对:

https://x.ai/news/grok-4-5

https://cursor.com/blog/grok-4-5

https://docs.x.ai/developers/models/grok-4.5

https://techcrunch.com/2026/07/08/spacexai-releases-grok-4-5-which-elon-describes-as-an-opus-class-model/

https://snorkel.ai/blog/grok-4-5-testing-results-how-spacexais-new-model-performs-on-real-professional-work/

把 Grok 4.5 跑在个人笔记本上仍有硬伤:休眠中断长 Agent 循环、多仓库并行争抢本地资源、企业难以统一审计与 7×24 常驻。对于需要 Cursor Agent、Codex CI 或 OpenClaw Gateway 稳定 7×24 运行的生产环境,CALMVPS 裸金属 Mac Mini 租赁通常是更优解:独占 Apple Silicon、Metal 原生加速、按月弹性下单,约 120 秒交付,可将重计算 Agent 卸载到云端而本地仅做 Plan 审核。详见 定价页