2026 年 7 月 8 日,馬斯克旗下 SpaceXAI 正式發布 Grok 4.5——上市後推出的第一款旗艦產品。馬斯克在 X 上喊話:「這是一款 Opus 級別的模型,但速度更快、Token 效率更高、成本更低。」
本文面向正在評估 AI 程式設計助手、Cursor 使用者與預算敏感的工程團隊,嚴格梳理公開 benchmark、TryAI 獨立測評、API 定價與平台接入方式,回答三件事:Grok 4.5 到底強在哪、弱在哪、以及「便宜 4 倍」是不是算術而非行銷。
01 Grok 4.5 是什麼?Cursor 聯合訓練與核心規格一覽
選型前的真實痛點:
- 只看 benchmark 排名:官方 harness 與中立 harness 分數可差 17 個百分點,單看一張表容易誤判。
- 只看 API 單價:輸出 Token 消耗差 4.2 倍時,標價便宜不等於任務便宜。
- 忽視訓練資料爭議:CursorBench 因資料污染被撤除,Cursor 相關宣稱需獨立重測。
- 幻覺率被忽略:AA-Omniscience Index 顯示 Grok 4.5 幻覺率 54%,生產環境須加強校驗。
Grok 4.5 是 SpaceXAI 迄今為止最強的模型,專為以下場景深度優化:
- 程式設計與程式碼 Agent:修 bug、大型程式碼庫重構、端到端應用開發
- 自主工作流(Agentic Tasks):跨工具、跨應用的多步驟自動化任務
- 知識密集型工作:法律、醫療、教育、資料分析等專業場景
與以往不同,這款模型不是單打獨鬥研發——它與 AI 程式設計工具 Cursor 聯合訓練,注入了數萬億 Token 的真實開發者互動資料(程式碼審查、除錯流程、Agent 與程式碼庫的互動記錄)。SpaceX 在 2026 年 6 月已完成對 Cursor 母公司 Anysphere 的收購,此次聯合訓練是收購後的首批成果之一。背景可參考 SpaceX 收購 Cursor 深度解析。
| 參數 | 數值 |
|---|---|
| 架構 | Mixture of Experts(MoE,混合專家) |
| 上下文視窗 | 500,000 Tokens(50 萬) |
| 推理模式 | 低 / 中 / 高(預設:高) |
| 推理速度 | 官方 80 TPS,實測約 90 TPS |
| 訓練硬體 | 數萬塊 NVIDIA GB300 GPU(孟菲斯資料中心) |
| 參數量 | 未公開(MoE 架構) |
02 Grok 4.5 定價多少?API 單價與真實任務成本對比
定價是 Grok 4.5 最核心的賣點。先看 API 單價,再看把 Token 效率折算進去後的「每任務實際成本」。
| 模型 | 輸入 | 輸出 |
|---|---|---|
| Grok 4.5 | $2.00 | $6.00 |
| Grok 4.5(快取命中) | $0.50 | — |
| Grok 4.5 Fast 版 | $4.00 | $18.00 |
| Claude Opus 4.7 | $5.00 | $25.00 |
| Claude Fable 5 | 更高 | 更高 |
| GPT-5.6 Sol(旗艦) | $5.00 | $30.00 |
| GPT-5.6 Luna(經濟檔) | $1.00 | $6.00 |
| 模型 / 平台 | 每任務平均 Token 消耗 | 每任務實際成本 |
|---|---|---|
| Grok 4.5 / Grok Build | ~1.9M tokens | $2.49 |
| GPT-5.5 / Codex | ~6.2M tokens | $5.07 |
| Claude Fable 5 / Claude Code | ~7.2M tokens | $11.80 |
在 SWE-Bench Pro 程式設計任務上,Grok 4.5 平均每次只消耗 15,954 個輸出 Token,而 Claude Opus 4.8 同任務消耗 67,020 個——差距 4.2 倍。按 500 任務/天估算,Grok 約 $1,245/天 vs Claude Code 約 $5,900/天,效率優勢在高頻呼叫場景下會被指數級放大。
03 Grok 4.5 benchmark 怎麼樣?程式設計、Agent 與綜合智慧指數
SpaceXAI 官方公布了 4 項程式設計評測。我們彙總官方資料與第三方獨立測試,並標註 CursorBench 撤除原因。
| 評測項目 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| DeepSWE 1.0(官方 harness) | 62.0% | 66.1% | 55.75% | 64.31% |
| DeepSWE 1.1(中立 harness) | 53% | 70% | 59% | 67% |
| Terminal Bench 2.1 | 83.3% | 84.3% | 78.9% | 83.4% |
| SWE-Bench Pro(解決率) | 64.7% | 80.4% | 69.2% | 58.6% |
解讀要點:
- DeepSWE 1.0(各廠商自有 harness):Grok 4.5 排第三,差距不大。
- DeepSWE 1.1(中立 harness):Grok 4.5 跌至第四,Fable 5 領先 17 個百分點——這是最誠實的橫向對比。
- Terminal Bench 2.1:四款頂級模型差距在 5.4 個百分點以內,幾乎是平局。
- SWE-Bench Pro:最嚴苛測試,Grok 4.5 排第三,落後 Fable 5 約 16 個點。
CursorBench 撤除說明:發布時 CursorBench(Cursor 自有評測集)被臨時撤除——Cursor 自身程式碼庫的部分快照意外混入了 Grok 4.5 的訓練資料,存在資料污染風險。這是本次發布的一個明顯瑕疵,相關效能數字需等待獨立重測。
| 評測項目 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| AutomationBench-AA(657 個企業工作流) | 51.4% | 48.6% | 48.5% |
| Snorkel GDPVal+(專業工作場景) | 29% | — | 21% |
AutomationBench-AA 涵蓋 Gmail、Slack、Salesforce、HubSpot 等 40 個模擬企業應用,Grok 4.5 是首個在不違反業務約束的前提下完成超過一半工作流目標的模型。Snorkel 專業場景評測中,Grok 4.5 在法律(40% vs 27–28%)、教育(58% vs 35–42%)、醫療(35% vs 23–25%)等領域大幅領先。
Artificial Analysis 綜合智慧指數:Grok 4.5 得 54 分(第四名),排在 Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)之後,但比上一代 Grok 大幅提升 16 分。
04 Grok 4.5 真實程式設計對比與 Cursor / API 六步接入
獨立測評機構 TryAI 讓 Grok 4.5、GPT-5.5、Claude Opus 4.8、Claude Fable 5 用相同提示詞從零建構相同的互動應用:
| 模型 | 結果 |
|---|---|
| Opus 4.8 / Fable 5 | 一次成功 |
| Grok 4.5 | 第一次僅渲染標題和按鈕,無立方體;第二次重試成功 |
| GPT-5.5 | 失敗 |
速度與成本:Grok 4.5 首 Token 出現時間 <0.5 秒,流速約 110 tokens/秒(約是競品的 2 倍);GPT-5.5 短回答最快;Fable 5 最慢、最貴。結論:高頻重複性程式設計任務 Grok 4.5 的速度與成本優勢壓倒性領先;需要一次搞定複雜狀態管理的高精度任務,Claude 系列仍然更可靠。
可用平台(歐盟預計 7 月中旬開放):
- Grok Build:SpaceXAI 自家 Coding Agent 平台,Grok 4.5 為預設模型
- Cursor:所有訂閱方案可用(桌面端、Web、iOS、CLI、SDK),首週使用量加倍
- SpaceXAI Console API:Chat Completions 與 Responses API
- Office 外掛:Word、PowerPoint、Excel 預設模型
- 第三方閘道:OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic
API 區域:us-east-1、us-west-2;速率限制 150 請求/秒、50M tokens/分鐘。
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "幫我找出這段程式碼的 bug 並修復:function median(a){a.sort();return a[a.length/2]}"
}'
六步落地接入:
- 註冊 SpaceXAI Console:在 console.x.ai 建立帳號並產生 API Key,確認帳單區域為 us-east-1 或 us-west-2。
- Cursor 內切換模型:開啟 Cursor → 模型選擇 → 選 Grok 4.5;首週用量加倍,適合壓測真實工作流。
- 設定快取鍵:Responses API 設定
prompt_cache_key,或 Chat Completions 加x-grok-conv-idHeader,命中快取後輸入價降至 $0.50/M tokens。 - 長 Agent 迴圈開啟 Context Compaction:減少 Token 累積,控制高頻任務總成本。
- 混合模型路由:常規子任務走 Grok 4.5,複雜架構決策留給 Claude Fable 5,在 Cursor 或 LiteLLM 層設定 fallback。
- 生產輸出校驗:對 SWE-Bench Pro 類高精度任務與幻覺敏感場景,加 CI 測試門與人工審核,勿盲信首次輸出。
05 Grok 4.5 值不值得切換?選型矩陣、FAQ 與總結
| 場景 | 建議 | 原因 |
|---|---|---|
| 高頻 Agent 任務(數百–數千次/天) | 優先考慮 | 每任務 ~$2.49 vs $11.80,成本節省立竿見影 |
| 終端機類任務與工具呼叫 | 優先考慮 | Terminal Bench 2.1、AutomationBench 頂級表現 |
| 已深度整合 Cursor 的團隊 | 優先考慮 | 聯合訓練、原生支援、無縫切換 |
| 混合模型策略 | 推薦 | 常規子任務 Grok,最難架構決策 Claude Fable 5 |
| SWE-Bench Pro 類高精度程式碼 | 謹慎 | Fable 5 領先約 16 個百分點,差距真實 |
| 幻覺率敏感生產系統 | 謹慎 | AA-Omniscience 幻覺率 54%,須加強驗證 |
| 歐盟使用者 | 等待 | API 暫僅 us-east-1 / us-west-2,EU 尚未開放 |
| CursorBench 相關宣稱 | 暫緩採信 | 訓練資料污染,結果已撤除 |
可引用關鍵資料(EEAT):
- Token 效率比:SWE-Bench Pro 單次輸出 Token Grok 4.5 為 15,954 vs Opus 4.8 為 67,020,差距 4.2×(來源:SpaceXAI 官方發布資料,2026-07-08)。
- 推理速度:首 Token <500ms,實測流速 ~110 tokens/s,約為競品 2 倍(來源:TryAI 獨立測評)。
- 綜合智慧指數:Artificial Analysis 54 分,較上一代 Grok 提升 16 分,仍列第四(來源:Artificial Analysis,2026-07)。
常見問題 FAQ:
- Q: Grok 4.5 比 Claude Opus 4.8 更好嗎? A: 取決於指標。Opus 4.8 在 SWE-Bench Pro 準確率更高(69.2% vs 64.7%);Grok 4.5 在速度、Token 效率、每任務成本上常領先 4×;Agent 工作流完成率 Grok 4.5 在獨立 benchmark 上略勝 Opus 4.8。
- Q: Grok 4.5 免費嗎? A: Grok Build 與 Cursor 曾有限時免費額度;API 正式價為 $2/M 輸入、$6/M 輸出。Cursor 訂閱方案已包含在模型池中。
- Q: Cursor 裡怎麼用 Grok 4.5? A: 所有 Cursor 方案自動可用,模型選擇器選 Grok 4.5 即可;發布後首週用量加倍。
- Q: 上下文視窗多大? A: 500,000 tokens(500K),足以涵蓋多數大型程式碼庫任務。
- Q: CursorBench 為什麼被撤除? A: Cursor 程式碼庫快照意外進入訓練資料,污染該 benchmark;SpaceXAI 已撤回相關結果,等待獨立重測。
- Q: 能透過 OpenRouter 用嗎? A: 可以,亦支援 Vercel AI Gateway、Cloudflare、Snowflake、Databricks Mosaic。
總結:Grok 4.5 不是「最強的程式設計模型」,但它是性價比最高的 Opus 級程式設計 Agent——把 Token 效率與 API 定價折算成實際任務成本時,可在主流 Agent 工作流上以七八折甚至更低價格完成與 Opus 4.8 相近品質的工作。金融程式碼、安全關鍵系統仍建議 Claude Fable 5。
以下為主要來源,發版或頁面更新後請再次開啟連結核對:
https://cursor.com/blog/grok-4-5
https://docs.x.ai/developers/models/grok-4.5
把 Grok 4.5 跑在個人筆電上仍有硬傷:休眠中斷長 Agent 迴圈、多儲存庫並行搶占本機資源、企業難以統一審計與 7×24 常駐。對於需要 Cursor Agent、Codex CI 或 OpenClaw Gateway 穩定 7×24 執行的生產環境,CALMVPS 裸機 Mac Mini 租賃通常是較優解:獨占 Apple Silicon、Metal 原生加速、按月彈性下單,約 120 秒交付,可將重計算 Agent 卸載到雲端而本機僅做 Plan 審核。詳見 定價頁。