Grok 4.5 全面評測:
SpaceXAI 最強程式設計模型,「Opus 級智慧 + 四分之一價格」是噱頭還是實力?

2026 年 7 月 8 日,馬斯克旗下 SpaceXAI 正式發布 Grok 4.5——上市後推出的第一款旗艦產品。馬斯克在 X 上喊話:「這是一款 Opus 級別的模型,但速度更快、Token 效率更高、成本更低。」

本文面向正在評估 AI 程式設計助手、Cursor 使用者與預算敏感的工程團隊,嚴格梳理公開 benchmark、TryAI 獨立測評、API 定價與平台接入方式,回答三件事:Grok 4.5 到底強在哪、弱在哪、以及「便宜 4 倍」是不是算術而非行銷。

01 Grok 4.5 是什麼?Cursor 聯合訓練與核心規格一覽

選型前的真實痛點:

  • 只看 benchmark 排名:官方 harness 與中立 harness 分數可差 17 個百分點,單看一張表容易誤判。
  • 只看 API 單價:輸出 Token 消耗差 4.2 倍時,標價便宜不等於任務便宜。
  • 忽視訓練資料爭議:CursorBench 因資料污染被撤除,Cursor 相關宣稱需獨立重測。
  • 幻覺率被忽略:AA-Omniscience Index 顯示 Grok 4.5 幻覺率 54%,生產環境須加強校驗。

Grok 4.5 是 SpaceXAI 迄今為止最強的模型,專為以下場景深度優化:

  • 程式設計與程式碼 Agent:修 bug、大型程式碼庫重構、端到端應用開發
  • 自主工作流(Agentic Tasks):跨工具、跨應用的多步驟自動化任務
  • 知識密集型工作:法律、醫療、教育、資料分析等專業場景

與以往不同,這款模型不是單打獨鬥研發——它與 AI 程式設計工具 Cursor 聯合訓練,注入了數萬億 Token 的真實開發者互動資料(程式碼審查、除錯流程、Agent 與程式碼庫的互動記錄)。SpaceX 在 2026 年 6 月已完成對 Cursor 母公司 Anysphere 的收購,此次聯合訓練是收購後的首批成果之一。背景可參考 SpaceX 收購 Cursor 深度解析

Grok 4.5 核心規格
參數 數值
架構 Mixture of Experts(MoE,混合專家)
上下文視窗 500,000 Tokens(50 萬)
推理模式 低 / 中 / 高(預設:高)
推理速度 官方 80 TPS,實測約 90 TPS
訓練硬體 數萬塊 NVIDIA GB300 GPU(孟菲斯資料中心)
參數量 未公開(MoE 架構)

02 Grok 4.5 定價多少?API 單價與真實任務成本對比

定價是 Grok 4.5 最核心的賣點。先看 API 單價,再看把 Token 效率折算進去後的「每任務實際成本」。

API 單價對比(per 1M tokens)
模型 輸入 輸出
Grok 4.5 $2.00 $6.00
Grok 4.5(快取命中) $0.50
Grok 4.5 Fast 版 $4.00 $18.00
Claude Opus 4.7 $5.00 $25.00
Claude Fable 5 更高 更高
GPT-5.6 Sol(旗艦) $5.00 $30.00
GPT-5.6 Luna(經濟檔) $1.00 $6.00
程式設計 Agent 任務真實成本對比
模型 / 平台 每任務平均 Token 消耗 每任務實際成本
Grok 4.5 / Grok Build ~1.9M tokens $2.49
GPT-5.5 / Codex ~6.2M tokens $5.07
Claude Fable 5 / Claude Code ~7.2M tokens $11.80

在 SWE-Bench Pro 程式設計任務上,Grok 4.5 平均每次只消耗 15,954 個輸出 Token,而 Claude Opus 4.8 同任務消耗 67,020 個——差距 4.2 倍。按 500 任務/天估算,Grok 約 $1,245/天 vs Claude Code 約 $5,900/天,效率優勢在高頻呼叫場景下會被指數級放大。

03 Grok 4.5 benchmark 怎麼樣?程式設計、Agent 與綜合智慧指數

SpaceXAI 官方公布了 4 項程式設計評測。我們彙總官方資料與第三方獨立測試,並標註 CursorBench 撤除原因。

程式設計 Benchmark 對比
評測項目 Grok 4.5 Claude Fable 5 Claude Opus 4.8 GPT-5.5
DeepSWE 1.0(官方 harness) 62.0% 66.1% 55.75% 64.31%
DeepSWE 1.1(中立 harness) 53% 70% 59% 67%
Terminal Bench 2.1 83.3% 84.3% 78.9% 83.4%
SWE-Bench Pro(解決率) 64.7% 80.4% 69.2% 58.6%

解讀要點:

  • DeepSWE 1.0(各廠商自有 harness):Grok 4.5 排第三,差距不大。
  • DeepSWE 1.1(中立 harness):Grok 4.5 跌至第四,Fable 5 領先 17 個百分點——這是最誠實的橫向對比。
  • Terminal Bench 2.1:四款頂級模型差距在 5.4 個百分點以內,幾乎是平局。
  • SWE-Bench Pro:最嚴苛測試,Grok 4.5 排第三,落後 Fable 5 約 16 個點。

CursorBench 撤除說明:發布時 CursorBench(Cursor 自有評測集)被臨時撤除——Cursor 自身程式碼庫的部分快照意外混入了 Grok 4.5 的訓練資料,存在資料污染風險。這是本次發布的一個明顯瑕疵,相關效能數字需等待獨立重測。

Agent 任務 Benchmark(Grok 4.5 高光舞台)
評測項目 Grok 4.5 Claude Fable 5 Claude Opus 4.8
AutomationBench-AA(657 個企業工作流) 51.4% 48.6% 48.5%
Snorkel GDPVal+(專業工作場景) 29% 21%

AutomationBench-AA 涵蓋 Gmail、Slack、Salesforce、HubSpot 等 40 個模擬企業應用,Grok 4.5 是首個在不違反業務約束的前提下完成超過一半工作流目標的模型。Snorkel 專業場景評測中,Grok 4.5 在法律(40% vs 27–28%)、教育(58% vs 35–42%)、醫療(35% vs 23–25%)等領域大幅領先。

Artificial Analysis 綜合智慧指數:Grok 4.5 得 54 分(第四名),排在 Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)之後,但比上一代 Grok 大幅提升 16 分。

04 Grok 4.5 真實程式設計對比與 Cursor / API 六步接入

獨立測評機構 TryAI 讓 Grok 4.5、GPT-5.5、Claude Opus 4.8、Claude Fable 5 用相同提示詞從零建構相同的互動應用:

TryAI 3D 立方體渲染任務(最難項)
模型 結果
Opus 4.8 / Fable 5 一次成功
Grok 4.5 第一次僅渲染標題和按鈕,無立方體;第二次重試成功
GPT-5.5 失敗

速度與成本:Grok 4.5 首 Token 出現時間 <0.5 秒,流速約 110 tokens/秒(約是競品的 2 倍);GPT-5.5 短回答最快;Fable 5 最慢、最貴。結論:高頻重複性程式設計任務 Grok 4.5 的速度與成本優勢壓倒性領先;需要一次搞定複雜狀態管理的高精度任務,Claude 系列仍然更可靠。

可用平台(歐盟預計 7 月中旬開放):

  • Grok Build:SpaceXAI 自家 Coding Agent 平台,Grok 4.5 為預設模型
  • Cursor:所有訂閱方案可用(桌面端、Web、iOS、CLI、SDK),首週使用量加倍
  • SpaceXAI Console API:Chat Completions 與 Responses API
  • Office 外掛:Word、PowerPoint、Excel 預設模型
  • 第三方閘道:OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic

API 區域:us-east-1us-west-2;速率限制 150 請求/秒、50M tokens/分鐘。

api-quickstart.sh
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "幫我找出這段程式碼的 bug 並修復:function median(a){a.sort();return a[a.length/2]}"
  }'

六步落地接入:

  1. 註冊 SpaceXAI Console:在 console.x.ai 建立帳號並產生 API Key,確認帳單區域為 us-east-1 或 us-west-2。
  2. Cursor 內切換模型:開啟 Cursor → 模型選擇 → 選 Grok 4.5;首週用量加倍,適合壓測真實工作流。
  3. 設定快取鍵:Responses API 設定 prompt_cache_key,或 Chat Completions 加 x-grok-conv-id Header,命中快取後輸入價降至 $0.50/M tokens。
  4. 長 Agent 迴圈開啟 Context Compaction:減少 Token 累積,控制高頻任務總成本。
  5. 混合模型路由:常規子任務走 Grok 4.5,複雜架構決策留給 Claude Fable 5,在 Cursor 或 LiteLLM 層設定 fallback。
  6. 生產輸出校驗:對 SWE-Bench Pro 類高精度任務與幻覺敏感場景,加 CI 測試門與人工審核,勿盲信首次輸出。

05 Grok 4.5 值不值得切換?選型矩陣、FAQ 與總結

適合 vs 謹慎場景
場景 建議 原因
高頻 Agent 任務(數百–數千次/天) 優先考慮 每任務 ~$2.49 vs $11.80,成本節省立竿見影
終端機類任務與工具呼叫 優先考慮 Terminal Bench 2.1、AutomationBench 頂級表現
已深度整合 Cursor 的團隊 優先考慮 聯合訓練、原生支援、無縫切換
混合模型策略 推薦 常規子任務 Grok,最難架構決策 Claude Fable 5
SWE-Bench Pro 類高精度程式碼 謹慎 Fable 5 領先約 16 個百分點,差距真實
幻覺率敏感生產系統 謹慎 AA-Omniscience 幻覺率 54%,須加強驗證
歐盟使用者 等待 API 暫僅 us-east-1 / us-west-2,EU 尚未開放
CursorBench 相關宣稱 暫緩採信 訓練資料污染,結果已撤除

可引用關鍵資料(EEAT):

  • Token 效率比:SWE-Bench Pro 單次輸出 Token Grok 4.5 為 15,954 vs Opus 4.8 為 67,020,差距 4.2×(來源:SpaceXAI 官方發布資料,2026-07-08)。
  • 推理速度:首 Token <500ms,實測流速 ~110 tokens/s,約為競品 2 倍(來源:TryAI 獨立測評)。
  • 綜合智慧指數:Artificial Analysis 54 分,較上一代 Grok 提升 16 分,仍列第四(來源:Artificial Analysis,2026-07)。

常見問題 FAQ:

  • Q: Grok 4.5 比 Claude Opus 4.8 更好嗎? A: 取決於指標。Opus 4.8 在 SWE-Bench Pro 準確率更高(69.2% vs 64.7%);Grok 4.5 在速度、Token 效率、每任務成本上常領先 4×;Agent 工作流完成率 Grok 4.5 在獨立 benchmark 上略勝 Opus 4.8。
  • Q: Grok 4.5 免費嗎? A: Grok Build 與 Cursor 曾有限時免費額度;API 正式價為 $2/M 輸入、$6/M 輸出。Cursor 訂閱方案已包含在模型池中。
  • Q: Cursor 裡怎麼用 Grok 4.5? A: 所有 Cursor 方案自動可用,模型選擇器選 Grok 4.5 即可;發布後首週用量加倍。
  • Q: 上下文視窗多大? A: 500,000 tokens(500K),足以涵蓋多數大型程式碼庫任務。
  • Q: CursorBench 為什麼被撤除? A: Cursor 程式碼庫快照意外進入訓練資料,污染該 benchmark;SpaceXAI 已撤回相關結果,等待獨立重測。
  • Q: 能透過 OpenRouter 用嗎? A: 可以,亦支援 Vercel AI Gateway、Cloudflare、Snowflake、Databricks Mosaic。

總結:Grok 4.5 不是「最強的程式設計模型」,但它是性價比最高的 Opus 級程式設計 Agent——把 Token 效率與 API 定價折算成實際任務成本時,可在主流 Agent 工作流上以七八折甚至更低價格完成與 Opus 4.8 相近品質的工作。金融程式碼、安全關鍵系統仍建議 Claude Fable 5。

以下為主要來源,發版或頁面更新後請再次開啟連結核對:

https://x.ai/news/grok-4-5

https://cursor.com/blog/grok-4-5

https://docs.x.ai/developers/models/grok-4.5

https://techcrunch.com/2026/07/08/spacexai-releases-grok-4-5-which-elon-describes-as-an-opus-class-model/

https://snorkel.ai/blog/grok-4-5-testing-results-how-spacexais-new-model-performs-on-real-professional-work/

把 Grok 4.5 跑在個人筆電上仍有硬傷:休眠中斷長 Agent 迴圈、多儲存庫並行搶占本機資源、企業難以統一審計與 7×24 常駐。對於需要 Cursor Agent、Codex CI 或 OpenClaw Gateway 穩定 7×24 執行的生產環境,CALMVPS 裸機 Mac Mini 租賃通常是較優解:獨占 Apple Silicon、Metal 原生加速、按月彈性下單,約 120 秒交付,可將重計算 Agent 卸載到雲端而本機僅做 Plan 審核。詳見 定價頁