首頁 / 部落格 / Grok 4.5 評測
ENGINEERING_BLOG · 2026.07.11

Grok 4.5 深度評測:
SpaceXAI 最強程式設計模型,真的比 Claude Opus 便宜 4 倍嗎?

如果你是一名在 Cursor 或自建 Agent 流水線裡高頻呼叫大模型的開發者,2026 年 7 月 8 日馬斯克旗下 SpaceXAI 發布的 Grok 4.5 很可能已經出現在你的模型清單裡——馬斯克稱其為「Opus 級智慧,卻只要幾分之一的價格」。本文基於公開 benchmark、獨立測評與 API 定價,完整涵蓋模型規格、定價對比、程式設計與 Agent 評測、TryAI 真實編碼測試、平台接入、6 步實操與 FAQ,幫你判斷 Grok 4.5 是否值得切換。

  • TL;DR:Grok 4.5 不是 benchmark 第一的程式設計模型,但在高頻 Agent 場景下,Token 效率 + API 定價使其單次任務成本約為 Claude Code 的四分之一(約 $2.49 vs $11.80)。
  • 亮點:與 Cursor 聯合訓練、50 萬 Token 上下文、AutomationBench-AA 首個超 50% 完成率、首 Token <0.5s、約 110 tokens/s。
  • 短版:SWE-Bench Pro 落後 Claude Fable 5 約 16 個百分點;幻覺率 AA-Omniscience 達 54%;CursorBench 因訓練資料污染被撤除。
  • 適合:高頻 Agent、終端機類任務、已用 Cursor 的團隊、預算敏感型工程組織。
  • 謹慎:高精度多檔案重構、金融/安全關鍵程式碼、歐盟 API 尚未開放(預計 7 月中旬)。

SECTION 01 Grok 4.5 是什麼?SpaceXAI 旗艦程式設計模型與 Cursor 聯合訓練背景

Grok 4.5 是 SpaceXAI 上市後推出的第一款旗艦模型,專為程式設計與程式碼 Agent、跨工具自主工作流,以及法律/醫療/教育等知識密集型場景深度最佳化。與以往不同,該模型與 AI 程式設計工具 Cursor 聯合訓練,注入了數兆 Token 的真實開發者互動資料(程式碼審查、除錯流程、Agent 與程式碼庫互動紀錄)。SpaceX 已於 2026 年 6 月完成對 Cursor 母公司 Anysphere 的收購,此次聯合訓練是收購後的首批成果之一。

Grok 4.5 核心規格一覽
參數 數值
架構 Mixture of Experts(MoE,混合專家)
上下文視窗 500,000 Tokens(50 萬)
推理模式 低 / 中 / 高(預設:高)
推理速度 官方 80 TPS,實測約 90 TPS
訓練硬體 數萬塊 NVIDIA GB300 GPU(孟菲斯資料中心)
參數量 未公開(MoE 架構)

SECTION 02 Grok 4.5 定價多少?API 單價與真實任務成本對比

定價是 Grok 4.5 最核心的賣點。標價已經低於 Claude Opus,但真正的差距來自 Token 效率——在 SWE-Bench Pro 程式設計任務上,Grok 4.5 平均每次只消耗 15,954 個輸出 Token,而 Claude Opus 4.8 同任務消耗 67,020 個,差距 4.2 倍

API 單價對比(per 1M tokens)
模型 輸入 輸出
Grok 4.5 $2.00 $6.00
Grok 4.5(快取命中) $0.50
Grok 4.5 Fast 版 $4.00 $18.00
Claude Opus 4.7 $5.00 $25.00
Claude Fable 5 更高 更高
GPT-5.6 Sol(旗艦) $5.00 $30.00
GPT-5.6 Luna(經濟檔) $1.00 $6.00
真實程式設計 Agent 任務每次成本估算
模型 / 平台 每任務平均 Token 每任務實際成本
Grok 4.5 / Grok Build ~1.9M tokens $2.49
GPT-5.5 / Codex ~6.2M tokens $5.07
Claude Fable 5 / Claude Code ~7.2M tokens $11.80

按每天 500 次 Agent 任務估算:Grok 4.5 約 $1,245/天,Claude Code 約 $5,900/天——效率差距會隨呼叫量指數級放大。

SECTION 03 Grok 4.5 Benchmark 全解析:程式設計、Agent 與綜合智慧指數

SpaceXAI 官方公布了 4 項程式設計相關評測。我們彙總官方數據與第三方獨立測試如下。

程式設計 Benchmark 對比
評測項目 Grok 4.5 Claude Fable 5 Claude Opus 4.8 GPT-5.5
DeepSWE 1.0(官方 harness) 62.0% 66.1% 55.75% 64.31%
DeepSWE 1.1(中立 harness) 53% 70% 59% 67%
Terminal Bench 2.1 83.3% 84.3% 78.9% 83.4%
SWE-Bench Pro(解決率) 64.7% 80.4% 69.2% 58.6%

解讀:DeepSWE 1.1 中立 harness 下 Grok 4.5 跌至第四,Fable 5 領先 17 個百分點;Terminal Bench 2.1 四款頂級模型差距在 5.4 個百分點以內,幾乎是平手;SWE-Bench Pro 是最嚴苛測試,Grok 4.5 排第三,落後 Fable 5 約 16 個點。

Agent 任務 Benchmark(Grok 4.5 亮點舞台):

Agent 與企業工作流 Benchmark
評測項目 Grok 4.5 Claude Fable 5 Claude Opus 4.8
AutomationBench-AA(657 個企業工作流) 51.4% 48.6% 48.5%
Snorkel GDPVal+(專業工作場景) 29% 21%

AutomationBench-AA 涵蓋 Gmail、Slack、Salesforce、HubSpot 等 40 個模擬企業應用,Grok 4.5 是首個在不違反業務約束的前提下完成超過一半工作流目標的模型。Snorkel 評測中,Grok 4.5 在法律(40% vs 27–28%)、教育(58% vs 35–42%)、醫療(35% vs 23–25%)等領域大幅領先。

綜合智慧指數:Artificial Analysis 綜合智慧指數 54 分(第四名),排在 Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)之後,但比上一代 Grok 大幅提升 16 分。

CursorBench 撤除說明:CursorBench(Cursor 自有評測集)在發布時被臨時撤除——發現 Cursor 自身程式碼庫的部分快照意外混入了 Grok 4.5 的訓練資料,存在資料污染風險,是本次發布的一個明顯瑕疵。

SECTION 04 真實程式設計對比與可用平台:TryAI 測試 + Grok Build / Cursor / API

獨立測評機構 TryAI 讓 Grok 4.5、GPT-5.5、Claude Opus 4.8、Claude Fable 5 用相同提示詞從零建構相同互動應用:

  • 3D 立方體渲染(最難):Opus 4.8 和 Fable 5 一次成功;Grok 4.5 第一次只渲染標題和按鈕、無立方體,第二次重試成功;GPT-5.5 失敗。
  • 速度:Grok 4.5 首 Token <0.5 秒,流速約 110 tokens/秒(約是競品的 2 倍)。
  • 成本:Grok 4.5 每次測試執行成本最低。

結論:高頻重複性程式設計任務中,Grok 4.5 的速度和成本優勢壓倒性領先;需要一次到位複雜狀態管理的高精度任務上,Claude 系列仍然更可靠。

可用平台(歐盟地區預計 7 月中旬開放):

  • Grok Build:SpaceXAI 自家 Coding Agent 平台,Grok 4.5 為預設模型
  • Cursor:所有訂閱方案均可使用(桌面端、Web、iOS、CLI、SDK),首週使用量加倍
  • SpaceXAI Console API:支援 Chat Completions 和 Responses API,區域 us-east-1 / us-west-2,限流 150 req/s、50M tokens/min
  • Office 外掛:Word、PowerPoint、Excel 預設模型
  • 第三方閘道:OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic
api-call.sh
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "幫我找出這段程式碼的 bug 並修復:function median(a){a.sort();return a[a.length/2]}"
  }'

SECTION 05 Grok 4.5 怎麼接入?Cursor 與 API 六步實操指南

  1. 在 Cursor 中選擇模型:開啟 Cursor → 模型選擇器 → 選擇 Grok 4.5(所有訂閱方案已內建,首週用量加倍)。
  2. 取得 SpaceXAI API Key:登入 SpaceXAI Console,在 API Keys 頁面建立金鑰,確認帳戶可存取 us-east-1 或 us-west-2。
  3. 設定環境變數:在本機或 CI 中設定 export XAI_API_KEY="your-key",勿將金鑰提交到版本儲存庫。
  4. 啟用 Prompt 快取:Responses API 設定 prompt_cache_key,或 Chat Completions 使用 x-grok-conv-id Header,將輸入價格從 $2.00/M 降至 $0.50/M
  5. 長 Agent 迴圈開啟 Context Compaction:減少多輪對話 Token 累積,降低高頻流水線總成本。
  6. 建立混合模型路由:將常規子任務路由給 Grok 4.5,最複雜架構決策留給 Claude Fable 5,並在輸出側加入自動化驗證(尤其幻覺敏感場景)。

SECTION 06 值得切換嗎?適合場景、風險與可引用數據

適合 Grok 4.5 的場景:

  • 每天執行數百到數千次程式設計任務的團隊,成本節省立竿見影
  • 終端機類任務和工具呼叫(Terminal Bench 2.1、AutomationBench 頂級表現)
  • 已深度整合 Cursor 的團隊,原生支援無縫切換
  • 新創公司與預算敏感團隊,相近智慧水平下每任務成本不到競品四分之一
  • 混合模型策略:常規子任務 Grok 4.5,複雜架構決策 Claude Fable 5

需要謹慎的場景:

  • SWE-Bench Pro 類高精度程式碼任務(Fable 5 領先約 16 個百分點)
  • 幻覺率敏感場景:AA-Omniscience Index 幻覺率達 54%,生產環境需加強輸出驗證
  • 歐盟使用者:API 當前僅在 us-east-1 和 us-west-2 可用
  • CursorBench 相關效能數據因訓練資料污染被撤除,需等待獨立重測

可引用硬核數據:

  • 上下文視窗:500,000 tokens
  • SWE-Bench Pro 輸出 Token 效率:15,954(Grok 4.5)vs 67,020(Opus 4.8),差距 4.2×
  • 單次 Agent 任務成本:$2.49(Grok 4.5)vs $11.80(Claude Code)
  • AutomationBench-AA:51.4%,首個超 50% 企業工作流完成率
  • Artificial Analysis 智慧指數:54 分,較上一代 +16 分

在本機 Mac 上跑高頻 Agent 流水線,筆電休眠、網路波動與多工搶占會打斷 7×24 自動化;純虛擬機方案還有 Hypervisor 損耗與 macOS EULA 限制。對於需要零損耗原生算力、穩定 iOS/macOS CI/CD 與 AI Agent 長期上線的生產環境,MACNOX 的雲端物理節點通常是更優解:100% 蘋果原裝 Mac Mini M4、完整 Root 權限、按天/週/月彈性下單、無 Hypervisor 損耗,可將 Grok Agent 與編譯流水線部署在獨立實體機上。可參考Mac Mini M4 租 vs 買費用對比Claude Code 安全風險處置,前往定價頁查看方案。

Grok 4.5 不是「最強的程式設計模型」,但它是性價比最高的 Opus 級程式設計 Agent——當你把 Token 效率與 API 定價折算成實際任務成本時,它在主流 Agent 工作流上能以更低價格完成與 Opus 4.8 相近品質的工作。若場景對準確率要求極高(金融程式碼、安全關鍵系統),Claude Fable 5 仍是更保險的選擇。

官方與第三方參考來源(發版後請再次開啟連結核對):

SpaceXAI 官方發布 — Grok 4.5

Cursor 聯合發布聲明 — Grok 4.5

SpaceXAI 官方文件 — Grok 4.5 API

TechCrunch — SpaceXAI releases Grok 4.5

Awesome Agents 獨立評測 — Grok 4.5

Snorkel AI 專業場景測試 — Grok 4.5

SECTION 07 常見問題 FAQ

Grok 4.5 比 Claude Opus 4.8 更好嗎?

取決於「更好」的定義。Opus 4.8 在 SWE-Bench Pro 程式設計準確率上更高(69.2% vs 64.7%);Grok 4.5 在速度、Token 效率與單次任務成本上領先,Agent 工作流完成率也略勝。高頻 Agent 場景選 Grok,高精度一次性編碼選 Claude。

Grok 4.5 免費嗎?

SpaceXAI 在 Grok Build 和 Cursor 中提供限時免費額度。之後 API 定價為 $2/M 輸入、$6/M 輸出。Cursor 訂閱方案已將其納入模型池。

如何在 Cursor 中使用 Grok 4.5?

所有 Cursor 方案自動可用。開啟 Cursor → 模型選擇 → 選擇 Grok 4.5。發布後首週使用量加倍。

上下文視窗多大?

500,000 tokens(50 萬),足以涵蓋大多數大型程式碼庫任務。

為什麼 CursorBench 被撤除?

Cursor 自身程式碼庫快照意外納入 Grok 4.5 訓練資料,污染了該評測。SpaceXAI 已撤回相關資料,等待獨立重測。

OpenRouter 能用 Grok 4.5 嗎?

可以。Grok 4.5 可透過 OpenRouter、Vercel AI Gateway、Cloudflare、Snowflake、Databricks Mosaic 等第三方閘道存取。