如果你是一名在 Cursor 或自建 Agent 流水線裡高頻呼叫大模型的開發者,2026 年 7 月 8 日馬斯克旗下 SpaceXAI 發布的 Grok 4.5 很可能已經出現在你的模型清單裡——馬斯克稱其為「Opus 級智慧,卻只要幾分之一的價格」。本文基於公開 benchmark、獨立測評與 API 定價,完整涵蓋模型規格、定價對比、程式設計與 Agent 評測、TryAI 真實編碼測試、平台接入、6 步實操與 FAQ,幫你判斷 Grok 4.5 是否值得切換。
- TL;DR:Grok 4.5 不是 benchmark 第一的程式設計模型,但在高頻 Agent 場景下,Token 效率 + API 定價使其單次任務成本約為 Claude Code 的四分之一(約 $2.49 vs $11.80)。
- 亮點:與 Cursor 聯合訓練、50 萬 Token 上下文、AutomationBench-AA 首個超 50% 完成率、首 Token <0.5s、約 110 tokens/s。
- 短版:SWE-Bench Pro 落後 Claude Fable 5 約 16 個百分點;幻覺率 AA-Omniscience 達 54%;CursorBench 因訓練資料污染被撤除。
- 適合:高頻 Agent、終端機類任務、已用 Cursor 的團隊、預算敏感型工程組織。
- 謹慎:高精度多檔案重構、金融/安全關鍵程式碼、歐盟 API 尚未開放(預計 7 月中旬)。
SECTION 01 Grok 4.5 是什麼?SpaceXAI 旗艦程式設計模型與 Cursor 聯合訓練背景
Grok 4.5 是 SpaceXAI 上市後推出的第一款旗艦模型,專為程式設計與程式碼 Agent、跨工具自主工作流,以及法律/醫療/教育等知識密集型場景深度最佳化。與以往不同,該模型與 AI 程式設計工具 Cursor 聯合訓練,注入了數兆 Token 的真實開發者互動資料(程式碼審查、除錯流程、Agent 與程式碼庫互動紀錄)。SpaceX 已於 2026 年 6 月完成對 Cursor 母公司 Anysphere 的收購,此次聯合訓練是收購後的首批成果之一。
| 參數 | 數值 |
|---|---|
| 架構 | Mixture of Experts(MoE,混合專家) |
| 上下文視窗 | 500,000 Tokens(50 萬) |
| 推理模式 | 低 / 中 / 高(預設:高) |
| 推理速度 | 官方 80 TPS,實測約 90 TPS |
| 訓練硬體 | 數萬塊 NVIDIA GB300 GPU(孟菲斯資料中心) |
| 參數量 | 未公開(MoE 架構) |
SECTION 02 Grok 4.5 定價多少?API 單價與真實任務成本對比
定價是 Grok 4.5 最核心的賣點。標價已經低於 Claude Opus,但真正的差距來自 Token 效率——在 SWE-Bench Pro 程式設計任務上,Grok 4.5 平均每次只消耗 15,954 個輸出 Token,而 Claude Opus 4.8 同任務消耗 67,020 個,差距 4.2 倍。
| 模型 | 輸入 | 輸出 |
|---|---|---|
| Grok 4.5 | $2.00 | $6.00 |
| Grok 4.5(快取命中) | $0.50 | — |
| Grok 4.5 Fast 版 | $4.00 | $18.00 |
| Claude Opus 4.7 | $5.00 | $25.00 |
| Claude Fable 5 | 更高 | 更高 |
| GPT-5.6 Sol(旗艦) | $5.00 | $30.00 |
| GPT-5.6 Luna(經濟檔) | $1.00 | $6.00 |
| 模型 / 平台 | 每任務平均 Token | 每任務實際成本 |
|---|---|---|
| Grok 4.5 / Grok Build | ~1.9M tokens | $2.49 |
| GPT-5.5 / Codex | ~6.2M tokens | $5.07 |
| Claude Fable 5 / Claude Code | ~7.2M tokens | $11.80 |
按每天 500 次 Agent 任務估算:Grok 4.5 約 $1,245/天,Claude Code 約 $5,900/天——效率差距會隨呼叫量指數級放大。
SECTION 03 Grok 4.5 Benchmark 全解析:程式設計、Agent 與綜合智慧指數
SpaceXAI 官方公布了 4 項程式設計相關評測。我們彙總官方數據與第三方獨立測試如下。
| 評測項目 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| DeepSWE 1.0(官方 harness) | 62.0% | 66.1% | 55.75% | 64.31% |
| DeepSWE 1.1(中立 harness) | 53% | 70% | 59% | 67% |
| Terminal Bench 2.1 | 83.3% | 84.3% | 78.9% | 83.4% |
| SWE-Bench Pro(解決率) | 64.7% | 80.4% | 69.2% | 58.6% |
解讀:DeepSWE 1.1 中立 harness 下 Grok 4.5 跌至第四,Fable 5 領先 17 個百分點;Terminal Bench 2.1 四款頂級模型差距在 5.4 個百分點以內,幾乎是平手;SWE-Bench Pro 是最嚴苛測試,Grok 4.5 排第三,落後 Fable 5 約 16 個點。
Agent 任務 Benchmark(Grok 4.5 亮點舞台):
| 評測項目 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| AutomationBench-AA(657 個企業工作流) | 51.4% | 48.6% | 48.5% |
| Snorkel GDPVal+(專業工作場景) | 29% | — | 21% |
AutomationBench-AA 涵蓋 Gmail、Slack、Salesforce、HubSpot 等 40 個模擬企業應用,Grok 4.5 是首個在不違反業務約束的前提下完成超過一半工作流目標的模型。Snorkel 評測中,Grok 4.5 在法律(40% vs 27–28%)、教育(58% vs 35–42%)、醫療(35% vs 23–25%)等領域大幅領先。
綜合智慧指數:Artificial Analysis 綜合智慧指數 54 分(第四名),排在 Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)之後,但比上一代 Grok 大幅提升 16 分。
CursorBench 撤除說明:CursorBench(Cursor 自有評測集)在發布時被臨時撤除——發現 Cursor 自身程式碼庫的部分快照意外混入了 Grok 4.5 的訓練資料,存在資料污染風險,是本次發布的一個明顯瑕疵。
SECTION 04 真實程式設計對比與可用平台:TryAI 測試 + Grok Build / Cursor / API
獨立測評機構 TryAI 讓 Grok 4.5、GPT-5.5、Claude Opus 4.8、Claude Fable 5 用相同提示詞從零建構相同互動應用:
- 3D 立方體渲染(最難):Opus 4.8 和 Fable 5 一次成功;Grok 4.5 第一次只渲染標題和按鈕、無立方體,第二次重試成功;GPT-5.5 失敗。
- 速度:Grok 4.5 首 Token <0.5 秒,流速約 110 tokens/秒(約是競品的 2 倍)。
- 成本:Grok 4.5 每次測試執行成本最低。
結論:高頻重複性程式設計任務中,Grok 4.5 的速度和成本優勢壓倒性領先;需要一次到位複雜狀態管理的高精度任務上,Claude 系列仍然更可靠。
可用平台(歐盟地區預計 7 月中旬開放):
- Grok Build:SpaceXAI 自家 Coding Agent 平台,Grok 4.5 為預設模型
- Cursor:所有訂閱方案均可使用(桌面端、Web、iOS、CLI、SDK),首週使用量加倍
- SpaceXAI Console API:支援 Chat Completions 和 Responses API,區域 us-east-1 / us-west-2,限流 150 req/s、50M tokens/min
- Office 外掛:Word、PowerPoint、Excel 預設模型
- 第三方閘道:OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "幫我找出這段程式碼的 bug 並修復:function median(a){a.sort();return a[a.length/2]}"
}'
SECTION 05 Grok 4.5 怎麼接入?Cursor 與 API 六步實操指南
- 在 Cursor 中選擇模型:開啟 Cursor → 模型選擇器 → 選擇 Grok 4.5(所有訂閱方案已內建,首週用量加倍)。
- 取得 SpaceXAI API Key:登入 SpaceXAI Console,在 API Keys 頁面建立金鑰,確認帳戶可存取 us-east-1 或 us-west-2。
- 設定環境變數:在本機或 CI 中設定
export XAI_API_KEY="your-key",勿將金鑰提交到版本儲存庫。 - 啟用 Prompt 快取:Responses API 設定
prompt_cache_key,或 Chat Completions 使用x-grok-conv-idHeader,將輸入價格從 $2.00/M 降至 $0.50/M。 - 長 Agent 迴圈開啟 Context Compaction:減少多輪對話 Token 累積,降低高頻流水線總成本。
- 建立混合模型路由:將常規子任務路由給 Grok 4.5,最複雜架構決策留給 Claude Fable 5,並在輸出側加入自動化驗證(尤其幻覺敏感場景)。
SECTION 06 值得切換嗎?適合場景、風險與可引用數據
適合 Grok 4.5 的場景:
- 每天執行數百到數千次程式設計任務的團隊,成本節省立竿見影
- 終端機類任務和工具呼叫(Terminal Bench 2.1、AutomationBench 頂級表現)
- 已深度整合 Cursor 的團隊,原生支援無縫切換
- 新創公司與預算敏感團隊,相近智慧水平下每任務成本不到競品四分之一
- 混合模型策略:常規子任務 Grok 4.5,複雜架構決策 Claude Fable 5
需要謹慎的場景:
- SWE-Bench Pro 類高精度程式碼任務(Fable 5 領先約 16 個百分點)
- 幻覺率敏感場景:AA-Omniscience Index 幻覺率達 54%,生產環境需加強輸出驗證
- 歐盟使用者:API 當前僅在 us-east-1 和 us-west-2 可用
- CursorBench 相關效能數據因訓練資料污染被撤除,需等待獨立重測
可引用硬核數據:
- 上下文視窗:500,000 tokens
- SWE-Bench Pro 輸出 Token 效率:15,954(Grok 4.5)vs 67,020(Opus 4.8),差距 4.2×
- 單次 Agent 任務成本:$2.49(Grok 4.5)vs $11.80(Claude Code)
- AutomationBench-AA:51.4%,首個超 50% 企業工作流完成率
- Artificial Analysis 智慧指數:54 分,較上一代 +16 分
在本機 Mac 上跑高頻 Agent 流水線,筆電休眠、網路波動與多工搶占會打斷 7×24 自動化;純虛擬機方案還有 Hypervisor 損耗與 macOS EULA 限制。對於需要零損耗原生算力、穩定 iOS/macOS CI/CD 與 AI Agent 長期上線的生產環境,MACNOX 的雲端物理節點通常是更優解:100% 蘋果原裝 Mac Mini M4、完整 Root 權限、按天/週/月彈性下單、無 Hypervisor 損耗,可將 Grok Agent 與編譯流水線部署在獨立實體機上。可參考Mac Mini M4 租 vs 買費用對比與Claude Code 安全風險處置,前往定價頁查看方案。
Grok 4.5 不是「最強的程式設計模型」,但它是性價比最高的 Opus 級程式設計 Agent——當你把 Token 效率與 API 定價折算成實際任務成本時,它在主流 Agent 工作流上能以更低價格完成與 Opus 4.8 相近品質的工作。若場景對準確率要求極高(金融程式碼、安全關鍵系統),Claude Fable 5 仍是更保險的選擇。
官方與第三方參考來源(發版後請再次開啟連結核對):
TechCrunch — SpaceXAI releases Grok 4.5
Awesome Agents 獨立評測 — Grok 4.5
SECTION 07 常見問題 FAQ
Grok 4.5 比 Claude Opus 4.8 更好嗎?
取決於「更好」的定義。Opus 4.8 在 SWE-Bench Pro 程式設計準確率上更高(69.2% vs 64.7%);Grok 4.5 在速度、Token 效率與單次任務成本上領先,Agent 工作流完成率也略勝。高頻 Agent 場景選 Grok,高精度一次性編碼選 Claude。
Grok 4.5 免費嗎?
SpaceXAI 在 Grok Build 和 Cursor 中提供限時免費額度。之後 API 定價為 $2/M 輸入、$6/M 輸出。Cursor 訂閱方案已將其納入模型池。
如何在 Cursor 中使用 Grok 4.5?
所有 Cursor 方案自動可用。開啟 Cursor → 模型選擇 → 選擇 Grok 4.5。發布後首週使用量加倍。
上下文視窗多大?
500,000 tokens(50 萬),足以涵蓋大多數大型程式碼庫任務。
為什麼 CursorBench 被撤除?
Cursor 自身程式碼庫快照意外納入 Grok 4.5 訓練資料,污染了該評測。SpaceXAI 已撤回相關資料,等待獨立重測。
OpenRouter 能用 Grok 4.5 嗎?
可以。Grok 4.5 可透過 OpenRouter、Vercel AI Gateway、Cloudflare、Snowflake、Databricks Mosaic 等第三方閘道存取。