首页 / 博客 / Grok 4.5 评测
ENGINEERING_BLOG · 2026.07.11

Grok 4.5 深度评测:
SpaceXAI 最强编程模型,真的比 Claude Opus 便宜 4 倍吗?

如果你是一名在 Cursor 或自建 Agent 流水线里高频调用大模型的开发者,2026 年 7 月 8 日马斯克旗下 SpaceXAI 发布的 Grok 4.5 很可能已经出现在你的模型列表里——马斯克称其为「Opus 级智能,却只要几分之一的价格」。本文基于公开 benchmark、独立测评与 API 定价,完整覆盖模型规格、定价对比、编程与 Agent 评测、TryAI 真实编码测试、平台接入、6 步实操与 FAQ,帮你判断 Grok 4.5 是否值得切换。

  • TL;DR:Grok 4.5 不是 benchmark 第一的编程模型,但在高频 Agent 场景下,Token 效率 + API 定价使其单次任务成本约为 Claude Code 的四分之一(约 $2.49 vs $11.80)。
  • 亮点:与 Cursor 联合训练、50 万 Token 上下文、AutomationBench-AA 首个超 50% 完成率、首 Token <0.5s、约 110 tokens/s。
  • 短板:SWE-Bench Pro 落后 Claude Fable 5 约 16 个百分点;幻觉率 AA-Omniscience 达 54%;CursorBench 因训练数据污染被撤除。
  • 适合:高频 Agent、终端类任务、已用 Cursor 的团队、预算敏感型工程组织。
  • 谨慎:高精度多文件重构、金融/安全关键代码、欧盟 API 尚未开放(预计 7 月中旬)。

SECTION 01 Grok 4.5 是什么?SpaceXAI 旗舰编程模型与 Cursor 联合训练背景

Grok 4.5 是 SpaceXAI 上市后推出的第一款旗舰模型,专为编程与代码 Agent、跨工具自主工作流、以及法律/医疗/教育等知识密集型场景深度优化。与以往不同,该模型与 AI 编程工具 Cursor 联合训练,注入了数万亿 Token 的真实开发者交互数据(代码审查、调试流程、Agent 与代码库互动记录)。SpaceX 已于 2026 年 6 月完成对 Cursor 母公司 Anysphere 的收购,此次联合训练是收购后的首批成果之一。

Grok 4.5 核心规格一览
参数 数值
架构 Mixture of Experts(MoE,混合专家)
上下文窗口 500,000 Tokens(50 万)
推理模式 低 / 中 / 高(默认:高)
推理速度 官方 80 TPS,实测约 90 TPS
训练硬件 数万块 NVIDIA GB300 GPU(孟菲斯数据中心)
参数量 未公开(MoE 架构)

SECTION 02 Grok 4.5 定价多少?API 单价与真实任务成本对比

定价是 Grok 4.5 最核心的卖点。贴纸价格已经低于 Claude Opus,但真正的差距来自 Token 效率——在 SWE-Bench Pro 编程任务上,Grok 4.5 平均每次只消耗 15,954 个输出 Token,而 Claude Opus 4.8 同任务消耗 67,020 个,差距 4.2 倍

API 单价对比(per 1M tokens)
模型 输入 输出
Grok 4.5 $2.00 $6.00
Grok 4.5(缓存命中) $0.50
Grok 4.5 Fast 版 $4.00 $18.00
Claude Opus 4.7 $5.00 $25.00
Claude Fable 5 更高 更高
GPT-5.6 Sol(旗舰) $5.00 $30.00
GPT-5.6 Luna(经济档) $1.00 $6.00
真实编程 Agent 任务每次成本估算
模型 / 平台 每任务平均 Token 每任务实际成本
Grok 4.5 / Grok Build ~1.9M tokens $2.49
GPT-5.5 / Codex ~6.2M tokens $5.07
Claude Fable 5 / Claude Code ~7.2M tokens $11.80

按每天 500 次 Agent 任务估算:Grok 4.5 约 $1,245/天,Claude Code 约 $5,900/天——效率差距会随调用量指数级放大。

SECTION 03 Grok 4.5 Benchmark 全解析:编程、Agent 与综合智能指数

SpaceXAI 官方公布了 4 项编程相关评测。我们汇总官方数据与第三方独立测试如下。

编程 Benchmark 对比
评测项目 Grok 4.5 Claude Fable 5 Claude Opus 4.8 GPT-5.5
DeepSWE 1.0(官方 harness) 62.0% 66.1% 55.75% 64.31%
DeepSWE 1.1(中立 harness) 53% 70% 59% 67%
Terminal Bench 2.1 83.3% 84.3% 78.9% 83.4%
SWE-Bench Pro(解决率) 64.7% 80.4% 69.2% 58.6%

解读:DeepSWE 1.1 中立 harness 下 Grok 4.5 跌至第四,Fable 5 领先 17 个百分点;Terminal Bench 2.1 四款顶级模型差距在 5.4 个百分点以内,几乎是平局;SWE-Bench Pro 是最严苛测试,Grok 4.5 排第三,落后 Fable 5 约 16 个点。

Agent 任务 Benchmark(Grok 4.5 高光舞台):

Agent 与企业工作流 Benchmark
评测项目 Grok 4.5 Claude Fable 5 Claude Opus 4.8
AutomationBench-AA(657 个企业工作流) 51.4% 48.6% 48.5%
Snorkel GDPVal+(专业工作场景) 29% 21%

AutomationBench-AA 涵盖 Gmail、Slack、Salesforce、HubSpot 等 40 个模拟企业应用,Grok 4.5 是首个在不违反业务约束的前提下完成超过一半工作流目标的模型。Snorkel 评测中,Grok 4.5 在法律(40% vs 27–28%)、教育(58% vs 35–42%)、医疗(35% vs 23–25%)等领域大幅领先。

综合智能指数:Artificial Analysis 综合智能指数 54 分(第四名),排在 Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)之后,但比上一代 Grok 大幅提升 16 分。

CursorBench 撤除说明:CursorBench(Cursor 自有评测集)在发布时被临时撤除——发现 Cursor 自身代码库的部分快照意外混入了 Grok 4.5 的训练数据,存在数据污染风险,是本次发布的一个明显瑕疵。

SECTION 04 真实编程对比与可用平台:TryAI 测试 + Grok Build / Cursor / API

独立测评机构 TryAI 让 Grok 4.5、GPT-5.5、Claude Opus 4.8、Claude Fable 5 用相同提示词从零构建相同交互应用:

  • 3D 立方体渲染(最难):Opus 4.8 和 Fable 5 一次成功;Grok 4.5 第一次只渲染标题和按钮、无立方体,第二次重试成功;GPT-5.5 失败。
  • 速度:Grok 4.5 首 Token <0.5 秒,流速约 110 tokens/秒(约是竞品的 2 倍)。
  • 成本:Grok 4.5 每次测试运行成本最低。

结论:高频重复性编程任务中,Grok 4.5 的速度和成本优势碾压;需要一次搞定复杂状态管理的高精度任务上,Claude 系列仍然更可靠。

可用平台(欧盟地区预计 7 月中旬开放):

  • Grok Build:SpaceXAI 自家 Coding Agent 平台,Grok 4.5 为默认模型
  • Cursor:所有订阅计划均可使用(桌面端、Web、iOS、CLI、SDK),首周使用量加倍
  • SpaceXAI Console API:支持 Chat Completions 和 Responses API,区域 us-east-1 / us-west-2,限流 150 req/s、50M tokens/min
  • Office 插件:Word、PowerPoint、Excel 默认模型
  • 第三方网关:OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic
api-call.sh
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "帮我找出这段代码的 bug 并修复:function median(a){a.sort();return a[a.length/2]}"
  }'

SECTION 05 Grok 4.5 怎么接入?Cursor 与 API 六步实操指南

  1. 在 Cursor 中选择模型:打开 Cursor → 模型选择器 → 选择 Grok 4.5(所有订阅计划已内置,首周用量加倍)。
  2. 获取 SpaceXAI API Key:登录 SpaceXAI Console,在 API Keys 页面创建密钥,确认账户可访问 us-east-1 或 us-west-2。
  3. 配置环境变量:在本地或 CI 中设置 export XAI_API_KEY="your-key",勿将密钥提交到版本库。
  4. 启用 Prompt 缓存:Responses API 设置 prompt_cache_key,或 Chat Completions 使用 x-grok-conv-id Header,将输入价格从 $2.00/M 降至 $0.50/M
  5. 长 Agent 循环开启 Context Compaction:减少多轮对话 Token 累积,降低高频流水线总成本。
  6. 建立混合模型路由:将常规子任务路由给 Grok 4.5,最复杂架构决策留给 Claude Fable 5,并在输出侧加入自动化验证(尤其幻觉敏感场景)。

SECTION 06 值得切换吗?适合场景、风险与可引用数据

适合 Grok 4.5 的场景:

  • 每天运行数百到数千次编程任务的团队,成本节省立竿见影
  • 终端类任务和工具调用(Terminal Bench 2.1、AutomationBench 顶级表现)
  • 已深度集成 Cursor 的团队,原生支持无缝切换
  • 初创公司与预算敏感团队,相近智能水平下每任务成本不到竞品四分之一
  • 混合模型策略:常规子任务 Grok 4.5,复杂架构决策 Claude Fable 5

需要谨慎的场景:

  • SWE-Bench Pro 类高精度代码任务(Fable 5 领先约 16 个百分点)
  • 幻觉率敏感场景:AA-Omniscience Index 幻觉率达 54%,生产环境需加强输出验证
  • 欧盟用户:API 当前仅在 us-east-1 和 us-west-2 可用
  • CursorBench 相关性能数据因训练数据污染被撤除,需等待独立重测

可引用硬核数据:

  • 上下文窗口:500,000 tokens
  • SWE-Bench Pro 输出 Token 效率:15,954(Grok 4.5)vs 67,020(Opus 4.8),差距 4.2×
  • 单次 Agent 任务成本:$2.49(Grok 4.5)vs $11.80(Claude Code)
  • AutomationBench-AA:51.4%,首个超 50% 企业工作流完成率
  • Artificial Analysis 智能指数:54 分,较上一代 +16 分

在本地 Mac 上跑高频 Agent 流水线,笔记本休眠、网络波动与多任务争抢会打断 7×24 自动化;纯虚拟机方案还有 Hypervisor 损耗与 macOS EULA 限制。对于需要零损耗原生算力、稳定 iOS/macOS CI/CD 与 AI Agent 长期在线的生产环境,MACNOX 的云端物理节点通常是更优解:100% 苹果原装 Mac Mini M4、完整 Root 权限、按天/周/月弹性下单、无 Hypervisor 损耗,可将 Grok Agent 与编译流水线部署在独立物理机上。可参考Mac Mini M4 租 vs 买费用对比Claude Code 安全风险处置,前往定价页查看方案。

Grok 4.5 不是「最强的编程模型」,但它是性价比最高的 Opus 级编程 Agent——当你把 Token 效率与 API 定价折算成实际任务成本时,它在主流 Agent 工作流上能以更低价格完成与 Opus 4.8 相近质量的工作。若场景对准确率要求极高(金融代码、安全关键系统),Claude Fable 5 仍是更保险的选择。

官方与第三方参考来源(发版后请再次打开链接核对):

SpaceXAI 官方发布 — Grok 4.5

Cursor 联合发布声明 — Grok 4.5

SpaceXAI 官方文档 — Grok 4.5 API

TechCrunch — SpaceXAI releases Grok 4.5

Awesome Agents 独立评测 — Grok 4.5

Snorkel AI 专业场景测试 — Grok 4.5

SECTION 07 常见问题 FAQ

Grok 4.5 比 Claude Opus 4.8 更好吗?

取决于「更好」的定义。Opus 4.8 在 SWE-Bench Pro 编程准确率上更高(69.2% vs 64.7%);Grok 4.5 在速度、Token 效率与单次任务成本上领先,Agent 工作流完成率也略胜。高频 Agent 场景选 Grok,高精度一次性编码选 Claude。

Grok 4.5 免费吗?

SpaceXAI 在 Grok Build 和 Cursor 中提供限时免费额度。之后 API 定价为 $2/M 输入、$6/M 输出。Cursor 订阅计划已将其纳入模型池。

如何在 Cursor 中使用 Grok 4.5?

所有 Cursor 计划自动可用。打开 Cursor → 模型选择 → 选择 Grok 4.5。发布后首周使用量加倍。

上下文窗口多大?

500,000 tokens(50 万),足以覆盖大多数大型代码库任务。

为什么 CursorBench 被撤除?

Cursor 自身代码库快照意外纳入 Grok 4.5 训练数据,污染了该评测。SpaceXAI 已撤回相关数据,等待独立重测。

OpenRouter 能用 Grok 4.5 吗?

可以。Grok 4.5 可通过 OpenRouter、Vercel AI Gateway、Cloudflare、Snowflake、Databricks Mosaic 等第三方网关访问。