如果你是一名在 Cursor 或自建 Agent 流水线里高频调用大模型的开发者,2026 年 7 月 8 日马斯克旗下 SpaceXAI 发布的 Grok 4.5 很可能已经出现在你的模型列表里——马斯克称其为「Opus 级智能,却只要几分之一的价格」。本文基于公开 benchmark、独立测评与 API 定价,完整覆盖模型规格、定价对比、编程与 Agent 评测、TryAI 真实编码测试、平台接入、6 步实操与 FAQ,帮你判断 Grok 4.5 是否值得切换。
- TL;DR:Grok 4.5 不是 benchmark 第一的编程模型,但在高频 Agent 场景下,Token 效率 + API 定价使其单次任务成本约为 Claude Code 的四分之一(约 $2.49 vs $11.80)。
- 亮点:与 Cursor 联合训练、50 万 Token 上下文、AutomationBench-AA 首个超 50% 完成率、首 Token <0.5s、约 110 tokens/s。
- 短板:SWE-Bench Pro 落后 Claude Fable 5 约 16 个百分点;幻觉率 AA-Omniscience 达 54%;CursorBench 因训练数据污染被撤除。
- 适合:高频 Agent、终端类任务、已用 Cursor 的团队、预算敏感型工程组织。
- 谨慎:高精度多文件重构、金融/安全关键代码、欧盟 API 尚未开放(预计 7 月中旬)。
SECTION 01 Grok 4.5 是什么?SpaceXAI 旗舰编程模型与 Cursor 联合训练背景
Grok 4.5 是 SpaceXAI 上市后推出的第一款旗舰模型,专为编程与代码 Agent、跨工具自主工作流、以及法律/医疗/教育等知识密集型场景深度优化。与以往不同,该模型与 AI 编程工具 Cursor 联合训练,注入了数万亿 Token 的真实开发者交互数据(代码审查、调试流程、Agent 与代码库互动记录)。SpaceX 已于 2026 年 6 月完成对 Cursor 母公司 Anysphere 的收购,此次联合训练是收购后的首批成果之一。
| 参数 | 数值 |
|---|---|
| 架构 | Mixture of Experts(MoE,混合专家) |
| 上下文窗口 | 500,000 Tokens(50 万) |
| 推理模式 | 低 / 中 / 高(默认:高) |
| 推理速度 | 官方 80 TPS,实测约 90 TPS |
| 训练硬件 | 数万块 NVIDIA GB300 GPU(孟菲斯数据中心) |
| 参数量 | 未公开(MoE 架构) |
SECTION 02 Grok 4.5 定价多少?API 单价与真实任务成本对比
定价是 Grok 4.5 最核心的卖点。贴纸价格已经低于 Claude Opus,但真正的差距来自 Token 效率——在 SWE-Bench Pro 编程任务上,Grok 4.5 平均每次只消耗 15,954 个输出 Token,而 Claude Opus 4.8 同任务消耗 67,020 个,差距 4.2 倍。
| 模型 | 输入 | 输出 |
|---|---|---|
| Grok 4.5 | $2.00 | $6.00 |
| Grok 4.5(缓存命中) | $0.50 | — |
| Grok 4.5 Fast 版 | $4.00 | $18.00 |
| Claude Opus 4.7 | $5.00 | $25.00 |
| Claude Fable 5 | 更高 | 更高 |
| GPT-5.6 Sol(旗舰) | $5.00 | $30.00 |
| GPT-5.6 Luna(经济档) | $1.00 | $6.00 |
| 模型 / 平台 | 每任务平均 Token | 每任务实际成本 |
|---|---|---|
| Grok 4.5 / Grok Build | ~1.9M tokens | $2.49 |
| GPT-5.5 / Codex | ~6.2M tokens | $5.07 |
| Claude Fable 5 / Claude Code | ~7.2M tokens | $11.80 |
按每天 500 次 Agent 任务估算:Grok 4.5 约 $1,245/天,Claude Code 约 $5,900/天——效率差距会随调用量指数级放大。
SECTION 03 Grok 4.5 Benchmark 全解析:编程、Agent 与综合智能指数
SpaceXAI 官方公布了 4 项编程相关评测。我们汇总官方数据与第三方独立测试如下。
| 评测项目 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| DeepSWE 1.0(官方 harness) | 62.0% | 66.1% | 55.75% | 64.31% |
| DeepSWE 1.1(中立 harness) | 53% | 70% | 59% | 67% |
| Terminal Bench 2.1 | 83.3% | 84.3% | 78.9% | 83.4% |
| SWE-Bench Pro(解决率) | 64.7% | 80.4% | 69.2% | 58.6% |
解读:DeepSWE 1.1 中立 harness 下 Grok 4.5 跌至第四,Fable 5 领先 17 个百分点;Terminal Bench 2.1 四款顶级模型差距在 5.4 个百分点以内,几乎是平局;SWE-Bench Pro 是最严苛测试,Grok 4.5 排第三,落后 Fable 5 约 16 个点。
Agent 任务 Benchmark(Grok 4.5 高光舞台):
| 评测项目 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| AutomationBench-AA(657 个企业工作流) | 51.4% | 48.6% | 48.5% |
| Snorkel GDPVal+(专业工作场景) | 29% | — | 21% |
AutomationBench-AA 涵盖 Gmail、Slack、Salesforce、HubSpot 等 40 个模拟企业应用,Grok 4.5 是首个在不违反业务约束的前提下完成超过一半工作流目标的模型。Snorkel 评测中,Grok 4.5 在法律(40% vs 27–28%)、教育(58% vs 35–42%)、医疗(35% vs 23–25%)等领域大幅领先。
综合智能指数:Artificial Analysis 综合智能指数 54 分(第四名),排在 Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)之后,但比上一代 Grok 大幅提升 16 分。
CursorBench 撤除说明:CursorBench(Cursor 自有评测集)在发布时被临时撤除——发现 Cursor 自身代码库的部分快照意外混入了 Grok 4.5 的训练数据,存在数据污染风险,是本次发布的一个明显瑕疵。
SECTION 04 真实编程对比与可用平台:TryAI 测试 + Grok Build / Cursor / API
独立测评机构 TryAI 让 Grok 4.5、GPT-5.5、Claude Opus 4.8、Claude Fable 5 用相同提示词从零构建相同交互应用:
- 3D 立方体渲染(最难):Opus 4.8 和 Fable 5 一次成功;Grok 4.5 第一次只渲染标题和按钮、无立方体,第二次重试成功;GPT-5.5 失败。
- 速度:Grok 4.5 首 Token <0.5 秒,流速约 110 tokens/秒(约是竞品的 2 倍)。
- 成本:Grok 4.5 每次测试运行成本最低。
结论:高频重复性编程任务中,Grok 4.5 的速度和成本优势碾压;需要一次搞定复杂状态管理的高精度任务上,Claude 系列仍然更可靠。
可用平台(欧盟地区预计 7 月中旬开放):
- Grok Build:SpaceXAI 自家 Coding Agent 平台,Grok 4.5 为默认模型
- Cursor:所有订阅计划均可使用(桌面端、Web、iOS、CLI、SDK),首周使用量加倍
- SpaceXAI Console API:支持 Chat Completions 和 Responses API,区域 us-east-1 / us-west-2,限流 150 req/s、50M tokens/min
- Office 插件:Word、PowerPoint、Excel 默认模型
- 第三方网关:OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "帮我找出这段代码的 bug 并修复:function median(a){a.sort();return a[a.length/2]}"
}'
SECTION 05 Grok 4.5 怎么接入?Cursor 与 API 六步实操指南
- 在 Cursor 中选择模型:打开 Cursor → 模型选择器 → 选择 Grok 4.5(所有订阅计划已内置,首周用量加倍)。
- 获取 SpaceXAI API Key:登录 SpaceXAI Console,在 API Keys 页面创建密钥,确认账户可访问 us-east-1 或 us-west-2。
- 配置环境变量:在本地或 CI 中设置
export XAI_API_KEY="your-key",勿将密钥提交到版本库。 - 启用 Prompt 缓存:Responses API 设置
prompt_cache_key,或 Chat Completions 使用x-grok-conv-idHeader,将输入价格从 $2.00/M 降至 $0.50/M。 - 长 Agent 循环开启 Context Compaction:减少多轮对话 Token 累积,降低高频流水线总成本。
- 建立混合模型路由:将常规子任务路由给 Grok 4.5,最复杂架构决策留给 Claude Fable 5,并在输出侧加入自动化验证(尤其幻觉敏感场景)。
SECTION 06 值得切换吗?适合场景、风险与可引用数据
适合 Grok 4.5 的场景:
- 每天运行数百到数千次编程任务的团队,成本节省立竿见影
- 终端类任务和工具调用(Terminal Bench 2.1、AutomationBench 顶级表现)
- 已深度集成 Cursor 的团队,原生支持无缝切换
- 初创公司与预算敏感团队,相近智能水平下每任务成本不到竞品四分之一
- 混合模型策略:常规子任务 Grok 4.5,复杂架构决策 Claude Fable 5
需要谨慎的场景:
- SWE-Bench Pro 类高精度代码任务(Fable 5 领先约 16 个百分点)
- 幻觉率敏感场景:AA-Omniscience Index 幻觉率达 54%,生产环境需加强输出验证
- 欧盟用户:API 当前仅在 us-east-1 和 us-west-2 可用
- CursorBench 相关性能数据因训练数据污染被撤除,需等待独立重测
可引用硬核数据:
- 上下文窗口:500,000 tokens
- SWE-Bench Pro 输出 Token 效率:15,954(Grok 4.5)vs 67,020(Opus 4.8),差距 4.2×
- 单次 Agent 任务成本:$2.49(Grok 4.5)vs $11.80(Claude Code)
- AutomationBench-AA:51.4%,首个超 50% 企业工作流完成率
- Artificial Analysis 智能指数:54 分,较上一代 +16 分
在本地 Mac 上跑高频 Agent 流水线,笔记本休眠、网络波动与多任务争抢会打断 7×24 自动化;纯虚拟机方案还有 Hypervisor 损耗与 macOS EULA 限制。对于需要零损耗原生算力、稳定 iOS/macOS CI/CD 与 AI Agent 长期在线的生产环境,MACNOX 的云端物理节点通常是更优解:100% 苹果原装 Mac Mini M4、完整 Root 权限、按天/周/月弹性下单、无 Hypervisor 损耗,可将 Grok Agent 与编译流水线部署在独立物理机上。可参考Mac Mini M4 租 vs 买费用对比与Claude Code 安全风险处置,前往定价页查看方案。
Grok 4.5 不是「最强的编程模型」,但它是性价比最高的 Opus 级编程 Agent——当你把 Token 效率与 API 定价折算成实际任务成本时,它在主流 Agent 工作流上能以更低价格完成与 Opus 4.8 相近质量的工作。若场景对准确率要求极高(金融代码、安全关键系统),Claude Fable 5 仍是更保险的选择。
官方与第三方参考来源(发版后请再次打开链接核对):
TechCrunch — SpaceXAI releases Grok 4.5
Awesome Agents 独立评测 — Grok 4.5
SECTION 07 常见问题 FAQ
Grok 4.5 比 Claude Opus 4.8 更好吗?
取决于「更好」的定义。Opus 4.8 在 SWE-Bench Pro 编程准确率上更高(69.2% vs 64.7%);Grok 4.5 在速度、Token 效率与单次任务成本上领先,Agent 工作流完成率也略胜。高频 Agent 场景选 Grok,高精度一次性编码选 Claude。
Grok 4.5 免费吗?
SpaceXAI 在 Grok Build 和 Cursor 中提供限时免费额度。之后 API 定价为 $2/M 输入、$6/M 输出。Cursor 订阅计划已将其纳入模型池。
如何在 Cursor 中使用 Grok 4.5?
所有 Cursor 计划自动可用。打开 Cursor → 模型选择 → 选择 Grok 4.5。发布后首周使用量加倍。
上下文窗口多大?
500,000 tokens(50 万),足以覆盖大多数大型代码库任务。
为什么 CursorBench 被撤除?
Cursor 自身代码库快照意外纳入 Grok 4.5 训练数据,污染了该评测。SpaceXAI 已撤回相关数据,等待独立重测。
OpenRouter 能用 Grok 4.5 吗?
可以。Grok 4.5 可通过 OpenRouter、Vercel AI Gateway、Cloudflare、Snowflake、Databricks Mosaic 等第三方网关访问。