Cursor や自前の Agent パイプラインで大規模言語モデルを高頻度に呼び出している開発者にとって、2026 年 7 月 8 日にマスク氏率いる SpaceXAI がリリースした Grok 4.5 は、すでにモデル一覧に現れている可能性があります。マスク氏は「Opus 級の知能を、わずかな価格で」と評しています。本記事では公開 benchmark、独立評価、API 料金に基づき、モデル仕様、料金比較、プログラミングと Agent 評価、TryAI 実測コーディングテスト、プラットフォーム接続、6 ステップ実践ガイド、FAQ を網羅し、Grok 4.5 への切り替えが妥当かどうかを判断できる材料を提供します。
- 要約(TL;DR):Grok 4.5 は benchmark 首位のコーディングモデルではありませんが、高頻度 Agent シナリオでは Token 効率と API 料金により、1 タスクあたりのコストは Claude Code の約 4 分の 1(約 $2.49 vs $11.80)になります。
- 強み:Cursor との共同訓練、50 万 Token コンテキスト、AutomationBench-AA で初の 50% 超完了率、初 Token <0.5s、約 110 tokens/s。
- 弱み:SWE-Bench Pro で Claude Fable 5 より約 16 ポイント低い;幻覚率 AA-Omniscience は 54%;CursorBench は訓練データ汚染により撤回。
- 向いている用途:高頻度 Agent、ターミナル系タスク、Cursor 利用チーム、予算に敏感なエンジニアリング組織。
- 慎重に:高精度な複数ファイルリファクタ、金融・セキュリティクリティカルなコード、EU 向け API は未開放(7 月中旬予定)。
SECTION 01 Grok 4.5 とは?SpaceXAI フラッグシップと Cursor 共同訓練の背景
Grok 4.5 は SpaceXAI 上場後初のフラッグシップモデルで、コーディングとコード Agent、クロスツール自律ワークフロー、法律・医療・教育など知識集約型シナリオ向けに最適化されています。従来と異なり、AI コーディングツール Cursor と共同訓練され、数兆 Token の実開発者インタラクションデータ(コードレビュー、デバッグフロー、Agent とコードベースのやり取り)が注入されています。SpaceX は 2026 年 6 月に Cursor 親会社 Anysphere の買収を完了しており、今回の共同訓練は買収後の最初の成果の一つです。
| 項目 | 値 |
|---|---|
| アーキテクチャ | Mixture of Experts(MoE、混合エキスパート) |
| コンテキストウィンドウ | 500,000 Tokens(50 万) |
| 推論モード | 低 / 中 / 高(デフォルト:高) |
| 推論速度 | 公式 80 TPS、実測約 90 TPS |
| 訓練ハードウェア | 数万基 NVIDIA GB300 GPU(メンフィスデータセンター) |
| パラメータ数 | 非公開(MoE アーキテクチャ) |
SECTION 02 Grok 4.5 の料金は?API 単価と実タスクコスト比較
料金は Grok 4.5 の最大の訴求点です。表示価格だけでも Claude Opus より低いですが、真の差は Token 効率にあります。SWE-Bench Pro プログラミングタスクでは、Grok 4.5 は平均 15,954 出力 Token を消費するのに対し、Claude Opus 4.8 は同タスクで 67,020 Token を消費し、4.2 倍の差があります。
| モデル | 入力 | 出力 |
|---|---|---|
| Grok 4.5 | $2.00 | $6.00 |
| Grok 4.5(キャッシュヒット) | $0.50 | — |
| Grok 4.5 Fast 版 | $4.00 | $18.00 |
| Claude Opus 4.7 | $5.00 | $25.00 |
| Claude Fable 5 | より高い | より高い |
| GPT-5.6 Sol(フラッグシップ) | $5.00 | $30.00 |
| GPT-5.6 Luna(エコノミー) | $1.00 | $6.00 |
| モデル / プラットフォーム | タスクあたり平均 Token | タスクあたり実コスト |
|---|---|---|
| Grok 4.5 / Grok Build | ~1.9M tokens | $2.49 |
| GPT-5.5 / Codex | ~6.2M tokens | $5.07 |
| Claude Fable 5 / Claude Code | ~7.2M tokens | $11.80 |
1 日 500 回の Agent タスクと仮定すると、Grok 4.5 は約 $1,245/日、Claude Code は約 $5,900/日——効率差は呼び出し量に応じて指数関数的に拡大します。
SECTION 03 Grok 4.5 Benchmark 完全解説:プログラミング、Agent、総合知能指数
SpaceXAI は 4 つのプログラミング関連評価を公表しました。公式データと第三者独立テストを以下にまとめます。
| 評価項目 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| DeepSWE 1.0(公式 harness) | 62.0% | 66.1% | 55.75% | 64.31% |
| DeepSWE 1.1(中立 harness) | 53% | 70% | 59% | 67% |
| Terminal Bench 2.1 | 83.3% | 84.3% | 78.9% | 83.4% |
| SWE-Bench Pro(解決率) | 64.7% | 80.4% | 69.2% | 58.6% |
解読:DeepSWE 1.1 の中立 harness では Grok 4.5 は 4 位に後退し、Fable 5 が 17 ポイントリードします。Terminal Bench 2.1 では 4 つのトップモデルが 5.4 ポイント以内でほぼ互角です。SWE-Bench Pro は最も厳しいテストで、Grok 4.5 は 3 位、Fable 5 より約 16 ポイント低い結果です。
Agent タスク Benchmark(Grok 4.5 のハイライト):
| 評価項目 | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| AutomationBench-AA(657 エンタープライズワークフロー) | 51.4% | 48.6% | 48.5% |
| Snorkel GDPVal+(専門業務シナリオ) | 29% | — | 21% |
AutomationBench-AA は Gmail、Slack、Salesforce、HubSpot など 40 の模擬エンタープライズアプリをカバーし、Grok 4.5 はビジネス制約に違反せずにワークフロー目標の半分以上を達成した初のモデルです。Snorkel 評価では、Grok 4.5 は法律(40% vs 27–28%)、教育(58% vs 35–42%)、医療(35% vs 23–25%)で大きくリードしています。
総合知能指数:Artificial Analysis 総合知能指数は 54 点(4 位)で、Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)に次ぎますが、前世代 Grok から 16 点大幅に向上しています。
CursorBench 撤回の説明:CursorBench(Cursor 独自評価セット)はリリース時に一時撤回されました。Cursor 自身のコードベースの一部スナップショットが Grok 4.5 の訓練データに混入したデータ汚染リスクが判明したためで、今回のリリースにおける明確な瑕疵です。
SECTION 04 実践コーディング比較と利用可能プラットフォーム:TryAI テスト + Grok Build / Cursor / API
独立評価機関 TryAI は、Grok 4.5、GPT-5.5、Claude Opus 4.8、Claude Fable 5 に同一プロンプトで同一のインタラクティブアプリをゼロから構築させました。
- 3D 立方体レンダリング(最難):Opus 4.8 と Fable 5 は一発成功;Grok 4.5 は初回タイトルとボタンのみで立方体なし、再試行で成功;GPT-5.5 は失敗。
- 速度:Grok 4.5 は初 Token <0.5 秒、流速約 110 tokens/秒(競合の約 2 倍)。
- コスト:Grok 4.5 は各テスト実行のコストが最低。
結論:高頻度の反復的コーディングタスクでは、Grok 4.5 の速度とコスト優位が際立ちます。複雑な状態管理を一発でこなす高精度タスクでは、Claude シリーズが依然としてより信頼できます。
利用可能プラットフォーム(EU 地域は 7 月中旬開放予定):
- Grok Build:SpaceXAI 自社 Coding Agent プラットフォーム、Grok 4.5 がデフォルトモデル
- Cursor:全サブスクリプションプランで利用可能(デスクトップ、Web、iOS、CLI、SDK)、リリース後 1 週間は使用量 2 倍
- SpaceXAI Console API:Chat Completions と Responses API をサポート、リージョン us-east-1 / us-west-2、レート制限 150 req/s、50M tokens/min
- Office プラグイン:Word、PowerPoint、Excel のデフォルトモデル
- サードパーティゲートウェイ:OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "このコードのバグを見つけて修正してください:function median(a){a.sort();return a[a.length/2]}"
}'
SECTION 05 Grok 4.5 の接続方法:Cursor と API 6 ステップ実践ガイド
- Cursor でモデルを選択:Cursor を開く → モデルセレクター → Grok 4.5 を選択(全サブスクリプションプランに内蔵、初週は使用量 2 倍)。
- SpaceXAI API Key を取得:SpaceXAI Console にログインし、API Keys ページでキーを作成。アカウントが us-east-1 または us-west-2 にアクセス可能か確認します。
- 環境変数を設定:ローカルまたは CI で
export XAI_API_KEY="your-key"を設定し、キーをバージョン管理にコミットしないでください。 - Prompt キャッシュを有効化:Responses API で
prompt_cache_keyを設定するか、Chat Completions でx-grok-conv-idHeader を使用し、入力価格を $2.00/M から $0.50/M へ引き下げます。 - 長時間 Agent ループで Context Compaction を有効化:複数回の会話における Token 累積を削減し、高頻度パイプラインの総コストを下げます。
- ハイブリッドモデルルーティングを構築:通常のサブタスクを Grok 4.5 に、最も複雑なアーキテクチャ判断を Claude Fable 5 に振り分け、出力側に自動検証を追加します(幻覚に敏感なシナリオを特に)。
SECTION 06 切り替える価値はあるか?適合シナリオ、リスク、引用可能データ
Grok 4.5 に向いているシナリオ:
- 1 日数百から数千回のプログラミングタスクを実行するチームで、コスト削減が即効性を持つ
- ターミナル系タスクとツール呼び出し(Terminal Bench 2.1、AutomationBench でトップクラス)
- Cursor に深く統合済みのチームで、ネイティブサポートによりシームレスに切り替え可能
- スタートアップと予算に敏感なチームで、同等知能水準でタスクあたりコストが競合の 4 分の 1 未満
- ハイブリッドモデル戦略:通常サブタスクは Grok 4.5、複雑なアーキテクチャ判断は Claude Fable 5
慎重に検討すべきシナリオ:
- SWE-Bench Pro クラスの高精度コードタスク(Fable 5 が約 16 ポイントリード)
- 幻覚率に敏感なシナリオ:AA-Omniscience Index の幻覚率は 54%、本番環境では出力検証の強化が必要
- EU ユーザー:API は現在 us-east-1 と us-west-2 のみ利用可能
- CursorBench 関連の性能データは訓練データ汚染により撤回、独立再テストを待つ必要あり
引用可能なハードデータ:
- コンテキストウィンドウ:500,000 tokens
- SWE-Bench Pro 出力 Token 効率:15,954(Grok 4.5)vs 67,020(Opus 4.8)、差 4.2×
- 1 回の Agent タスクコスト:$2.49(Grok 4.5)vs $11.80(Claude Code)
- AutomationBench-AA:51.4%、初の 50% 超エンタープライズワークフロー完了率
- Artificial Analysis 知能指数:54 点、前世代比 +16 点
ローカル Mac で高頻度 Agent パイプラインを動かすと、ノート PC のスリープ、ネットワーク変動、マルチタスク競合が 7×24 自動化を中断します。純粋な VM 案には Hypervisor オーバーヘッドと macOS EULA 制限もあります。ゼロ損耗ネイティブ算力、安定 iOS/macOS CI/CD、AI Agent の長期オンラインが必要な本番環境では、MACNOX のクラウド物理ノードが通常より優れた選択となります。100% Apple 純正 Mac Mini M4、フル Root 権限、日/週/月の柔軟注文、Hypervisor オーバーヘッドゼロで、Grok Agent とビルドパイプラインを独立物理機にデプロイできます。Mac Mini M4 レンタル vs 購入の費用比較やClaude Code セキュリティリスク対処もご参照のうえ、料金ページでプランをご確認ください。
Grok 4.5 は「最強のコーディングモデル」ではありませんが、コストパフォーマンス最高の Opus 級プログラミング Agentです。Token 効率と API 料金を実タスクコストに換算すると、主流 Agent ワークフローで Opus 4.8 に近い品質をより低価格で達成できます。精度要求が極めて高いシナリオ(金融コード、セキュリティクリティカルシステム)では、Claude Fable 5 が依然としてより安全な選択です。
公式および第三者参考ソース(リリース後はリンクを再度開いてご確認ください):
SpaceXAI 公式ドキュメント — Grok 4.5 API
TechCrunch — SpaceXAI releases Grok 4.5
Awesome Agents 独立レビュー — Grok 4.5
Snorkel AI 専門シナリオテスト — Grok 4.5
SECTION 07 よくある質問 FAQ
Grok 4.5 は Claude Opus 4.8 より優れていますか?
「優れている」の定義によります。Opus 4.8 は SWE-Bench Pro のコーディング精度が高い(69.2% vs 64.7%)一方、Grok 4.5 は速度、Token 効率、1 タスクあたりコストでリードし、Agent ワークフロー完了率もわずかに上回ります。高頻度 Agent には Grok、高精度の一発コーディングには Claude が適しています。
Grok 4.5 は無料ですか?
SpaceXAI は Grok Build と Cursor で期間限定の無料枠を提供しています。その後の API 料金は入力 $2/M、出力 $6/M です。Cursor サブスクリプションプランにはモデルプールに含まれています。
Cursor で Grok 4.5 を使うには?
全 Cursor プランで自動利用可能です。Cursor を開く → モデル選択 → Grok 4.5 を選択。リリース後 1 週間は使用量が 2 倍になります。
コンテキストウィンドウはどのくらいですか?
500,000 tokens(50 万)で、大多数の大規模コードベースタスクをカバーできます。
CursorBench が撤回された理由は?
Cursor 自身のコードベーススナップショットが Grok 4.5 の訓練データに誤って含まれ、評価を汚染しました。SpaceXAI は関連データを撤回し、独立再テストを待っています。
OpenRouter で Grok 4.5 は使えますか?
はい。Grok 4.5 は OpenRouter、Vercel AI Gateway、Cloudflare、Snowflake、Databricks Mosaic などのサードパーティゲートウェイ経由でアクセスできます。