Wer in Cursor oder einer eigenen Agent-Pipeline täglich hunderte LLM-Aufrufe fährt, hat Grok 4.5 seit dem 8. Juli 2026 vermutlich schon in der Modellliste — SpaceXAI bewirbt es als „Opus-Klasse zum Bruchteil des Preises“. Dieser datenbasierte Leitfaden bündelt öffentliche Benchmarks, unabhängige Tests und API-Tarife: Modellspezifikation, Preisvergleich, Programmier- und Agent-Benchmarks, TryAI-Coding-Test, Plattformzugang, 6-Schritte-Setup und FAQ — inklusive DSGVO-relevanter Hinweise für EU-Teams.
- Kurzfassung: Grok 4.5 ist nicht der Benchmark-Sieger im Coding, aber bei hochfrequenten Agent-Szenarien machen Token-Effizienz plus API-Preis den Einzelaufgaben-Kosten etwa ein Viertel von Claude Code (ca. $2,49 vs. $11,80).
- Stärken: Gemeinsames Training mit Cursor, 500.000 Token Kontext, AutomationBench-AA als erstes Modell über 50 % Abschlussrate, First Token <0,5 s, ca. 110 tokens/s.
- Schwächen: SWE-Bench Pro rund 16 Prozentpunkte hinter Claude Fable 5; Halluzinationsrate AA-Omniscience 54 %; CursorBench wegen Trainingsdaten-Kontamination zurückgezogen.
- Geeignet für: Hochfrequente Agenten, Terminal-Tasks, Cursor-Teams, budgetsensible Engineering-Organisationen.
- Vorsicht bei: Präzise Multi-File-Refactorings, Finanz-/Sicherheitskritischem Code, EU-API noch nicht verfügbar (voraussichtlich Mitte Juli).
SECTION 01 Was ist Grok 4.5? SpaceXAI-Flaggschiff und Cursor-Gemeinschaftstraining
Grok 4.5 ist das erste Flaggschiffmodell von SpaceXAI nach dem Börsengang, optimiert für Programmierung und Code-Agenten, autonome Workflows über Tools hinweg sowie wissensintensive Domänen wie Recht, Medizin und Bildung. Neu ist das Gemeinschaftstraining mit Cursor: Billionen Token echter Entwicklerinteraktionen (Code-Reviews, Debug-Flows, Agent-Codebase-Logs) flossen ins Training. SpaceX hat Anysphere (Muttergesellschaft von Cursor) im Juni 2026 übernommen — Grok 4.5 ist eines der ersten sichtbaren Ergebnisse.
| Parameter | Wert |
|---|---|
| Architektur | Mixture of Experts (MoE) |
| Kontextfenster | 500.000 Tokens |
| Reasoning-Modus | Niedrig / Mittel / Hoch (Standard: Hoch) |
| Inferenzgeschwindigkeit | Offiziell 80 TPS, gemessen ca. 90 TPS |
| Trainingshardware | Zehntausende NVIDIA GB300 GPUs (Rechenzentrum Memphis) |
| Parameterzahl | Nicht veröffentlicht (MoE) |
SECTION 02 Preise: API-Tarife und reale Aufgabenkosten
Preis ist Grok 4.5s stärkstes Verkaufsargument. Der Listenpreis liegt unter Claude Opus — der entscheidende Hebel ist aber die Token-Effizienz: Auf SWE-Bench-Pro-Programmieraufgaben verbraucht Grok 4.5 im Schnitt 15.954 Output-Tokens pro Lauf, Claude Opus 4.8 67.020 — Faktor 4,2.
| Modell | Input | Output |
|---|---|---|
| Grok 4.5 | $2,00 | $6,00 |
| Grok 4.5 (Cache-Treffer) | $0,50 | — |
| Grok 4.5 Fast | $4,00 | $18,00 |
| Claude Opus 4.7 | $5,00 | $25,00 |
| Claude Fable 5 | Höher | Höher |
| GPT-5.6 Sol (Flaggschiff) | $5,00 | $30,00 |
| GPT-5.6 Luna (Economy) | $1,00 | $6,00 |
| Modell / Plattform | Ø Tokens pro Aufgabe | Reale Kosten |
|---|---|---|
| Grok 4.5 / Grok Build | ~1,9M Tokens | $2,49 |
| GPT-5.5 / Codex | ~6,2M Tokens | $5,07 |
| Claude Fable 5 / Claude Code | ~7,2M Tokens | $11,80 |
Bei 500 Agent-Aufgaben pro Tag: Grok 4.5 ca. $1.245/Tag, Claude Code ca. $5.900/Tag — die Effizienzlücke skaliert mit dem Volumen exponentiell.
SECTION 03 Benchmarks: Programmierung, Agenten und Intelligenzindex
SpaceXAI veröffentlichte vier programmierbezogene Benchmarks. Nachfolgend offizielle und unabhängige Werte.
| Benchmark | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| DeepSWE 1.0 (offizieller Harness) | 62,0 % | 66,1 % | 55,75 % | 64,31 % |
| DeepSWE 1.1 (neutraler Harness) | 53 % | 70 % | 59 % | 67 % |
| Terminal Bench 2.1 | 83,3 % | 84,3 % | 78,9 % | 83,4 % |
| SWE-Bench Pro (Lösungsrate) | 64,7 % | 80,4 % | 69,2 % | 58,6 % |
Einordnung: Unter DeepSWE 1.1 (neutraler Harness) fällt Grok 4.5 auf Platz vier — Fable 5 führt mit 17 Prozentpunkten. Terminal Bench 2.1: alle Top-Modelle innerhalb von 5,4 Prozentpunkten, praktisch Gleichstand. SWE-Bench Pro ist der härteste Test: Grok 4.5 Platz drei, rund 16 Punkte hinter Fable 5.
Agent-Benchmarks (Grok 4.5s Stärke):
| Benchmark | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| AutomationBench-AA (657 Enterprise-Workflows) | 51,4 % | 48,6 % | 48,5 % |
| Snorkel GDPVal+ (professionelle Arbeitsszenarien) | 29 % | — | 21 % |
AutomationBench-AA simuliert 40 Unternehmensanwendungen (Gmail, Slack, Salesforce, HubSpot u. a.). Grok 4.5 ist das erste Modell, das über die Hälfte der Workflow-Ziele ohne Verletzung von Geschäftsregeln erreicht. Snorkel-Tests: Grok 4.5 führt in Recht (40 % vs. 27–28 %), Bildung (58 % vs. 35–42 %) und Medizin (35 % vs. 23–25 %) deutlich.
Gesamtintelligenz: Artificial-Analysis-Index 54 Punkte (Rang vier) — hinter Fable 5 (60), Opus 4.8 (56), GPT-5.5 (55), aber +16 Punkte gegenüber dem Vorgänger Grok.
CursorBench zurückgezogen: Beim Launch wurde CursorBench (Cursor-eigener Test) entfernt — Teile des Cursor-Codebase-Snapshots waren versehentlich in Grok-4.5-Trainingsdaten gelandet (Data Contamination). Ein sichtbarer Makel dieser Veröffentlichung.
SECTION 04 Praxistest und Plattformen: TryAI, Grok Build, Cursor, API
TryAI ließ Grok 4.5, GPT-5.5, Claude Opus 4.8 und Claude Fable 5 mit identischen Prompts dieselbe interaktive App von Grund auf bauen:
- 3D-Würfel-Rendering (schwierigster Test): Opus 4.8 und Fable 5 beim ersten Versuch erfolgreich; Grok 4.5 beim ersten Lauf nur Titel und Button ohne Würfel, zweiter Versuch erfolgreich; GPT-5.5 scheiterte.
- Geschwindigkeit: Grok 4.5 First Token <0,5 s, Durchsatz ca. 110 tokens/s (etwa doppelte Geschwindigkeit der Konkurrenz).
- Kosten: Niedrigste Kosten pro Testlauf bei Grok 4.5.
Fazit: Bei hochfrequenten, repetitiven Coding-Tasks dominieren Geschwindigkeit und Kosten; bei komplexem State-Management auf Anhieb bleibt Claude zuverlässiger.
Verfügbare Plattformen (EU-Region voraussichtlich Mitte Juli):
- Grok Build: SpaceXAI-eigene Coding-Agent-Plattform, Grok 4.5 als Standardmodell
- Cursor: Alle Abopläne (Desktop, Web, iOS, CLI, SDK), verdoppeltes Kontingent in der ersten Woche
- SpaceXAI Console API: Chat Completions und Responses API, Regionen us-east-1 / us-west-2, Limit 150 req/s, 50M tokens/min
- Office-Plugins: Word, PowerPoint, Excel — Standardmodell
- Drittanbieter-Gateways: OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic
DSGVO-Bezug für EU-Teams: Die API ist derzeit nur in US-Regionen (us-east-1, us-west-2) verfügbar. Prompts, Code-Snippets und API-Keys können damit Drittlandübermittlungen nach Art. 44 ff. DSGVO auslösen, sofern keine geeigneten Garantien (z. B. EU-US Data Privacy Framework, SCCs) und ein dokumentiertes Verarbeitungsverzeichnis vorliegen. Bis zur EU-Verfügbarkeit sollten Unternehmen eine Auftragsverarbeitungsvereinbarung mit SpaceXAI prüfen und Egress zu x.ai-Endpunkten auditieren — analog zu Art. 32 (technische Maßnahmen).
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "Finde den Bug in diesem Code und behebe ihn: function median(a){a.sort();return a[a.length/2]}"
}'
SECTION 05 Integration: Sechs Schritte für Cursor und API
- Modell in Cursor wählen: Cursor öffnen → Modellauswahl → Grok 4.5 (alle Abopläne, erste Woche doppeltes Kontingent).
- SpaceXAI API Key erstellen: SpaceXAI Console → API Keys → Schlüssel anlegen, Zugriff auf us-east-1 oder us-west-2 bestätigen.
- Umgebungsvariable setzen: Lokal oder in CI
export XAI_API_KEY="your-key"— Schlüssel nie ins Repository committen. - Prompt-Cache aktivieren: Responses API mit
prompt_cache_keyoder Chat Completions mit Headerx-grok-conv-id— Input-Preis von $2,00/M auf $0,50/M senken. - Context Compaction für lange Agent-Loops: Token-Akkumulation über mehrere Runden reduzieren, Gesamtkosten der Pipeline senken.
- Hybrid-Routing aufbauen: Routine-Subtasks an Grok 4.5, komplexe Architekturentscheidungen an Claude Fable 5; automatisierte Output-Validierung besonders bei halluzinationskritischen Szenarien.
SECTION 06 Wechseln lohnen? Szenarien, Risiken und harte Zahlen
Grok 4.5 passt, wenn:
- Ihr Team täglich hunderte bis tausende Programmieraufgaben fährt — Kosteneinsparung sofort messbar
- Terminal-Tasks und Tool-Calls im Fokus stehen (Terminal Bench 2.1, AutomationBench top)
- Cursor bereits tief integriert ist — natives Modell ohne Reibung
- Startups und budgetsensible Teams ähnliche Intelligenz zum Viertel der Aufgabenkosten wollen
- Hybrid-Strategie: Grok 4.5 für Routine, Claude Fable 5 für Architektur
Vorsicht, wenn:
- SWE-Bench-Pro-ähnliche Präzision nötig ist (Fable 5 +16 Prozentpunkte)
- Halluzinationsrate kritisch: AA-Omniscience-Index 54 % — Output-Validierung in Produktion Pflicht
- EU-Nutzer: API nur us-east-1 und us-west-2 (DSGVO-Drittlandtransfer prüfen)
- CursorBench-Daten wegen Kontamination ungültig — auf unabhängige Retests warten
Zitierfähige Kennzahlen:
- Kontextfenster: 500.000 Tokens
- SWE-Bench-Pro Output-Effizienz: 15.954 (Grok 4.5) vs. 67.020 (Opus 4.8), Faktor 4,2×
- Kosten pro Agent-Aufgabe: $2,49 (Grok 4.5) vs. $11,80 (Claude Code)
- AutomationBench-AA: 51,4 %, erstes Modell über 50 % Enterprise-Workflow-Abschluss
- Artificial-Analysis-Index: 54 Punkte, +16 gegenüber Vorgänger
Hochfrequente Agent-Pipelines auf einem lokalen Mac leiden unter Sleep-Modus, Netzschwankungen und Ressourcenkonkurrenz — 7×24-Automatisierung bricht ab. Reine VM-Lösungen bringen Hypervisor-Overhead und macOS-EULA-Risiken. Für native Leistung ohne Overhead, stabile iOS/macOS-CI/CD und dauerhaft online Agenten sind MACNOX-Cloud-Physikknoten oft die bessere Wahl: 100 % original Mac Mini M4, voller Root, flexible Tages-/Wochen-/Monatsmiete, null Hypervisor-Overhead. Siehe Mac Mini M4 Miete vs. Kauf und Claude-Code-Sicherheitsrisiken sowie die Preisseite.
Grok 4.5 ist nicht „das stärkste Programmiermodell“, aber das preiswerteste Opus-Klasse-Coding-Agent — wenn Token-Effizienz und API-Tarif in reale Aufgabenkosten übersetzt werden, liefert es in gängigen Agent-Workflows Opus-4.8-nahe Qualität zum Bruchteil des Preises. Wo Genauigkeit oberste Priorität hat (Finanzcode, sicherheitskritische Systeme), bleibt Claude Fable 5 die sicherere Wahl.
Offizielle und unabhängige Quellen (Links nach Veröffentlichung erneut prüfen):
Cursor — Gemeinsame Veröffentlichung Grok 4.5
SpaceXAI API-Dokumentation — Grok 4.5
TechCrunch — SpaceXAI releases Grok 4.5
Awesome Agents — Unabhängiger Test Grok 4.5
Snorkel AI — Professionelle Arbeitsszenarien
SECTION 07 FAQ
Ist Grok 4.5 besser als Claude Opus 4.8?
Kommt auf die Definition von „besser“ an. Opus 4.8 liegt bei SWE-Bench Pro höher (69,2 % vs. 64,7 %). Grok 4.5 führt bei Geschwindigkeit, Token-Effizienz und Kosten pro Aufgabe; bei Agent-Workflows knapp vorn. Hochfrequente Agenten: Grok. Präzises Einmal-Coding: Claude.
Ist Grok 4.5 kostenlos?
SpaceXAI bietet zeitlich begrenzte Gratis-Kontingente in Grok Build und Cursor. Danach API: $2/M Input, $6/M Output. Cursor-Abos enthalten das Modell im Pool.
Wie nutze ich Grok 4.5 in Cursor?
Automatisch in allen Cursor-Plänen. Cursor öffnen → Modellauswahl → Grok 4.5. Erste Woche nach Launch: doppeltes Kontingent.
Wie groß ist das Kontextfenster?
500.000 Tokens — ausreichend für die meisten großen Codebase-Aufgaben.
Warum wurde CursorBench zurückgezogen?
Cursor-Codebase-Snapshots landeten versehentlich in Grok-4.5-Trainingsdaten und verfälschten den Benchmark. SpaceXAI zog die Daten zurück; unabhängiger Retest ausstehend.
Geht Grok 4.5 über OpenRouter?
Ja. Erreichbar über OpenRouter, Vercel AI Gateway, Cloudflare, Snowflake, Databricks Mosaic und weitere Gateways.