Startseite / Blog / Grok 4.5 Test
ENGINEERING_BLOG · 2026.07.11

Grok 4.5 im Test:
SpaceXAI-Flaggschiff für Coding-Agenten — wirklich 4× günstiger als Claude Opus?

Wer in Cursor oder einer eigenen Agent-Pipeline täglich hunderte LLM-Aufrufe fährt, hat Grok 4.5 seit dem 8. Juli 2026 vermutlich schon in der Modellliste — SpaceXAI bewirbt es als „Opus-Klasse zum Bruchteil des Preises“. Dieser datenbasierte Leitfaden bündelt öffentliche Benchmarks, unabhängige Tests und API-Tarife: Modellspezifikation, Preisvergleich, Programmier- und Agent-Benchmarks, TryAI-Coding-Test, Plattformzugang, 6-Schritte-Setup und FAQ — inklusive DSGVO-relevanter Hinweise für EU-Teams.

  • Kurzfassung: Grok 4.5 ist nicht der Benchmark-Sieger im Coding, aber bei hochfrequenten Agent-Szenarien machen Token-Effizienz plus API-Preis den Einzelaufgaben-Kosten etwa ein Viertel von Claude Code (ca. $2,49 vs. $11,80).
  • Stärken: Gemeinsames Training mit Cursor, 500.000 Token Kontext, AutomationBench-AA als erstes Modell über 50 % Abschlussrate, First Token <0,5 s, ca. 110 tokens/s.
  • Schwächen: SWE-Bench Pro rund 16 Prozentpunkte hinter Claude Fable 5; Halluzinationsrate AA-Omniscience 54 %; CursorBench wegen Trainingsdaten-Kontamination zurückgezogen.
  • Geeignet für: Hochfrequente Agenten, Terminal-Tasks, Cursor-Teams, budgetsensible Engineering-Organisationen.
  • Vorsicht bei: Präzise Multi-File-Refactorings, Finanz-/Sicherheitskritischem Code, EU-API noch nicht verfügbar (voraussichtlich Mitte Juli).

SECTION 01 Was ist Grok 4.5? SpaceXAI-Flaggschiff und Cursor-Gemeinschaftstraining

Grok 4.5 ist das erste Flaggschiffmodell von SpaceXAI nach dem Börsengang, optimiert für Programmierung und Code-Agenten, autonome Workflows über Tools hinweg sowie wissensintensive Domänen wie Recht, Medizin und Bildung. Neu ist das Gemeinschaftstraining mit Cursor: Billionen Token echter Entwicklerinteraktionen (Code-Reviews, Debug-Flows, Agent-Codebase-Logs) flossen ins Training. SpaceX hat Anysphere (Muttergesellschaft von Cursor) im Juni 2026 übernommen — Grok 4.5 ist eines der ersten sichtbaren Ergebnisse.

Grok 4.5 — Kerndaten
Parameter Wert
Architektur Mixture of Experts (MoE)
Kontextfenster 500.000 Tokens
Reasoning-Modus Niedrig / Mittel / Hoch (Standard: Hoch)
Inferenzgeschwindigkeit Offiziell 80 TPS, gemessen ca. 90 TPS
Trainingshardware Zehntausende NVIDIA GB300 GPUs (Rechenzentrum Memphis)
Parameterzahl Nicht veröffentlicht (MoE)

SECTION 02 Preise: API-Tarife und reale Aufgabenkosten

Preis ist Grok 4.5s stärkstes Verkaufsargument. Der Listenpreis liegt unter Claude Opus — der entscheidende Hebel ist aber die Token-Effizienz: Auf SWE-Bench-Pro-Programmieraufgaben verbraucht Grok 4.5 im Schnitt 15.954 Output-Tokens pro Lauf, Claude Opus 4.8 67.020 — Faktor 4,2.

API-Preise (pro 1M Tokens)
Modell Input Output
Grok 4.5 $2,00 $6,00
Grok 4.5 (Cache-Treffer) $0,50
Grok 4.5 Fast $4,00 $18,00
Claude Opus 4.7 $5,00 $25,00
Claude Fable 5 Höher Höher
GPT-5.6 Sol (Flaggschiff) $5,00 $30,00
GPT-5.6 Luna (Economy) $1,00 $6,00
Geschätzte Kosten pro Programmier-Agent-Aufgabe
Modell / Plattform Ø Tokens pro Aufgabe Reale Kosten
Grok 4.5 / Grok Build ~1,9M Tokens $2,49
GPT-5.5 / Codex ~6,2M Tokens $5,07
Claude Fable 5 / Claude Code ~7,2M Tokens $11,80

Bei 500 Agent-Aufgaben pro Tag: Grok 4.5 ca. $1.245/Tag, Claude Code ca. $5.900/Tag — die Effizienzlücke skaliert mit dem Volumen exponentiell.

SECTION 03 Benchmarks: Programmierung, Agenten und Intelligenzindex

SpaceXAI veröffentlichte vier programmierbezogene Benchmarks. Nachfolgend offizielle und unabhängige Werte.

Programmier-Benchmarks im Vergleich
Benchmark Grok 4.5 Claude Fable 5 Claude Opus 4.8 GPT-5.5
DeepSWE 1.0 (offizieller Harness) 62,0 % 66,1 % 55,75 % 64,31 %
DeepSWE 1.1 (neutraler Harness) 53 % 70 % 59 % 67 %
Terminal Bench 2.1 83,3 % 84,3 % 78,9 % 83,4 %
SWE-Bench Pro (Lösungsrate) 64,7 % 80,4 % 69,2 % 58,6 %

Einordnung: Unter DeepSWE 1.1 (neutraler Harness) fällt Grok 4.5 auf Platz vier — Fable 5 führt mit 17 Prozentpunkten. Terminal Bench 2.1: alle Top-Modelle innerhalb von 5,4 Prozentpunkten, praktisch Gleichstand. SWE-Bench Pro ist der härteste Test: Grok 4.5 Platz drei, rund 16 Punkte hinter Fable 5.

Agent-Benchmarks (Grok 4.5s Stärke):

Agent- und Enterprise-Workflow-Benchmarks
Benchmark Grok 4.5 Claude Fable 5 Claude Opus 4.8
AutomationBench-AA (657 Enterprise-Workflows) 51,4 % 48,6 % 48,5 %
Snorkel GDPVal+ (professionelle Arbeitsszenarien) 29 % 21 %

AutomationBench-AA simuliert 40 Unternehmensanwendungen (Gmail, Slack, Salesforce, HubSpot u. a.). Grok 4.5 ist das erste Modell, das über die Hälfte der Workflow-Ziele ohne Verletzung von Geschäftsregeln erreicht. Snorkel-Tests: Grok 4.5 führt in Recht (40 % vs. 27–28 %), Bildung (58 % vs. 35–42 %) und Medizin (35 % vs. 23–25 %) deutlich.

Gesamtintelligenz: Artificial-Analysis-Index 54 Punkte (Rang vier) — hinter Fable 5 (60), Opus 4.8 (56), GPT-5.5 (55), aber +16 Punkte gegenüber dem Vorgänger Grok.

CursorBench zurückgezogen: Beim Launch wurde CursorBench (Cursor-eigener Test) entfernt — Teile des Cursor-Codebase-Snapshots waren versehentlich in Grok-4.5-Trainingsdaten gelandet (Data Contamination). Ein sichtbarer Makel dieser Veröffentlichung.

SECTION 04 Praxistest und Plattformen: TryAI, Grok Build, Cursor, API

TryAI ließ Grok 4.5, GPT-5.5, Claude Opus 4.8 und Claude Fable 5 mit identischen Prompts dieselbe interaktive App von Grund auf bauen:

  • 3D-Würfel-Rendering (schwierigster Test): Opus 4.8 und Fable 5 beim ersten Versuch erfolgreich; Grok 4.5 beim ersten Lauf nur Titel und Button ohne Würfel, zweiter Versuch erfolgreich; GPT-5.5 scheiterte.
  • Geschwindigkeit: Grok 4.5 First Token <0,5 s, Durchsatz ca. 110 tokens/s (etwa doppelte Geschwindigkeit der Konkurrenz).
  • Kosten: Niedrigste Kosten pro Testlauf bei Grok 4.5.

Fazit: Bei hochfrequenten, repetitiven Coding-Tasks dominieren Geschwindigkeit und Kosten; bei komplexem State-Management auf Anhieb bleibt Claude zuverlässiger.

Verfügbare Plattformen (EU-Region voraussichtlich Mitte Juli):

  • Grok Build: SpaceXAI-eigene Coding-Agent-Plattform, Grok 4.5 als Standardmodell
  • Cursor: Alle Abopläne (Desktop, Web, iOS, CLI, SDK), verdoppeltes Kontingent in der ersten Woche
  • SpaceXAI Console API: Chat Completions und Responses API, Regionen us-east-1 / us-west-2, Limit 150 req/s, 50M tokens/min
  • Office-Plugins: Word, PowerPoint, Excel — Standardmodell
  • Drittanbieter-Gateways: OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic

DSGVO-Bezug für EU-Teams: Die API ist derzeit nur in US-Regionen (us-east-1, us-west-2) verfügbar. Prompts, Code-Snippets und API-Keys können damit Drittlandübermittlungen nach Art. 44 ff. DSGVO auslösen, sofern keine geeigneten Garantien (z. B. EU-US Data Privacy Framework, SCCs) und ein dokumentiertes Verarbeitungsverzeichnis vorliegen. Bis zur EU-Verfügbarkeit sollten Unternehmen eine Auftragsverarbeitungsvereinbarung mit SpaceXAI prüfen und Egress zu x.ai-Endpunkten auditieren — analog zu Art. 32 (technische Maßnahmen).

api-call.sh
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "Finde den Bug in diesem Code und behebe ihn: function median(a){a.sort();return a[a.length/2]}"
  }'

SECTION 05 Integration: Sechs Schritte für Cursor und API

  1. Modell in Cursor wählen: Cursor öffnen → Modellauswahl → Grok 4.5 (alle Abopläne, erste Woche doppeltes Kontingent).
  2. SpaceXAI API Key erstellen: SpaceXAI Console → API Keys → Schlüssel anlegen, Zugriff auf us-east-1 oder us-west-2 bestätigen.
  3. Umgebungsvariable setzen: Lokal oder in CI export XAI_API_KEY="your-key" — Schlüssel nie ins Repository committen.
  4. Prompt-Cache aktivieren: Responses API mit prompt_cache_key oder Chat Completions mit Header x-grok-conv-id — Input-Preis von $2,00/M auf $0,50/M senken.
  5. Context Compaction für lange Agent-Loops: Token-Akkumulation über mehrere Runden reduzieren, Gesamtkosten der Pipeline senken.
  6. Hybrid-Routing aufbauen: Routine-Subtasks an Grok 4.5, komplexe Architekturentscheidungen an Claude Fable 5; automatisierte Output-Validierung besonders bei halluzinationskritischen Szenarien.

SECTION 06 Wechseln lohnen? Szenarien, Risiken und harte Zahlen

Grok 4.5 passt, wenn:

  • Ihr Team täglich hunderte bis tausende Programmieraufgaben fährt — Kosteneinsparung sofort messbar
  • Terminal-Tasks und Tool-Calls im Fokus stehen (Terminal Bench 2.1, AutomationBench top)
  • Cursor bereits tief integriert ist — natives Modell ohne Reibung
  • Startups und budgetsensible Teams ähnliche Intelligenz zum Viertel der Aufgabenkosten wollen
  • Hybrid-Strategie: Grok 4.5 für Routine, Claude Fable 5 für Architektur

Vorsicht, wenn:

  • SWE-Bench-Pro-ähnliche Präzision nötig ist (Fable 5 +16 Prozentpunkte)
  • Halluzinationsrate kritisch: AA-Omniscience-Index 54 % — Output-Validierung in Produktion Pflicht
  • EU-Nutzer: API nur us-east-1 und us-west-2 (DSGVO-Drittlandtransfer prüfen)
  • CursorBench-Daten wegen Kontamination ungültig — auf unabhängige Retests warten

Zitierfähige Kennzahlen:

  • Kontextfenster: 500.000 Tokens
  • SWE-Bench-Pro Output-Effizienz: 15.954 (Grok 4.5) vs. 67.020 (Opus 4.8), Faktor 4,2×
  • Kosten pro Agent-Aufgabe: $2,49 (Grok 4.5) vs. $11,80 (Claude Code)
  • AutomationBench-AA: 51,4 %, erstes Modell über 50 % Enterprise-Workflow-Abschluss
  • Artificial-Analysis-Index: 54 Punkte, +16 gegenüber Vorgänger

Hochfrequente Agent-Pipelines auf einem lokalen Mac leiden unter Sleep-Modus, Netzschwankungen und Ressourcenkonkurrenz — 7×24-Automatisierung bricht ab. Reine VM-Lösungen bringen Hypervisor-Overhead und macOS-EULA-Risiken. Für native Leistung ohne Overhead, stabile iOS/macOS-CI/CD und dauerhaft online Agenten sind MACNOX-Cloud-Physikknoten oft die bessere Wahl: 100 % original Mac Mini M4, voller Root, flexible Tages-/Wochen-/Monatsmiete, null Hypervisor-Overhead. Siehe Mac Mini M4 Miete vs. Kauf und Claude-Code-Sicherheitsrisiken sowie die Preisseite.

Grok 4.5 ist nicht „das stärkste Programmiermodell“, aber das preiswerteste Opus-Klasse-Coding-Agent — wenn Token-Effizienz und API-Tarif in reale Aufgabenkosten übersetzt werden, liefert es in gängigen Agent-Workflows Opus-4.8-nahe Qualität zum Bruchteil des Preises. Wo Genauigkeit oberste Priorität hat (Finanzcode, sicherheitskritische Systeme), bleibt Claude Fable 5 die sicherere Wahl.

Offizielle und unabhängige Quellen (Links nach Veröffentlichung erneut prüfen):

SpaceXAI — Grok 4.5 Launch

Cursor — Gemeinsame Veröffentlichung Grok 4.5

SpaceXAI API-Dokumentation — Grok 4.5

TechCrunch — SpaceXAI releases Grok 4.5

Awesome Agents — Unabhängiger Test Grok 4.5

Snorkel AI — Professionelle Arbeitsszenarien

SECTION 07 FAQ

Ist Grok 4.5 besser als Claude Opus 4.8?

Kommt auf die Definition von „besser“ an. Opus 4.8 liegt bei SWE-Bench Pro höher (69,2 % vs. 64,7 %). Grok 4.5 führt bei Geschwindigkeit, Token-Effizienz und Kosten pro Aufgabe; bei Agent-Workflows knapp vorn. Hochfrequente Agenten: Grok. Präzises Einmal-Coding: Claude.

Ist Grok 4.5 kostenlos?

SpaceXAI bietet zeitlich begrenzte Gratis-Kontingente in Grok Build und Cursor. Danach API: $2/M Input, $6/M Output. Cursor-Abos enthalten das Modell im Pool.

Wie nutze ich Grok 4.5 in Cursor?

Automatisch in allen Cursor-Plänen. Cursor öffnen → Modellauswahl → Grok 4.5. Erste Woche nach Launch: doppeltes Kontingent.

Wie groß ist das Kontextfenster?

500.000 Tokens — ausreichend für die meisten großen Codebase-Aufgaben.

Warum wurde CursorBench zurückgezogen?

Cursor-Codebase-Snapshots landeten versehentlich in Grok-4.5-Trainingsdaten und verfälschten den Benchmark. SpaceXAI zog die Daten zurück; unabhängiger Retest ausstehend.

Geht Grok 4.5 über OpenRouter?

Ja. Erreichbar über OpenRouter, Vercel AI Gateway, Cloudflare, Snowflake, Databricks Mosaic und weitere Gateways.