Si vous appelez un grand modèle des centaines de fois par jour dans Cursor ou une pipeline d'agents maison, Grok 4.5 est probablement déjà dans votre liste depuis le 8 juillet 2026 — SpaceXAI le présente comme une « intelligence de classe Opus à une fraction du prix ». Ce guide professionnel regroupe benchmarks publics, tests indépendants et tarifs API : spécifications, comparaison tarifaire, benchmarks programmation et agents, test de codage TryAI, plateformes, guide en 6 étapes et FAQ.
- Synthèse : Grok 4.5 n'est pas le leader des benchmarks de programmation, mais dans les scénarios d'agents à haute fréquence, l'efficacité token et le tarif API ramènent le coût par tâche à environ un quart de Claude Code (environ 2,49 $ vs 11,80 $).
- Points forts : entraînement conjoint avec Cursor, contexte de 500 000 tokens, AutomationBench-AA premier modèle au-dessus de 50 % de réussite, premier token <0,5 s, environ 110 tokens/s.
- Limites : SWE-Bench Pro environ 16 points de retard sur Claude Fable 5 ; taux d'hallucination AA-Omniscience à 54 % ; CursorBench retiré pour contamination des données d'entraînement.
- Adapté à : agents haute fréquence, tâches terminal, équipes Cursor, organisations sensibles au budget.
- Prudence pour : refactorings multi-fichiers de haute précision, code financier ou critique en sécurité, API UE pas encore ouverte (mi-juillet prévue).
SECTION 01 Qu'est-ce que Grok 4.5 ? Modèle phare SpaceXAI et entraînement conjoint Cursor
Grok 4.5 est le premier modèle phare de SpaceXAI après son introduction en bourse, optimisé pour la programmation et les agents de code, les workflows autonomes multi-outils et les domaines à forte densité de connaissances (droit, santé, éducation). La nouveauté majeure : un entraînement conjoint avec Cursor, alimenté par des billions de tokens d'interactions réelles de développeurs (revues de code, débogage, journaux agent-codebase). SpaceX a acquis Anysphere (maison mère de Cursor) en juin 2026 — Grok 4.5 en est l'un des premiers résultats visibles.
| Paramètre | Valeur |
|---|---|
| Architecture | Mixture of Experts (MoE) |
| Fenêtre de contexte | 500 000 tokens |
| Mode de raisonnement | Faible / Moyen / Élevé (par défaut : Élevé) |
| Vitesse d'inférence | 80 TPS officiel, environ 90 TPS mesuré |
| Matériel d'entraînement | Dizaines de milliers de GPU NVIDIA GB300 (datacenter Memphis) |
| Nombre de paramètres | Non divulgué (architecture MoE) |
SECTION 02 Tarification : prix API et coût réel par tâche
Le prix constitue l'argument central de Grok 4.5. Le tarif affiché est déjà inférieur à Claude Opus, mais l'écart décisif vient de l'efficacité token : sur les tâches SWE-Bench Pro, Grok 4.5 consomme en moyenne 15 954 tokens de sortie par exécution, Claude Opus 4.8 en consomme 67 020 — un facteur de 4,2.
| Modèle | Entrée | Sortie |
|---|---|---|
| Grok 4.5 | 2,00 $ | 6,00 $ |
| Grok 4.5 (cache hit) | 0,50 $ | — |
| Grok 4.5 Fast | 4,00 $ | 18,00 $ |
| Claude Opus 4.7 | 5,00 $ | 25,00 $ |
| Claude Fable 5 | Plus élevé | Plus élevé |
| GPT-5.6 Sol (phare) | 5,00 $ | 30,00 $ |
| GPT-5.6 Luna (économique) | 1,00 $ | 6,00 $ |
| Modèle / plateforme | Tokens moyens par tâche | Coût réel |
|---|---|---|
| Grok 4.5 / Grok Build | ~1,9M tokens | 2,49 $ |
| GPT-5.5 / Codex | ~6,2M tokens | 5,07 $ |
| Claude Fable 5 / Claude Code | ~7,2M tokens | 11,80 $ |
À 500 tâches agent par jour : Grok 4.5 environ 1 245 $/jour, Claude Code environ 5 900 $/jour — l'écart d'efficacité s'amplifie exponentiellement avec le volume.
SECTION 03 Benchmarks : programmation, agents et indice d'intelligence
SpaceXAI a publié quatre benchmarks liés à la programmation. Synthèse des données officielles et des tests indépendants.
| Benchmark | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| DeepSWE 1.0 (harness officiel) | 62,0 % | 66,1 % | 55,75 % | 64,31 % |
| DeepSWE 1.1 (harness neutre) | 53 % | 70 % | 59 % | 67 % |
| Terminal Bench 2.1 | 83,3 % | 84,3 % | 78,9 % | 83,4 % |
| SWE-Bench Pro (taux de résolution) | 64,7 % | 80,4 % | 69,2 % | 58,6 % |
Lecture : sous DeepSWE 1.1 (harness neutre), Grok 4.5 tombe à la quatrième place — Fable 5 mène avec 17 points d'écart. Terminal Bench 2.1 : les quatre modèles de tête se tiennent dans 5,4 points, quasi-égalité. SWE-Bench Pro est le test le plus exigeant : Grok 4.5 troisième, environ 16 points derrière Fable 5.
Benchmarks agents (terrain de prédilection de Grok 4.5) :
| Benchmark | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| AutomationBench-AA (657 workflows entreprise) | 51,4 % | 48,6 % | 48,5 % |
| Snorkel GDPVal+ (scénarios professionnels) | 29 % | — | 21 % |
AutomationBench-AA simule 40 applications d'entreprise (Gmail, Slack, Salesforce, HubSpot, etc.). Grok 4.5 est le premier modèle à dépasser la moitié des objectifs de workflow sans violer les contraintes métier. Tests Snorkel : Grok 4.5 domine en droit (40 % vs 27–28 %), éducation (58 % vs 35–42 %) et santé (35 % vs 23–25 %).
Intelligence globale : indice Artificial Analysis 54 points (quatrième rang) — derrière Fable 5 (60), Opus 4.8 (56), GPT-5.5 (55), mais +16 points par rapport au Grok précédent.
Retrait de CursorBench : au lancement, CursorBench (benchmark propriétaire Cursor) a été retiré — des instantanés de la codebase Cursor se sont retrouvés par erreur dans les données d'entraînement de Grok 4.5 (contamination). Un défaut visible de cette publication.
SECTION 04 Test réel et plateformes : TryAI, Grok Build, Cursor, API
TryAI a fait construire la même application interactive from scratch à Grok 4.5, GPT-5.5, Claude Opus 4.8 et Claude Fable 5 avec des prompts identiques :
- Rendu cube 3D (test le plus difficile) : Opus 4.8 et Fable 5 réussis du premier coup ; Grok 4.5 n'affiche que titre et bouton au premier essai, réussite au second ; GPT-5.5 échoue.
- Vitesse : premier token Grok 4.5 <0,5 s, débit environ 110 tokens/s (environ le double des concurrents).
- Coût : coût par exécution de test le plus bas avec Grok 4.5.
Conclusion : pour les tâches de codage répétitives à haute fréquence, vitesse et coût de Grok 4.5 l'emportent ; pour la gestion d'état complexe du premier coup, Claude reste plus fiable.
Plateformes disponibles (région UE prévue mi-juillet) :
- Grok Build : plateforme d'agent de codage SpaceXAI, Grok 4.5 modèle par défaut
- Cursor : tous les abonnements (desktop, web, iOS, CLI, SDK), quota doublé la première semaine
- SpaceXAI Console API : Chat Completions et Responses API, régions us-east-1 / us-west-2, limite 150 req/s, 50M tokens/min
- Plugins Office : Word, PowerPoint, Excel — modèle par défaut
- Passerelles tierces : OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "Trouve le bug dans ce code et corrige-le : function median(a){a.sort();return a[a.length/2]}"
}'
SECTION 05 Intégration : six étapes pour Cursor et l'API
- Choisir le modèle dans Cursor : ouvrir Cursor → sélecteur de modèle → Grok 4.5 (tous les abonnements, quota doublé la première semaine).
- Obtenir une clé API SpaceXAI : se connecter à SpaceXAI Console → API Keys → créer une clé, confirmer l'accès us-east-1 ou us-west-2.
- Configurer la variable d'environnement : en local ou en CI
export XAI_API_KEY="your-key"— ne jamais committer la clé. - Activer le cache de prompt : Responses API avec
prompt_cache_keyou Chat Completions avec l'en-têtex-grok-conv-id— ramener le prix d'entrée de 2,00 $/M à 0,50 $/M. - Context Compaction pour les boucles agent longues : réduire l'accumulation de tokens sur plusieurs tours, abaisser le coût total de la pipeline.
- Mettre en place un routage hybride : sous-tâches courantes vers Grok 4.5, décisions d'architecture complexes vers Claude Fable 5 ; validation automatisée des sorties, surtout en cas de sensibilité aux hallucinations.
SECTION 06 Faut-il migrer ? Scénarios, risques et chiffres citables
Grok 4.5 convient si :
- votre équipe exécute des centaines à milliers de tâches de programmation par jour — économies immédiates
- les tâches terminal et appels d'outils sont prioritaires (Terminal Bench 2.1, AutomationBench au sommet)
- Cursor est déjà intégré en profondeur — bascule sans friction
- startups et équipes sensibles au budget veulent un niveau d'intelligence comparable pour un quart du coût par tâche
- stratégie hybride : Grok 4.5 pour la routine, Claude Fable 5 pour l'architecture
Prudence si :
- précision de type SWE-Bench Pro requise (Fable 5 +16 points)
- taux d'hallucination critique : indice AA-Omniscience à 54 % — validation des sorties obligatoire en production
- utilisateurs UE : API uniquement us-east-1 et us-west-2 pour l'instant
- données CursorBench invalidées par contamination — attendre des retests indépendants
Chiffres citables :
- Fenêtre de contexte : 500 000 tokens
- Efficacité sortie SWE-Bench Pro : 15 954 (Grok 4.5) vs 67 020 (Opus 4.8), facteur 4,2×
- Coût par tâche agent : 2,49 $ (Grok 4.5) vs 11,80 $ (Claude Code)
- AutomationBench-AA : 51,4 %, premier modèle au-dessus de 50 % de workflows entreprise
- Indice Artificial Analysis : 54 points, +16 vs génération précédente
Les pipelines d'agents haute fréquence sur Mac local souffrent du mode veille, des fluctuations réseau et de la concurrence des ressources — l'automatisation 7×24 s'interrompt. Les solutions VM pures ajoutent la perte hyperviseur et les risques EULA macOS. Pour une puissance native sans perte, une CI/CD iOS/macOS stable et des agents en ligne en continu, les nœuds physiques cloud MACNOX sont souvent le meilleur choix : Mac Mini M4 100 % d'origine, Root complet, location flexible jour/semaine/mois, zéro perte hyperviseur. Voir location vs achat Mac Mini M4 et risques de sécurité Claude Code, ainsi que la page tarifs.
Grok 4.5 n'est pas « le meilleur modèle de programmation », mais c'est l'agent de codage de classe Opus le plus rentable — une fois efficacité token et tarif API convertis en coût réel par tâche, il délivre une qualité proche d'Opus 4.8 dans les workflows agent courants à une fraction du prix. Lorsque la précision est primordiale (code financier, systèmes critiques), Claude Fable 5 reste le choix le plus sûr.
Sources officielles et indépendantes (revérifier les liens après publication) :
Cursor — annonce conjointe Grok 4.5
Documentation API SpaceXAI — Grok 4.5
TechCrunch — SpaceXAI releases Grok 4.5
Awesome Agents — test indépendant Grok 4.5
Snorkel AI — scénarios professionnels
SECTION 07 FAQ
Grok 4.5 est-il meilleur que Claude Opus 4.8 ?
Cela dépend de la définition de « meilleur ». Opus 4.8 est plus précis sur SWE-Bench Pro (69,2 % vs 64,7 %). Grok 4.5 mène en vitesse, efficacité token et coût par tâche ; légèrement devant sur les workflows agents. Agents haute fréquence : Grok. Codage précis en une passe : Claude.
Grok 4.5 est-il gratuit ?
SpaceXAI propose des quotas gratuits limités dans Grok Build et Cursor. Ensuite, API : 2 $/M entrée, 6 $/M sortie. Les abonnements Cursor incluent le modèle.
Comment utiliser Grok 4.5 dans Cursor ?
Disponible automatiquement sur tous les plans Cursor. Ouvrir Cursor → sélection de modèle → Grok 4.5. Première semaine après lancement : quota doublé.
Quelle est la taille de la fenêtre de contexte ?
500 000 tokens — suffisant pour la plupart des tâches sur de grandes codebases.
Pourquoi CursorBench a-t-il été retiré ?
Des instantanés de la codebase Cursor se sont retrouvés par erreur dans les données d'entraînement de Grok 4.5, faussant le benchmark. SpaceXAI a retiré les données ; retest indépendant en attente.
Grok 4.5 est-il disponible via OpenRouter ?
Oui. Accessible via OpenRouter, Vercel AI Gateway, Cloudflare, Snowflake, Databricks Mosaic et d'autres passerelles.