Grok 4.5 : test approfondi
Le modèle de code SpaceXAI — niveau Opus à un quart du prix ?

Le 8 juillet 2026, SpaceXAI, la société d'Elon Musk, a officiellement dévoilé Grok 4.5, son premier flagship post-introduction en bourse. Sur X, la promesse est claire : intelligence de classe Opus, plus rapide, plus efficace en tokens, moins coûteuse.

Cet article s'adresse aux développeurs qui évaluent un assistant de code IA, aux utilisateurs Cursor et aux équipes sensibles au budget. Nous croisons benchmarks publics, évaluation indépendante TryAI, grille tarifaire API et modes d'accès pour répondre à trois questions : forces, faiblesses, et si « quatre fois moins cher » relève du calcul ou du marketing.

01 Grok 4.5 : définition, co-entraînement Cursor et spécifications

Pièges fréquents avant de choisir :

  • Se fier au seul classement benchmark : l'écart entre harness officiel et harness neutre peut atteindre 17 points.
  • Comparer uniquement le prix API : avec 4,2× plus de tokens en sortie, un tarif bas ne garantit pas un coût par tâche bas.
  • Ignorer la controverse sur les données d'entraînement : CursorBench a été retiré pour contamination — les affirmations liées à Cursor exigent des retests indépendants.
  • Négliger le taux d'hallucination : AA-Omniscience Index : 54 % pour Grok 4.5 — la production exige une couche de validation.

Grok 4.5 est le modèle le plus puissant de SpaceXAI à ce jour, optimisé pour :

  • Programmation et agents de code : corrections, refactors massifs, applications de bout en bout
  • Workflows agentiques : automatisation multi-étapes à travers outils et applications
  • Travail à forte densité de connaissances : juridique, santé, éducation, analyse de données

Le modèle n'a pas été développé en vase clos : il a été co-entraîné avec Cursor, avec des milliers de milliards de tokens d'interactions réelles (revues de code, débogage, dialogues agent-dépôt). SpaceX a acquis Anysphere en juin 2026 ; ce co-entraînement en est l'une des premières manifestations. Contexte : analyse de l'acquisition de Cursor par SpaceX.

Spécifications clés de Grok 4.5
Paramètre Valeur
Architecture Mixture of Experts (MoE)
Fenêtre de contexte 500 000 tokens
Modes de raisonnement Faible / Moyen / Élevé (défaut : Élevé)
Vitesse d'inférence 80 TPS officiel, ~90 TPS mesuré
Matériel d'entraînement Dizaines de milliers de GPU NVIDIA GB300 (datacenter Memphis)
Paramètres Non divulgués (MoE)

02 Tarifs Grok 4.5 : prix API et coût réel par tâche

Le prix constitue l'argument central. Comparons d'abord les tarifs API, puis le coût par tâche une fois l'efficacité token intégrée.

Comparaison des tarifs API (par 1M tokens)
Modèle Entrée Sortie
Grok 4.5 2,00 $ 6,00 $
Grok 4.5 (cache hit) 0,50 $
Grok 4.5 Fast 4,00 $ 18,00 $
Claude Opus 4.7 5,00 $ 25,00 $
Claude Fable 5 Plus élevé Plus élevé
GPT-5.6 Sol (flagship) 5,00 $ 30,00 $
GPT-5.6 Luna (économique) 1,00 $ 6,00 $
Coût réel par tâche agent de code
Modèle / plateforme Tokens moyens Coût réel / tâche
Grok 4.5 / Grok Build ~1,9M tokens 2,49 $
GPT-5.5 / Codex ~6,2M tokens 5,07 $
Claude Fable 5 / Claude Code ~7,2M tokens 11,80 $

Sur SWE-Bench Pro, Grok 4.5 consomme en moyenne 15 954 tokens de sortie par exécution, Claude Opus 4.8 67 020 — écart de 4,2×. À 500 tâches/jour : Grok ~1 245 $/jour vs Claude Code ~5 900 $/jour. L'avantage s'amplifie exponentiellement en haute fréquence.

03 Benchmarks Grok 4.5 : code, agents et indice global

SpaceXAI a publié quatre évaluations de programmation. Nous consolidons données officielles et tests tiers, avec le retrait de CursorBench.

Benchmarks de programmation
Évaluation Grok 4.5 Fable 5 Opus 4.8 GPT-5.5
DeepSWE 1.0 (harness éditeur) 62,0 % 66,1 % 55,75 % 64,31 %
DeepSWE 1.1 (harness neutre) 53 % 70 % 59 % 67 %
Terminal Bench 2.1 83,3 % 84,3 % 78,9 % 83,4 %
SWE-Bench Pro 64,7 % 80,4 % 69,2 % 58,6 %

Points de lecture :

  • DeepSWE 1.0 : Grok 4.5 troisième — écart modeste.
  • DeepSWE 1.1 : quatrième ; Fable 5 mène de 17 points — comparaison la plus honnête.
  • Terminal Bench 2.1 : les quatre modèles de tête à moins de 5,4 points — quasi-parité.
  • SWE-Bench Pro : test le plus exigeant ; Grok 4.5 ~16 points derrière Fable 5.

Retrait de CursorBench : au lancement, le benchmark propriétaire Cursor a été temporairement retiré — des instantanés du dépôt Cursor auraient contaminé les données d'entraînement. Les chiffres associés attendent des retests indépendants.

Benchmarks agents (terrain de prédilection de Grok 4.5)
Évaluation Grok 4.5 Fable 5 Opus 4.8
AutomationBench-AA (657 workflows) 51,4 % 48,6 % 48,5 %
Snorkel GDPVal+ (travail professionnel) 29 % 21 %

AutomationBench-AA couvre 40 applications métier simulées (Gmail, Slack, Salesforce, HubSpot). Grok 4.5 est le premier modèle à dépasser la moitié des objectifs de workflow sans violer les contraintes métier. Snorkel : juridique (40 % vs 27–28 %), éducation (58 % vs 35–42 %), santé (35 % vs 23–25 %).

Indice Artificial Analysis : Grok 4.5 54 points (4e rang) — derrière Fable 5 (60), Opus 4.8 (56), GPT-5.5 (55), mais +16 vs la génération Grok précédente.

04 Test TryAI et intégration Cursor / API en six étapes

TryAI a demandé à Grok 4.5, GPT-5.5, Claude Opus 4.8 et Claude Fable 5 de construire la même application interactive à partir de prompts identiques.

TryAI — rendu cube 3D (test le plus difficile)
Modèle Résultat
Opus 4.8 / Fable 5 Réussite du premier coup
Grok 4.5 Premier essai : titre et bouton seulement, pas de cube ; succès au second essai
GPT-5.5 Échec

Vitesse et coût : premier token <0,5 s, débit ~110 tokens/s (~2× la concurrence). GPT-5.5 le plus rapide sur réponses courtes ; Fable 5 le plus lent et le plus cher. Grok 4.5 domine les tâches répétitives à haute fréquence ; Claude reste plus fiable pour la gestion d'état complexe en un seul passage.

Plateformes disponibles (UE prévue mi-juillet) :

  • Grok Build : plateforme agent de code SpaceXAI, Grok 4.5 par défaut
  • Cursor : tous les abonnements (desktop, Web, iOS, CLI, SDK) ; quota doublé la première semaine
  • API SpaceXAI Console : Chat Completions et Responses API
  • Plugins Office : modèle par défaut Word, PowerPoint, Excel
  • Passerelles tierces : OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic

Régions API : us-east-1, us-west-2. Limites : 150 req/s, 50M tokens/min.

api-quickstart.sh
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "Trouve le bug et corrige : function median(a){a.sort();return a[a.length/2]}"
  }'

Six étapes de déploiement :

  1. Créer un compte SpaceXAI Console : sur console.x.ai, générer une clé API et vérifier la région de facturation us-east-1 ou us-west-2.
  2. Basculer le modèle dans Cursor : Cursor → sélection de modèle → Grok 4.5 ; quota doublé la première semaine pour stress-tester les workflows réels.
  3. Configurer la clé de cache : prompt_cache_key dans Responses API ou header x-grok-conv-id en Chat Completions — entrée à 0,50 $/M en cas de cache hit.
  4. Activer Context Compaction sur les boucles agent longues : réduire l'accumulation de tokens et maîtriser le coût global.
  5. Routage hybride : sous-tâches courantes sur Grok 4.5, décisions d'architecture difficiles sur Claude Fable 5 — fallback dans Cursor ou LiteLLM.
  6. Valider les sorties en production : portes CI et revue humaine pour les tâches de précision type SWE-Bench Pro et les scénarios sensibles aux hallucinations.

05 Faut-il migrer vers Grok 4.5 ? Matrice, FAQ et conclusion

Scénarios adaptés vs prudence
Scénario Recommandation Raison
Agents haute fréquence (centaines–milliers/jour) Prioritaire ~2,49 $ vs 11,80 $ par tâche — économie immédiate
Tâches terminal et appels d'outils Prioritaire Terminal Bench 2.1, AutomationBench au sommet
Équipes profondément intégrées à Cursor Prioritaire Co-entraînement, support natif, bascule fluide
Stratégie multi-modèles Recommandé Grok au quotidien, Fable 5 pour l'architecture
Code haute précision type SWE-Bench Pro Prudence Fable 5 ~16 points devant — écart réel
Production sensible aux hallucinations Prudence AA-Omniscience 54 % — validation obligatoire
Utilisateurs UE Attendre API limitée à us-east-1 / us-west-2 ; UE pas encore ouverte
Affirmations liées à CursorBench En suspens Contamination des données, résultats retirés

Données citables (EEAT) :

  • Efficacité token : SWE-Bench Pro sortie : Grok 4.5 15 954 vs Opus 4.8 67 020 — facteur 4,2 (SpaceXAI, 08/07/2026).
  • Vitesse d'inférence : premier token <500 ms, ~110 tokens/s, ~2× concurrence (TryAI).
  • Indice global : Artificial Analysis 54, +16 vs génération précédente, 4e rang (juillet 2026).

FAQ :

  • Q : Grok 4.5 est-il meilleur que Claude Opus 4.8 ? R : Selon la métrique. Opus 4.8 mène sur SWE-Bench Pro (69,2 % vs 64,7 %). Grok 4.5 mène souvent en vitesse, efficacité token et coût (jusqu'à 4×). Sur les taux de complétion de workflows agents, légèrement devant Opus 4.8 dans des benchmarks indépendants.
  • Q : Grok 4.5 est-il gratuit ? R : Quotas gratuits temporaires sur Grok Build et Cursor ; API officielle 2 $/M entrée, 6 $/M sortie. Inclus dans le pool de modèles Cursor.
  • Q : Comment utiliser Grok 4.5 dans Cursor ? R : Tous les plans Cursor ; sélecteur de modèle → Grok 4.5. Quota doublé la première semaine.
  • Q : Quelle taille de contexte ? R : 500 000 tokens — suffisant pour la plupart des dépôts volumineux.
  • Q : Pourquoi CursorBench a-t-il été retiré ? R : Instantanés Cursor dans les données d'entraînement — contamination ; SpaceXAI a retiré les résultats.
  • Q : Via OpenRouter ? R : Oui — aussi Vercel AI Gateway, Cloudflare, Snowflake, Databricks Mosaic.

Conclusion : Grok 4.5 n'est pas le modèle de code le plus puissant, mais l'agent de programmation classe Opus au meilleur rapport qualité-prix — souvent 70 à 80 % moins cher pour une qualité proche d'Opus 4.8 dans les workflows agents courants. Code financier et systèmes safety-critical : Claude Fable 5 reste recommandé.

Sources principales — revérifier les liens après mise à jour en amont :

https://x.ai/news/grok-4-5

https://cursor.com/blog/grok-4-5

https://docs.x.ai/developers/models/grok-4.5

https://techcrunch.com/2026/07/08/spacexai-releases-grok-4-5-which-elon-describes-as-an-opus-class-model/

https://snorkel.ai/blog/grok-4-5-testing-results-how-spacexais-new-model-performs-on-real-professional-work/

Faire tourner Grok 4.5 sur un MacBook personnel impose trois contraintes : veille qui coupe les boucles agent longues, dépôts parallèles qui se disputent CPU/RAM, audit difficile à unifier en équipe. Pour Cursor Agent, Codex CI ou OpenClaw Gateway en 24/7, la location Mac Mini bare metal CALMVPS est en général plus adaptée : Apple Silicon dédié, accélération Metal native, facturation mensuelle flexible, provisioning ~120 s — déporter les agents lourds vers le cloud, garder la validation des plans en local. Page tarifs.