Grok 4.5 im Test:
SpaceXAI stärkstes Coding-Modell — Opus-Klasse zum Viertelpreis?

Am 8. Juli 2026 hat SpaceXAI unter Elon Musk Grok 4.5 veröffentlicht — das erste Flaggschiff nach dem Börsengang. Auf X verspricht Musk: Opus-Klasse, schneller, token-effizienter, günstiger.

Dieser datengetriebene Report richtet sich an Teams, die AI-Coding-Assistenten evaluieren, Cursor-Nutzer und budgetbewusste Engineering-Leads. Wir ordnen öffentliche Benchmarks, TryAI-Tests, API-Preise und Plattform-Zugänge ein und beantworten: Wo ist Grok 4.5 stark, wo schwach — und ist „4× günstiger" Rechnung oder Marketing?

01 Was ist Grok 4.5? Cursor-Co-Training und Kernspezifikationen

Typische Fehlannahmen vor der Auswahl:

  • Nur Benchmark-Ranglisten: Offizielle vs. neutrale Harness-Werte können 17 Prozentpunkte auseinanderliegen.
  • Nur API-Stückpreis: Bei 4,2× Output-Token-Verbrauch ist billiger pro Million nicht gleich billiger pro Task.
  • Trainingsdaten-Streit ignorieren: CursorBench wurde wegen Datenkontamination zurückgezogen — Cursor-Claims brauchen unabhängige Retests.
  • Halluzinationsrate übersehen: AA-Omniscience Index: 54 % Halluzinationen bei Grok 4.5 — Produktion braucht Validierung.

Grok 4.5 ist das bisher stärkste SpaceXAI-Modell, optimiert für:

  • Programmierung und Code-Agents: Bugfixes, große Refactors, End-to-End-Apps
  • Agentische Workflows: Mehrstufige Automatisierung über Tools und Apps
  • Wissensintensive Arbeit: Recht, Medizin, Bildung, Datenanalyse

Anders als frühere Modelle wurde Grok 4.5 gemeinsam mit Cursor trainiert — mit Billionen Tokens echter Entwickler-Interaktionen (Code-Reviews, Debugging, Agent-Repository-Dialoge). SpaceX hat Anysphere im Juni 2026 übernommen; das Co-Training ist eines der ersten Ergebnisse. Hintergrund: SpaceX-Übernahme von Cursor.

Grok 4.5 Kernspezifikationen
Parameter Wert
Architektur Mixture of Experts (MoE)
Kontextfenster 500.000 Tokens
Reasoning-Modi Niedrig / Mittel / Hoch (Standard: Hoch)
Inferenzgeschwindigkeit Offiziell 80 TPS, gemessen ~90 TPS
Trainings-Hardware Zehntausende NVIDIA GB300 GPUs (Memphis-Rechenzentrum)
Parameterzahl Nicht veröffentlicht (MoE)

02 Grok 4.5 Preise: API-Tarife und echte Task-Kosten

Preis ist der zentrale Hebel. Zuerst API-Stückpreise, dann Token-Effizienz in Task-Kosten umgerechnet.

API-Preisvergleich (pro 1M Tokens)
Modell Input Output
Grok 4.5 $2,00 $6,00
Grok 4.5 (Cache-Hit) $0,50
Grok 4.5 Fast $4,00 $18,00
Claude Opus 4.7 $5,00 $25,00
Claude Fable 5 Höher Höher
GPT-5.6 Sol (Flagship) $5,00 $30,00
GPT-5.6 Luna (Economy) $1,00 $6,00
Echte Coding-Agent-Task-Kosten
Modell / Plattform Ø Token pro Task Echte Kosten / Task
Grok 4.5 / Grok Build ~1,9M Tokens $2,49
GPT-5.5 / Codex ~6,2M Tokens $5,07
Claude Fable 5 / Claude Code ~7,2M Tokens $11,80

Bei SWE-Bench Pro verbraucht Grok 4.5 im Schnitt 15.954 Output-Tokens pro Lauf, Claude Opus 4.8 67.020 — Faktor 4,2. Bei 500 Tasks/Tag: Grok ~$1.245/Tag vs. Claude Code ~$5.900/Tag. Der Vorteil skaliert bei hoher Frequenz exponentiell.

03 Grok 4.5 Benchmarks: Coding, Agents und Intelligence Index

SpaceXAI veröffentlichte vier Coding-Benchmarks. Wir fassen offizielle und unabhängige Werte zusammen und dokumentieren den CursorBench-Rückzug.

Coding-Benchmark-Vergleich
Benchmark Grok 4.5 Fable 5 Opus 4.8 GPT-5.5
DeepSWE 1.0 (Vendor-Harness) 62,0 % 66,1 % 55,75 % 64,31 %
DeepSWE 1.1 (neutraler Harness) 53 % 70 % 59 % 67 %
Terminal Bench 2.1 83,3 % 84,3 % 78,9 % 83,4 %
SWE-Bench Pro 64,7 % 80,4 % 69,2 % 58,6 %

Lesart:

  • DeepSWE 1.0: Grok 4.5 Platz 3 — enger Abstand.
  • DeepSWE 1.1: Platz 4; Fable 5 führt um 17 Punkte — ehrlichster Quervergleich.
  • Terminal Bench 2.1: Top-4 innerhalb 5,4 Punkten — praktisch Gleichstand.
  • SWE-Bench Pro: Härtester Test; Grok 4.5 ~16 Punkte hinter Fable 5.

CursorBench-Rückzug: Beim Launch wurde CursorBench vorübergehend entfernt — Cursor-Codebase-Snapshots gelangten vermutlich in die Trainingsdaten. Datenkontamination. Performance-Zahlen zu Cursor-Training warten auf unabhängige Retests.

Agent-Benchmarks (Stärke von Grok 4.5)
Benchmark Grok 4.5 Fable 5 Opus 4.8
AutomationBench-AA (657 Workflows) 51,4 % 48,6 % 48,5 %
Snorkel GDPVal+ (Facharbeit) 29 % 21 %

AutomationBench-AA simuliert 40 Unternehmens-Apps (Gmail, Slack, Salesforce, HubSpot). Grok 4.5 ist das erste Modell, das über die Hälfte der Workflow-Ziele ohne Verstoß gegen Geschäftsregeln erreicht. Snorkel: Recht (40 % vs. 27–28 %), Bildung (58 % vs. 35–42 %), Medizin (35 % vs. 23–25 %).

Artificial Analysis Intelligence Index: Grok 4.5 54 Punkte (Rang 4) — hinter Fable 5 (60), Opus 4.8 (56), GPT-5.5 (55), aber +16 vs. Vorgänger-Grok.

04 TryAI-Praxistest und Cursor/API-Anbindung in sechs Schritten

TryAI ließ Grok 4.5, GPT-5.5, Claude Opus 4.8 und Claude Fable 5 mit identischen Prompts dieselbe interaktive App von Grund auf bauen.

TryAI 3D-Würfel-Rendering (schwierigster Test)
Modell Ergebnis
Opus 4.8 / Fable 5 Erfolg beim ersten Versuch
Grok 4.5 Erster Lauf: nur Titel und Button, kein Würfel; Retry erfolgreich
GPT-5.5 Fehlgeschlagen

Geschwindigkeit und Kosten: Time-to-first-token <0,5 s, ~110 tokens/s (~2× Wettbewerber). GPT-5.5 am schnellsten bei Kurzantworten; Fable 5 langsamstes und teuerstes. Für repetitive High-Frequency-Coding-Tasks dominiert Grok 4.5; für komplexes State-Management in einem Durchlauf bleibt Claude zuverlässiger.

Verfügbare Plattformen (EU voraussichtlich Mitte Juli):

  • Grok Build: SpaceXAI-eigene Coding-Agent-Plattform, Grok 4.5 als Standard
  • Cursor: Alle Abos (Desktop, Web, iOS, CLI, SDK); verdoppeltes Kontingent in Woche 1
  • SpaceXAI Console API: Chat Completions und Responses API
  • Office-Plugins: Word, PowerPoint, Excel als Standardmodell
  • Drittanbieter-Gateways: OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic

API-Regionen: us-east-1, us-west-2. Rate Limits: 150 req/s, 50M tokens/min.

api-quickstart.sh
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "Finde den Bug und fixe ihn: function median(a){a.sort();return a[a.length/2]}"
  }'

Sechs Schritte zur Produktion:

  1. SpaceXAI Console registrieren: Konto auf console.x.ai anlegen, API-Key erzeugen, Billing-Region us-east-1 oder us-west-2 prüfen.
  2. Modell in Cursor wechseln: Cursor → Modellauswahl → Grok 4.5; Woche 1 mit doppeltem Kontingent Lasttest.
  3. Cache-Key konfigurieren: prompt_cache_key in Responses API oder x-grok-conv-id Header bei Chat Completions — Input $0,50/M bei Cache-Hit.
  4. Context Compaction für lange Agent-Loops: Token-Akkumulation reduzieren, Gesamtkosten bei hoher Frequenz kontrollieren.
  5. Hybrid-Routing: Routine-Subtasks an Grok 4.5, schwierigste Architekturentscheidungen an Claude Fable 5 — Fallback in Cursor oder LiteLLM.
  6. Output-Validierung in Produktion: CI-Gates und manuelle Review bei SWE-Bench-Pro-ähnlichen Tasks und halluzinationskritischen Szenarien.

05 Lohnt der Wechsel? Entscheidungsmatrix, FAQ und DSGVO

Passende vs. kritische Szenarien
Szenario Empfehlung Begründung
High-Frequency-Agent-Tasks (100–1000+/Tag) Priorität ~$2,49 vs. $11,80 pro Task — sofortige Einsparung
Terminal- und Tool-Calling-Workloads Priorität Terminal Bench 2.1, AutomationBench top
Cursor-tief integrierte Teams Priorität Co-Training, natives Support, nahtloser Wechsel
Hybrid-Modell-Strategie Empfohlen Grok für Routine, Fable 5 für Architektur
SWE-Bench-Pro-Präzisionscode Vorsicht Fable 5 ~16 Punkte voraus
Halluzinationskritische Produktion Vorsicht AA-Omniscience 54 % — Validierung Pflicht
EU-Nutzer Abwarten API nur us-east-1 / us-west-2; EU noch nicht live
CursorBench-Claims Nicht übernehmen Trainingsdaten-Kontamination, Ergebnisse zurückgezogen

Zitierbare Kennzahlen (EEAT):

  • Token-Effizienz: SWE-Bench Pro Output: Grok 4.5 15.954 vs. Opus 4.8 67.020 — Faktor 4,2 (SpaceXAI, 08.07.2026).
  • Inferenzgeschwindigkeit: Erstes Token <500 ms, ~110 tokens/s, ~2× Wettbewerb (TryAI).
  • Intelligence Index: Artificial Analysis 54, +16 vs. Vorgänger, Rang 4 (Juli 2026).

FAQ:

  • F1: Ist Grok 4.5 besser als Claude Opus 4.8? A: Kommt auf die Metrik an. Opus 4.8 führt bei SWE-Bench Pro (69,2 % vs. 64,7 %). Grok 4.5 führt oft bei Geschwindigkeit, Token-Effizienz und Kosten (bis 4×). Bei Agent-Workflow-Abschlussraten leicht vor Opus 4.8 in unabhängigen Benchmarks.
  • F2: Ist Grok 4.5 kostenlos? A: Zeitlich begrenzte Gratis-Kontingente bei Grok Build und Cursor; API offiziell $2/M Input, $6/M Output. In Cursor-Abos im Modell-Pool enthalten.
  • F3: Grok 4.5 in Cursor nutzen? A: Alle Cursor-Pläne; Modellauswahl → Grok 4.5. Erste Woche doppeltes Kontingent.
  • F4: Kontextfenster? A: 500.000 Tokens — ausreichend für die meisten großen Codebases.
  • F5: Warum CursorBench zurückgezogen? A: Cursor-Snapshots in Trainingsdaten — Kontamination; SpaceXAI hat Ergebnisse zurückgezogen.
  • F6: Über OpenRouter? A: Ja — auch Vercel AI Gateway, Cloudflare, Snowflake, Databricks Mosaic.

DSGVO und US-Cloud-API: Grok 4.5 läuft derzeit nur in us-east-1 und us-west-2. Prompts, Code-Snippets und Agent-Logs werden in US-Rechenzentren verarbeitet — für EU-Teams mit personenbezogenen Daten in Prompts ist das eine Drittlandübermittlung nach Art. 44 ff. DSGVO. Prüfen Sie Auftragsverarbeitung, Standardvertragsklauseln und ob Code/PII lokal bleiben kann. Dedizierte Bare-Metal-Knoten mit klarer Datenhoheit reduzieren unnötige Cloud-Exposition.

Fazit: Grok 4.5 ist nicht das stärkste Coding-Modell, aber der preis-leistungsstärkste Opus-Klasse-Agent — in Token-Effizienz und API-Preis oft 70–80 % günstiger bei vergleichbarer Opus-4.8-Qualität in Mainstream-Agent-Workflows. Finanz- und Safety-Critical-Code: weiterhin Claude Fable 5.

Primärquellen — Links vor Zitaten erneut prüfen:

https://x.ai/news/grok-4-5

https://cursor.com/blog/grok-4-5

https://docs.x.ai/developers/models/grok-4.5

https://techcrunch.com/2026/07/08/spacexai-releases-grok-4-5-which-elon-describes-as-an-opus-class-model/

https://snorkel.ai/blog/grok-4-5-testing-results-how-spacexais-new-model-performs-on-real-professional-work/

Lokale Laptops brechen lange Agent-Loops durch Sleep, parallelisierte Repos konkurrieren um CPU/RAM, und Audit-Grenzen sind schwer teamweit zu vereinheitlichen. Für 24/7 Cursor-Agenten, Codex-CI oder OpenClaw-Gateways ist CALMVPS Bare-Metal Mac Mini Miete meist die stabilere Wahl: dediziertes Apple Silicon, Metal-native Beschleunigung, monatliche Elastizität, ~120 s Provisioning — schwere Agent-Runs in die Cloud, lokal nur Plan-Review. Preisseite.