Am 8. Juli 2026 hat SpaceXAI unter Elon Musk Grok 4.5 veröffentlicht — das erste Flaggschiff nach dem Börsengang. Auf X verspricht Musk: Opus-Klasse, schneller, token-effizienter, günstiger.
Dieser datengetriebene Report richtet sich an Teams, die AI-Coding-Assistenten evaluieren, Cursor-Nutzer und budgetbewusste Engineering-Leads. Wir ordnen öffentliche Benchmarks, TryAI-Tests, API-Preise und Plattform-Zugänge ein und beantworten: Wo ist Grok 4.5 stark, wo schwach — und ist „4× günstiger" Rechnung oder Marketing?
01 Was ist Grok 4.5? Cursor-Co-Training und Kernspezifikationen
Typische Fehlannahmen vor der Auswahl:
- Nur Benchmark-Ranglisten: Offizielle vs. neutrale Harness-Werte können 17 Prozentpunkte auseinanderliegen.
- Nur API-Stückpreis: Bei 4,2× Output-Token-Verbrauch ist billiger pro Million nicht gleich billiger pro Task.
- Trainingsdaten-Streit ignorieren: CursorBench wurde wegen Datenkontamination zurückgezogen — Cursor-Claims brauchen unabhängige Retests.
- Halluzinationsrate übersehen: AA-Omniscience Index: 54 % Halluzinationen bei Grok 4.5 — Produktion braucht Validierung.
Grok 4.5 ist das bisher stärkste SpaceXAI-Modell, optimiert für:
- Programmierung und Code-Agents: Bugfixes, große Refactors, End-to-End-Apps
- Agentische Workflows: Mehrstufige Automatisierung über Tools und Apps
- Wissensintensive Arbeit: Recht, Medizin, Bildung, Datenanalyse
Anders als frühere Modelle wurde Grok 4.5 gemeinsam mit Cursor trainiert — mit Billionen Tokens echter Entwickler-Interaktionen (Code-Reviews, Debugging, Agent-Repository-Dialoge). SpaceX hat Anysphere im Juni 2026 übernommen; das Co-Training ist eines der ersten Ergebnisse. Hintergrund: SpaceX-Übernahme von Cursor.
| Parameter | Wert |
|---|---|
| Architektur | Mixture of Experts (MoE) |
| Kontextfenster | 500.000 Tokens |
| Reasoning-Modi | Niedrig / Mittel / Hoch (Standard: Hoch) |
| Inferenzgeschwindigkeit | Offiziell 80 TPS, gemessen ~90 TPS |
| Trainings-Hardware | Zehntausende NVIDIA GB300 GPUs (Memphis-Rechenzentrum) |
| Parameterzahl | Nicht veröffentlicht (MoE) |
02 Grok 4.5 Preise: API-Tarife und echte Task-Kosten
Preis ist der zentrale Hebel. Zuerst API-Stückpreise, dann Token-Effizienz in Task-Kosten umgerechnet.
| Modell | Input | Output |
|---|---|---|
| Grok 4.5 | $2,00 | $6,00 |
| Grok 4.5 (Cache-Hit) | $0,50 | — |
| Grok 4.5 Fast | $4,00 | $18,00 |
| Claude Opus 4.7 | $5,00 | $25,00 |
| Claude Fable 5 | Höher | Höher |
| GPT-5.6 Sol (Flagship) | $5,00 | $30,00 |
| GPT-5.6 Luna (Economy) | $1,00 | $6,00 |
| Modell / Plattform | Ø Token pro Task | Echte Kosten / Task |
|---|---|---|
| Grok 4.5 / Grok Build | ~1,9M Tokens | $2,49 |
| GPT-5.5 / Codex | ~6,2M Tokens | $5,07 |
| Claude Fable 5 / Claude Code | ~7,2M Tokens | $11,80 |
Bei SWE-Bench Pro verbraucht Grok 4.5 im Schnitt 15.954 Output-Tokens pro Lauf, Claude Opus 4.8 67.020 — Faktor 4,2. Bei 500 Tasks/Tag: Grok ~$1.245/Tag vs. Claude Code ~$5.900/Tag. Der Vorteil skaliert bei hoher Frequenz exponentiell.
03 Grok 4.5 Benchmarks: Coding, Agents und Intelligence Index
SpaceXAI veröffentlichte vier Coding-Benchmarks. Wir fassen offizielle und unabhängige Werte zusammen und dokumentieren den CursorBench-Rückzug.
| Benchmark | Grok 4.5 | Fable 5 | Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| DeepSWE 1.0 (Vendor-Harness) | 62,0 % | 66,1 % | 55,75 % | 64,31 % |
| DeepSWE 1.1 (neutraler Harness) | 53 % | 70 % | 59 % | 67 % |
| Terminal Bench 2.1 | 83,3 % | 84,3 % | 78,9 % | 83,4 % |
| SWE-Bench Pro | 64,7 % | 80,4 % | 69,2 % | 58,6 % |
Lesart:
- DeepSWE 1.0: Grok 4.5 Platz 3 — enger Abstand.
- DeepSWE 1.1: Platz 4; Fable 5 führt um 17 Punkte — ehrlichster Quervergleich.
- Terminal Bench 2.1: Top-4 innerhalb 5,4 Punkten — praktisch Gleichstand.
- SWE-Bench Pro: Härtester Test; Grok 4.5 ~16 Punkte hinter Fable 5.
CursorBench-Rückzug: Beim Launch wurde CursorBench vorübergehend entfernt — Cursor-Codebase-Snapshots gelangten vermutlich in die Trainingsdaten. Datenkontamination. Performance-Zahlen zu Cursor-Training warten auf unabhängige Retests.
| Benchmark | Grok 4.5 | Fable 5 | Opus 4.8 |
|---|---|---|---|
| AutomationBench-AA (657 Workflows) | 51,4 % | 48,6 % | 48,5 % |
| Snorkel GDPVal+ (Facharbeit) | 29 % | — | 21 % |
AutomationBench-AA simuliert 40 Unternehmens-Apps (Gmail, Slack, Salesforce, HubSpot). Grok 4.5 ist das erste Modell, das über die Hälfte der Workflow-Ziele ohne Verstoß gegen Geschäftsregeln erreicht. Snorkel: Recht (40 % vs. 27–28 %), Bildung (58 % vs. 35–42 %), Medizin (35 % vs. 23–25 %).
Artificial Analysis Intelligence Index: Grok 4.5 54 Punkte (Rang 4) — hinter Fable 5 (60), Opus 4.8 (56), GPT-5.5 (55), aber +16 vs. Vorgänger-Grok.
04 TryAI-Praxistest und Cursor/API-Anbindung in sechs Schritten
TryAI ließ Grok 4.5, GPT-5.5, Claude Opus 4.8 und Claude Fable 5 mit identischen Prompts dieselbe interaktive App von Grund auf bauen.
| Modell | Ergebnis |
|---|---|
| Opus 4.8 / Fable 5 | Erfolg beim ersten Versuch |
| Grok 4.5 | Erster Lauf: nur Titel und Button, kein Würfel; Retry erfolgreich |
| GPT-5.5 | Fehlgeschlagen |
Geschwindigkeit und Kosten: Time-to-first-token <0,5 s, ~110 tokens/s (~2× Wettbewerber). GPT-5.5 am schnellsten bei Kurzantworten; Fable 5 langsamstes und teuerstes. Für repetitive High-Frequency-Coding-Tasks dominiert Grok 4.5; für komplexes State-Management in einem Durchlauf bleibt Claude zuverlässiger.
Verfügbare Plattformen (EU voraussichtlich Mitte Juli):
- Grok Build: SpaceXAI-eigene Coding-Agent-Plattform, Grok 4.5 als Standard
- Cursor: Alle Abos (Desktop, Web, iOS, CLI, SDK); verdoppeltes Kontingent in Woche 1
- SpaceXAI Console API: Chat Completions und Responses API
- Office-Plugins: Word, PowerPoint, Excel als Standardmodell
- Drittanbieter-Gateways: OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic
API-Regionen: us-east-1, us-west-2. Rate Limits: 150 req/s, 50M tokens/min.
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "Finde den Bug und fixe ihn: function median(a){a.sort();return a[a.length/2]}"
}'
Sechs Schritte zur Produktion:
- SpaceXAI Console registrieren: Konto auf console.x.ai anlegen, API-Key erzeugen, Billing-Region us-east-1 oder us-west-2 prüfen.
- Modell in Cursor wechseln: Cursor → Modellauswahl → Grok 4.5; Woche 1 mit doppeltem Kontingent Lasttest.
- Cache-Key konfigurieren:
prompt_cache_keyin Responses API oderx-grok-conv-idHeader bei Chat Completions — Input $0,50/M bei Cache-Hit. - Context Compaction für lange Agent-Loops: Token-Akkumulation reduzieren, Gesamtkosten bei hoher Frequenz kontrollieren.
- Hybrid-Routing: Routine-Subtasks an Grok 4.5, schwierigste Architekturentscheidungen an Claude Fable 5 — Fallback in Cursor oder LiteLLM.
- Output-Validierung in Produktion: CI-Gates und manuelle Review bei SWE-Bench-Pro-ähnlichen Tasks und halluzinationskritischen Szenarien.
05 Lohnt der Wechsel? Entscheidungsmatrix, FAQ und DSGVO
| Szenario | Empfehlung | Begründung |
|---|---|---|
| High-Frequency-Agent-Tasks (100–1000+/Tag) | Priorität | ~$2,49 vs. $11,80 pro Task — sofortige Einsparung |
| Terminal- und Tool-Calling-Workloads | Priorität | Terminal Bench 2.1, AutomationBench top |
| Cursor-tief integrierte Teams | Priorität | Co-Training, natives Support, nahtloser Wechsel |
| Hybrid-Modell-Strategie | Empfohlen | Grok für Routine, Fable 5 für Architektur |
| SWE-Bench-Pro-Präzisionscode | Vorsicht | Fable 5 ~16 Punkte voraus |
| Halluzinationskritische Produktion | Vorsicht | AA-Omniscience 54 % — Validierung Pflicht |
| EU-Nutzer | Abwarten | API nur us-east-1 / us-west-2; EU noch nicht live |
| CursorBench-Claims | Nicht übernehmen | Trainingsdaten-Kontamination, Ergebnisse zurückgezogen |
Zitierbare Kennzahlen (EEAT):
- Token-Effizienz: SWE-Bench Pro Output: Grok 4.5 15.954 vs. Opus 4.8 67.020 — Faktor 4,2 (SpaceXAI, 08.07.2026).
- Inferenzgeschwindigkeit: Erstes Token <500 ms, ~110 tokens/s, ~2× Wettbewerb (TryAI).
- Intelligence Index: Artificial Analysis 54, +16 vs. Vorgänger, Rang 4 (Juli 2026).
FAQ:
- F1: Ist Grok 4.5 besser als Claude Opus 4.8? A: Kommt auf die Metrik an. Opus 4.8 führt bei SWE-Bench Pro (69,2 % vs. 64,7 %). Grok 4.5 führt oft bei Geschwindigkeit, Token-Effizienz und Kosten (bis 4×). Bei Agent-Workflow-Abschlussraten leicht vor Opus 4.8 in unabhängigen Benchmarks.
- F2: Ist Grok 4.5 kostenlos? A: Zeitlich begrenzte Gratis-Kontingente bei Grok Build und Cursor; API offiziell $2/M Input, $6/M Output. In Cursor-Abos im Modell-Pool enthalten.
- F3: Grok 4.5 in Cursor nutzen? A: Alle Cursor-Pläne; Modellauswahl → Grok 4.5. Erste Woche doppeltes Kontingent.
- F4: Kontextfenster? A: 500.000 Tokens — ausreichend für die meisten großen Codebases.
- F5: Warum CursorBench zurückgezogen? A: Cursor-Snapshots in Trainingsdaten — Kontamination; SpaceXAI hat Ergebnisse zurückgezogen.
- F6: Über OpenRouter? A: Ja — auch Vercel AI Gateway, Cloudflare, Snowflake, Databricks Mosaic.
DSGVO und US-Cloud-API: Grok 4.5 läuft derzeit nur in us-east-1 und us-west-2. Prompts, Code-Snippets und Agent-Logs werden in US-Rechenzentren verarbeitet — für EU-Teams mit personenbezogenen Daten in Prompts ist das eine Drittlandübermittlung nach Art. 44 ff. DSGVO. Prüfen Sie Auftragsverarbeitung, Standardvertragsklauseln und ob Code/PII lokal bleiben kann. Dedizierte Bare-Metal-Knoten mit klarer Datenhoheit reduzieren unnötige Cloud-Exposition.
Fazit: Grok 4.5 ist nicht das stärkste Coding-Modell, aber der preis-leistungsstärkste Opus-Klasse-Agent — in Token-Effizienz und API-Preis oft 70–80 % günstiger bei vergleichbarer Opus-4.8-Qualität in Mainstream-Agent-Workflows. Finanz- und Safety-Critical-Code: weiterhin Claude Fable 5.
Primärquellen — Links vor Zitaten erneut prüfen:
https://cursor.com/blog/grok-4-5
https://docs.x.ai/developers/models/grok-4.5
Lokale Laptops brechen lange Agent-Loops durch Sleep, parallelisierte Repos konkurrieren um CPU/RAM, und Audit-Grenzen sind schwer teamweit zu vereinheitlichen. Für 24/7 Cursor-Agenten, Codex-CI oder OpenClaw-Gateways ist CALMVPS Bare-Metal Mac Mini Miete meist die stabilere Wahl: dediziertes Apple Silicon, Metal-native Beschleunigung, monatliche Elastizität, ~120 s Provisioning — schwere Agent-Runs in die Cloud, lokal nur Plan-Review. Preisseite.