GPT-5.6 Sol, Terra & Luna:
Vollständiger Review, Benchmarks, Preise & Zugangs-Guide

Am 26. Juni 2026 veröffentlichte OpenAI seine größte Modellfamilie des Jahres: GPT-5.6 Sol, Terra und Luna. Sol verdrängt Claude Mythos 5 auf dem TerminalBench-2.1-Coding-Leaderboard mit einem Rekordwert von 91,9 %. Alle drei Modelle erreichen OpenAIs «High»-Cybersecurity-Schwelle — ein Novum für eine gesamte Produktlinie. Der Haken: Auf Anfrage der US-Regierung haben derzeit nur etwa 20 geprüfte Organisationen Zugang.

Dieser Guide richtet sich an Entwickler, KI-Teamleiter und Cursor/Codex-Nutzer, die Modell-Stacks evaluieren. Wir decken Modell-Tiers und Preise, Max-/Ultra-Reasoning-Modi, vollständige Benchmark-Daten, den Vergleich mit Claude Mythos 5, Trumps Executive Order vom 2. Juni, die Cerebras-Deployment-Zielgeschwindigkeit von 750 Tokens/Sekunde im Juli, Zugangs-Timelines und sechs praktische Vorbereitungsschritte ab. Am Ende wissen Sie, welches Tier passt, ob Sie es heute nutzen können und wie Sie es bei allgemeiner Verfügbarkeit in Produktion einbinden.

01 GPT-5.6 Kurzüberblick: Modell-Tiers und Schmerzpunkte für Entwickler

GPT-5.6-Familie auf einen Blick (26. Juni 2026)
Modell Tier Input Output Highlight
GPT-5.6 Sol Flagship 5 $ / 1M Tokens 30 $ / 1M Tokens TerminalBench 2.1 #1 mit 91,9 %
GPT-5.6 Terra Balanced 2,50 $ / 1M Tokens 15 $ / 1M Tokens Nahe GPT-5.5-Qualität, 50 % günstiger
GPT-5.6 Luna Lightweight 1 $ / 1M Tokens 6 $ / 1M Tokens 80 % günstiger als Sol für High-Volume-Tasks

Verfügbarkeit heute: GPT-5.6 ist auf etwa 20 staatlich genehmigte Trusted Partner über API und Codex-Preview beschränkt. Allgemeiner ChatGPT-Zugang wird innerhalb weniger Wochen erwartet. Polymarket-Händler geben einer breiten Veröffentlichung bis zum 31. Juli 2026 eine Wahrscheinlichkeit von 87 %.

Der Launch war politisch brisant. Eine Trump-Executive Order vom 2. Juni 2026 gewährte US-Behörden bis zu 30 Tage Vorabzugang zu Frontier-Modellen. Es ist das erste Mal, dass die US-Regierung formell verlangte, dass ein KI-Unternehmen eine Frontier-Veröffentlichung einschränkt. OpenAI kam nach, widersprach aber öffentlich:

Wir glauben nicht, dass dieser Art von staatlichem Zugangsprozess langfristig Standard werden sollte. Er hält die besten Tools von Nutzern, Entwicklern, Unternehmen, Cyber-Verteidigern und globalen Partnern fern, die sie brauchen.

Was Entwicklern gerade wehtut:

  • Noch keine allgemeine API: Die meisten Teams können Sols Ultra-Multi-Agent-Modus nicht in Produktion validieren.
  • Wettbewerber ebenfalls blockiert: Claude Mythos 5 ging am 12. Juni unter Exportkontrollen offline; Gemini 3.5 Pro rutschte auf Juli.
  • Tier-Verwirrung: Preis- und Leistungslücken zwischen Sol/Terra/Luna sind groß — Benchmarks zählen mehr als Branding.
  • Safety-Compliance: Alle drei Tiers tragen OpenAIs «High»-Cyber-Rating; Unternehmen brauchen früh Abuse Controls und Audit-Pläne.
  • Infra-Timing: Im Juli kommen Cerebras 750 t/s plus Public API — Teams ohne elastische Knoten riskieren Integrations-Engpässe am Tag eins.
  • DSGVO bei Cloud-Daten: EU-Teams, die Prompts und Agent-Logs über US-APIs senden, sollten Verarbeitungsgrundlage, Auftragsverarbeitung und Datenfluss vor dem breiten Rollout dokumentieren.

02 GPT-5.6 Sol, Terra und Luna: Features und Preise

OpenAI benannte die Familie erstmals nach Himmelskörpern: Sol (Sonne) für Flagship-Leistung, Terra (Erde) für ausgewogenes Kosten/Leistungs-Verhältnis und Luna (Mond) für schnellen, günstigen Durchsatz.

GPT-5.6 Sol — Flagship

Sol zielt auf schweres Coding, langfristige Security-Forschung und mehrstufige agentische Workflows. Preise entsprechen GPT-5.5: 5 $ / 30 $ pro Million Tokens Input/Output. Kontextfenster liegt bei etwa 1,5 M Tokens.

Zwei neue Reasoning-Modi:

  • Max-Modus: Zusätzliche Reasoning-Zeit vor der Antwort — tauscht Latenz gegen Genauigkeit bei kritischen Tasks.
  • Ultra-Modus: Startet mehrere parallele Subagenten, die Arbeit aufteilen, parallel ausführen und Ergebnisse zusammenführen. Diese Architektur treibt den TerminalBench-Rekord von 91,9 %, verbraucht aber deutlich mehr Tokens.

GPT-5.6 Terra — ausgewogener Workhorse

Terra ist der Default für volumenstarke Business-Arbeit: Support-Tickets, interne Tools, Dokumentenanalyse. Leistung liegt nahe GPT-5.5 bei der Hälfte der Kosten (2,50 $ / 15 $ pro MTok).

GPT-5.6 Luna — Lightweight

Luna optimiert für Zusammenfassungen, Entwürfe und Routine-Automatisierung. Es ist OpenAIs erstes Nicht-Flagship-Modell mit «High»-Rating in Cybersecurity und Biologie, bei 1 $ / 6 $ pro MTok.

Welches GPT-5.6-Modell passt?
Bedarf Wahl
Komplexe Coding-Agenten und mehrstufige Workflows Sol (Ultra)
High-Volume-Docs, Support, Produktions-APIs Terra
Zusammenfassung, Entwürfe, leichte Automatisierung Luna
GPT-5.5-Niveau im Budget Terra
Ultra-niedrige Latenz ab Juli (Enterprise) Sol auf Cerebras

03 GPT-5.6-Benchmark-Ergebnisse und Cerebras 750 Tokens pro Sekunde

Coding: TerminalBench 2.1

TerminalBench 2.1 führt 89 komplexe Command-Line-Planungsaufgaben aus — näher an echter Agent-Arbeit als Single-Shot-Code-Completion.

TerminalBench-2.1-Scores
Modell Score Modus
GPT-5.6 Sol 91,9 % Ultra (Multi-Agent)
GPT-5.6 Sol 88,8 % Standard
Claude Mythos 5 88,0 % Standard
GPT-5.5 83,4 % Standard
Gemini 3.1 Pro Preview 70,7 % Standard

Claude Mythos 5 hielt die Spitze nur 17 Tage (seit 9. Juni), bevor Sol vorbeizog.

Langfrist-Agenten: Agent's Last Exam

  • GPT-5.6 Sol: 50,9 % Task-Completion — das einzige Modell über 50 %
  • GPT-5.6 Luna: Leicht über GPT-5.5

Cybersecurity: CTF und ExploitBench

GPT-5.6 ist die erste OpenAI-Familie, bei der alle drei Tiers die «High»-Cybersecurity-Klassifikation erreichen.

Capture-the-Flag-Trefferquoten
Modell Trefferquote
Sol 96,7 %
Terra 91,84 %
Luna 85,19 %

ExploitBench: Sol entspricht Anthropics Mythos Preview bei nur etwa einem Drittel der Output-Tokens — gleiche Security-Forschungstiefe bei deutlich niedrigeren Kosten.

Safety-Hinweis: OpenAI-Red-Teaming bestätigte, dass Sol autonom keine vollständige, funktionale Exploit-Chain gegen gehärtete Chromium- oder Firefox-Ziele konstruieren kann. Es bleibt unter OpenAIs «Cyber Critical»-Schwelle.

Life Sciences: Auf GeneBench v1 entspricht Sol GPT-5.5 oder schlägt es mit weniger Tokens. HealthBench Professional: 60,5 (+8,7 vs GPT-5.5).

Cerebras-Beschleunigung (Juli 2026)

Ab Juli zielt Sol auf Cerebras-Hardware auf bis zu 750 Tokens pro Sekunde. Die meisten Frontier-Modelle liegen heute bei 50–150 t/s — ein 5×- bis 15×-Speedup. Eine 10-Sekunden-Antwort könnte in unter einer Sekunde fertig sein für Echtzeit-Coding-Assistenten und Streaming-Agenten. Erstzugang ist auf ausgewählte Enterprise-Kunden beschränkt, während die Kapazität wächst.

Integrierte Schutzmaßnahmen: Echtzeit-Missbrauchs-Klassifikatoren, Account-Level-Review für sensible Flows, 700.000 A100-äquivalente GPU-Stunden automatisiertes Red-Teaming, universelles Jailbreak-Testing, spezialisierter Reasoning-Filter als Backup und externe Security-Audits vor dem Launch.

04 GPT-5.6 vs Claude Mythos 5 und die staatliche Einschränkung

GPT-5.6 Sol vs Claude Mythos 5
Kategorie GPT-5.6 Sol Claude Mythos 5
TerminalBench 2.1 91,9 % (Ultra) / 88,8 % 88,0 %
ExploitBench Nahezu identisch, ~3× günstiger bei Tokens Stark (eingeschränkter Zugang)
Preise 5 $ / 30 $ pro MTok 10 $ / 50 $ (offline)
Verfügbarkeit Begrenzte Preview → allgemeine Veröffentlichung bald Offline (US-Exportkontrolle)
Kontextfenster ~1,5 M Tokens 200K Tokens

Fazit: Sol führt bei TerminalBench und bietet vergleichbare Security-Forschung zum halben Preis. Mythos 5 kann bei Benchmarks wie SWE-Bench Pro noch führen, wo GPT-5.6-System-Card-Daten noch nicht vollständig veröffentlicht sind.

Juni 2026: Alle drei Frontier-Labs blockiert

Flagship-Release-Status — Juni 2026
Unternehmen Modell Status
OpenAI GPT-5.6 Sol/Terra/Luna Begrenzte Preview (~20 Orgs)
Anthropic Claude Fable 5 / Mythos 5 Erzwungen offline 12. Juni
Google Gemini 3.5 Pro Verschoben auf Juli

Juni sollte der größte Monat in der KI-Geschichte werden. Stattdessen blieben alle drei Flagship-Releases an der Tür stecken — ein Präzedenzfall dafür, wie Frontier-Modelle global deployt werden könnten.

Zugangs-Timeline:

  • Jetzt (Juni 2026): ~20 genehmigte Partner über API und Codex only.
  • Ab Juli 2026: Allgemeines ChatGPT (Plus/Pro zuerst), Public API, Cerebras Sol bis 750 t/s für Enterprise.

05 Sechs Vorbereitungsschritte, zitierbare Daten und FAQ

Sechs Schritte vor allgemeiner Verfügbarkeit:

  1. Produktion auf GPT-5.5 oder Claude Opus 4.8 halten, bis Sol breit verfügbar ist — Agent-Pipelines nicht an Preview-only-Zugang hängen.
  2. LiteLLM-Routen vorbereiten mit Platzhaltern für gpt-5.6-sol, gpt-5.6-terra und gpt-5.6-luna, damit A/B-Tests per Env-Vars am Tag eins laufen.
  3. Ultra-Kosten-Guardrails setzen: Ultra-Multi-Agent-Modus verbrennt Tokens schnell — max_tokens und Komplexitäts-Schwellen im Code setzen.
  4. Cursor Rules und Agent Skills in Git versionieren für einstündige Benchmark-Replay, wenn die API öffnet.
  5. OpenAI Status und Polymarket beobachten: 87 % implizite Odds für Release bis 31. Juli — nützliches Signal, kein offizieller Kalender.
  6. 24/7-Bare-Metal-Knoten aufsetzen mit Codex CLI, OpenClaw Gateway und Self-hosted Runners — Modellwechsel als Hot-Swaps statt Rebuilds. EU-Teams mit DSGVO-Pflicht: Prompts und Agent-Logs auf isolierten Knoten in kontrollierter Jurisdiktion verarbeiten statt unkontrolliert über US-Cloud-APIs zu leaken.

Zitierbare technische Daten:

  • TerminalBench 2.1: Sol Ultra 91,9 %, Standard 88,8 %, Mythos 5 88,0 %, GPT-5.5 83,4 %
  • CTF-Trefferquoten: Sol 96,7 %, Terra 91,84 %, Luna 85,19 %
  • Cerebras: bis 750 t/s im Juli — etwa 5–15× heutige Frontier-Geschwindigkeiten
  • Preise: Sol 5 $/30 $, Terra 2,50 $/15 $, Luna 1 $/6 $ pro MTok
  • Kontext: ~1,5 M Tokens (erneut prüfen, wenn die vollständige System Card erscheint)

FAQ

  • Ist GPT-5.6 schon in ChatGPT? Nicht für die breite Öffentlichkeit. Nur ~20 Trusted Partner; vollständiger ChatGPT-Rollout innerhalb weniger Wochen erwartet (Juli 2026).
  • Ist GPT-5.6 Sol besser als Claude Fable 5 fürs Coding? Sol führt TerminalBench 2.1 (91,9 % vs 88 % bei Mythos 5). Fable 5 führt noch SWE-Bench Pro, ist aber unter Exportkontrollen offline.
  • Was ist der Ultra-Modus? Mehrere parallele Subagenten teilen eine Aufgabe, arbeiten gleichzeitig und synthetisieren eine Antwort — höhere Leistung, höhere Token-Kosten.
  • Warum ist GPT-5.6 eingeschränkt? US-Regierungsreview unter Trumps Order vom 2. Juni, koordiniert über White House OSTP und ONCD. OpenAI kam nach, lehnt aber eine dauerhafte Regel ab.
  • Wie schnell ist GPT-5.6 auf Cerebras? Bis 750 Tokens pro Sekunde — etwa 5–15× die meisten aktuellen Frontier-Modelle, Juli 2026 für ausgewählte Enterprise-Kunden.
  • Wie groß ist das GPT-5.6-Kontextfenster? Berichtet bei ~1,5 M Tokens, gegenüber 1 M bei GPT-5.5 — offizielle Bestätigung mit der vollständigen System Card erwartet.
  • Sind alle drei GPT-5.6-Modelle sicher für Cybersecurity-Arbeit? Alle tragen OpenAIs «High»-Cyber-Rating mit mehrschichtigen Schutzmaßnahmen; Modelle können autonom keine vollständigen funktionalen Exploits bauen.

Quellen (Links nach Upstream-Updates erneut prüfen):

OpenAI: Previewing GPT-5.6 Sol

OpenAI Deployment Safety System Card

VentureBeat: GPT-5.6 Launch Coverage

SiliconAngle: GPT-5.6 vs Claude Mythos 5

TechTimes: Government Lock Analysis

Cloud-IDEs und Shared-VPS scheitern bei Agent-Workloads vorhersehbar: Laptops schlafen mitten im Run, Teams kollidieren auf einer Instanz, launchd-Daemons halten keinen 24/7-Betrieb. Für Produktions-Cursor-Agenten, Codex CLI und iOS-CI/CD liefert CALMVPS Bare-Metal-Mac-Mini-Miete dediziertes Apple Silicon, 120-Sekunden-Provisioning und Monatsabrechnung — OPENAI_MODEL auf isoliertem Knoten wechseln, wenn GPT-5.6 öffnet, ohne den Stack neu zu bauen. Für EU-Teams mit DSGVO-Anforderungen: Agent-Logs und Prompts auf dedizierten Knoten in kontrollierter Jurisdiktion halten.