DeepSeek V4 GA (Juli 2026):
Preise, Benchmarks und Vergleich mit GPT-5.6

Kurzfassung: Nach drei Monaten Preview-Zugang ist DeepSeek V4 am 20. Juli 2026 offiziell in die General Availability (GA) gegangen. Die Vollversion bringt messbare Upgrades bei Agent-Tasks, Mathematik und Code — plus erstmals bei DeepSeek zeitbasierte Peak-Preise.

Dieser datengetriebene Report richtet sich an Entwickler und Produktteams, die API-Optionen, Open-Weight-Modelle und laufende Inferenzkosten evaluieren. Enthalten: Architektur-Breakdown, Benchmark-Zahlen, vollständige Preistabellen, ehrlicher Vergleich mit GPT-5.6 und Claude Fable 5 sowie eine Migrations-Checkliste vor dem 24.-Juli-Deadline.

01 Was ändert sich in der GA gegenüber der April-Preview?

Reale Pain Points vor dem Wechsel:

  • Legacy-Endpunkte enden am 24. Juli: deepseek-chat und deepseek-reasoner werden dauerhaft abgeschaltet. Nicht migrierte Produktionscode bricht sofort.
  • Peak-Preise erfordern Scheduling: Werktags 09:00–12:00 und 14:00–18:00 Peking-Zeit verdoppeln sich die Sätze. 24/7-Agent-Pipelines brauchen Umplanung.
  • GA-Performance weicht von Preview ab: Agent-, Mathe- und Code-Fähigkeiten wurden gezielt verbessert. April-Benchmarks sind nicht mehr belastbar.
  • Pro vs Flash Routing zählt: 1,6T und 284B unterscheiden sich stark. Falsches Routing verbrennt Budget oder kostet Qualität.
DeepSeek V4 — zentrale Termine
Datum Ereignis
24. Apr. 2026 V4-Preview + MIT Open Source: V4-Pro (1,6T) und V4-Flash (284B)
Mai 2026 Produktionsgetunte V4-Flash und V4-Pro, API allgemein verfügbar
Jun. 2026 V4-Pro Output-Preis dauerhaft um 75 % gesenkt auf $0,87/M Tokens
29. Jun. 2026 E-Mail an alle API-Nutzer: GA Mitte Juli, erste Offenlegung Peak-Valley-Preise
19. Jul. 2026 GA-Gray-Release für ausgewählte Entwickler; Medien berichten Launch
20. Jul. 2026 GA offiziell live
24. Jul. 2026 deepseek-chat / deepseek-reasoner dauerhaft eingestellt

Die GA ist keine neue Architektur — sie ist die April-Preview mit Stabilitätsverbesserungen und formaler kommerzieller Preisstruktur in die Produktion überführt.

02 Wie DeepSeek V4 1M Tokens praktikabel skaliert

V4-Pro vs V4-Flash — Spezifikationen
Spezifikation V4-Pro V4-Flash
Gesamtparameter 1,6 Billionen 284 Milliarden
Aktiv pro Token 49B (3 % des Gesamtwerts) 13B (4,6 %)
Layer 61 43
Kontextfenster 1.000.000 Tokens 1.000.000 Tokens
Max. Output 384K Tokens 384K Tokens
Präzision FP4 (MoE-Experten) + FP8 (Rest) FP4 + FP8 gemischt
Trainingsdaten 33T+ Tokens 32T+ Tokens
Lizenz MIT MIT

DeepSeek ersetzte Multi-head Latent Attention (MLA) aus V2/V3 durch ein Zwei-Spur-Hybrid-System:

  • Compressed Sparse Attention (CSA): Komprimiert KV-Einträge 4× via Softmax-gated Pooling, nutzt FP4-Lightning-Indexer für Top-k-Auswahl (Top-1024 auf Pro, Top-512 auf Flash) plus 128-Token-Sliding-Window. Bei 1M Tokens benötigt Inferenz nur 27 % der V3.2-FLOPs.
  • Heavily Compressed Attention (HCA): 128× Kompression gefolgt von dichtem globalem Attention. Erfasst Langstrecken-Muster, die CSA übersehen könnte. CSA und HCA alternieren über Layer.
  • Manifold-Constrained Hyper-Connections (mHC): Vier Kanäle Residual-Stream, gesteuert durch doppelt-stochastische Matrix — hält Gradienten über 61 tiefe Layer stabil.
  • Muon Optimizer: Newton-Schulz-Orthogonalisierung konditioniert Gradientenschritte besser als AdamW und beschleunigt Konvergenz.

Nettoeffekt: KV-Cache bei 1M Tokens sinkt auf 10 % des V3.2-Speichers (7 % auf V4-Flash).

Drei Reasoning-Modi
Modus Beschreibung Einsatz
Non-think Schnell, ohne Chain-of-Thought Einfache Queries, Routing, Klassifikation
Think High Explizites Reasoning in Thinking-Blöcken Debugging, mittlere Komplexität
Think Max Maximale Reasoning-Anstrengung (384K+ Kontext) Komplexe Mathematik, Multi-Step-Agent-Planung

Offizielle Sampling-Empfehlung: temperature=1.0, top_p=1.0 für alle Modi.

03 Ist DeepSeek V4 besser als GPT-5.6? Benchmark-Zahlen

V4-Pro — Kern-Benchmarks
Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80,6 % (Open-Weight-Rekord) 96,0 % N/A ~69 %
SWE-bench Pro 55,4 % 80,3 % 78,1 % 69,2 %
LiveCodeBench (Pass@1) 93,5 % 88,1 % 87,4 % 83,2 %
Codeforces Elo 3.206
Terminal-Bench 2.1 83,9 % 88,0 % 85,1 % 82,7 %

Laut Artificial Analysis bei Strategy-&-Ops-Tasks: Claude Fable 5 erreicht 50 Punkte bei $3,48 pro Task; DeepSeek V4-Pro 38 Punkte bei $0,03 pro Task. Das sind 116× günstiger bei 24 % Performance-Lücke.

Frontier-Modell-Vergleich
Dimension DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open Weights / Self-Hosting Ja (MIT) Nein Nein
1M Kontext Ja Nicht bestätigt Ja
Output-Kosten (Off-Peak) $0,87/M ~$15/M ~$50/M
Output-Kosten (Peak) $1,74/M
Bestes Coding gesamt Zweite Liga Zweite Liga Führt SWE-bench Pro
Datensouveränität Self-Host möglich Nein Nein

V4-Pro oder V4-Flash für Budget, hohes Volumen oder Self-Hosted-Workloads. Claude Fable 5 für schwierigste Multi-File-Repo-Arbeit. GPT-5.6 für terminal-lastige Agent-Workflows und M365/Azure-Integration.

04 DeepSeek Peak-Valley-Preise: Was sie bedeuten und wie Sie sparen

Die bedeutendste GA-Änderung: zeitbasierte Preise. Sätze verdoppeln sich werktags Peking-Zeit in 09:00–12:00 und 14:00–18:00.

Vollständige V4-Pro / V4-Flash Preistabelle
Modell Position Off-Peak Peak
V4-Pro Input (Cache Hit) $0,0035/1M
V4-Pro Input (Cache Miss) $0,435/1M $0,87/1M
V4-Pro Output $0,87/1M $1,74/1M
V4-Flash Input (Cache Hit) $0,0028/1M
V4-Flash Input (Cache Miss) $0,14/1M $0,28/1M
V4-Flash Output $0,28/1M $0,56/1M

Vier praktische Kostensenker:

  • Batch-Jobs Off-Peak planen: Bulk-Summaries, Code-Review und Daten-Pipelines nach 18:00 oder vor 09:00 Peking-Zeit.
  • Cache-Hit-Rate maximieren: Statische System-Prompts zuerst. V4-Flash Cache Hits kosten nur $0,0028/M.
  • Einfache Queries auf V4-Flash routen: Intent-Klassifikation und FAQ auf Flash; komplexes Reasoning an Pro eskalieren.
  • Abrechnungs-E-Mails beobachten: DeepSeek kündigt Preisänderungen 24 Stunden im Voraus an.

Selbst im Peak kostet V4-Pro Output bei $1,74/M 8,6× weniger als Claude Opus 4.8 ($15/M) und GPT-5.6 Sol (~$15/M).

05 Migration von deepseek-chat vor dem 24. Juli — FAQ und DSGVO

Deadline: 24. Juli 2026, 15:59 UTC. Legacy-Namen deepseek-chat und deepseek-reasoner werden dauerhaft deaktiviert.

API-Migrations-Mapping
Altes Modell Neues Äquivalent Hinweis
deepseek-chat deepseek-v4-flash (Non-thinking) Drop-in für die meisten Chat-Use-Cases
deepseek-reasoner deepseek-v4-flash (Thinking-Modus) Oder Upgrade auf deepseek-v4-pro
deepseek_v4_migration.py
Alte Variante (endet 24.07.)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

Neue Variante
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 unterstützt OpenAI ChatCompletions und Anthropic Messages API. Base URL bleibt gleich; nur Modellname aktualisieren.

Primärquellen — Links vor Zitaten erneut prüfen:

https://api-docs.deepseek.com

https://arxiv.org/abs/2606.19348

https://huggingface.co/deepseek-ai

Sechs Schritte zur Migration:

  1. Codebase durchsuchen: Alle Referenzen auf deepseek-chat und deepseek-reasoner in Code, CI-Konfigurationen und Umgebungsvariablen finden.
  2. Ersetzungen zuordnen: Leichtes Chat auf deepseek-v4-flash (Non-think); Reasoning auf Flash Thinking-Modus oder deepseek-v4-pro.
  3. SDK-Aufrufe aktualisieren: OpenAI-kompatible Clients brauchen nur Modellnamen-Wechsel. Anthropic SDK behält base_url=https://api.deepseek.com.
  4. Thinking-Modus konfigurieren: Ehemalige Reasoner-Nutzer aktivieren Thinking via extra_body. Think Max erfordert 384K+ Kontext.
  5. In Staging testen: End-to-End-Validierung vor dem 24. Juli. Peak-Preis-Impact auf Budget prüfen.
  6. Batch-Jobs Off-Peak cronen: Dokumentenverarbeitung und Code-Review nach 18:00 oder am Wochenende. Mit Prompt Cache kombinieren.

Zitierbare Kennzahlen (EEAT):

  • SWE-bench Verified 80,6 %: Beste Open-Weight-Punktzahl, gleichauf mit Gemini 3.1 Pro (Quelle: DeepSeek offizielle Docs, Jul. 2026).
  • KV-Cache bei 10 %: 1M-Token-Szenarien nutzen nur 10 % V3.2-Speicher; V4-Flash bis 7 % (Quelle: arXiv:2606.19348).
  • 116× Kosten-Vorteil: Artificial Analysis Strategy & Ops: V4-Pro $0,03/Task vs Fable 5 $3,48/Task (Quelle: Artificial Analysis, Jul. 2026).

FAQ:

  • F1: Ist DeepSeek V4 kostenlos? A: Gewichte MIT-lizenziert und downloadbar; API pay-per-token mit Peak-Valley-Staffelung.
  • F2: Lokal lauffähig? A: Ja — V4-Pro und V4-Flash ab April auf Hugging Face; Produktion braucht dedizierte GPU/Accelerator-Farm, kein Laptop.
  • F3: V4-Pro vs V4-Flash? A: Pro für schweres Reasoning und Agent-Planung; Flash für hohes Volumen, Routing und einfache Chat-Tasks — deutlich günstiger.
  • F4: Was passiert am 24. Juli? A: deepseek-chat und deepseek-reasoner antworten nicht mehr; nur V4-Modellnamen gültig.
  • F5: Peak-Preise in EU-Zeitzone? A: Staffelung folgt Peking-Zeit (UTC+8); Cron-Jobs und Budget-Alerts entsprechend umrechnen.
  • F6: OpenAI SDK kompatibel? A: Ja — ChatCompletions und Anthropic Messages; Base URL unverändert, nur model anpassen.

DSGVO, Self-Hosting und Datenschutz: Die DeepSeek-Cloud-API (api.deepseek.com) verarbeitet Prompts, Code-Snippets und Agent-Logs in chinesischen Rechenzentren — für EU-Teams mit personenbezogenen Daten in Prompts eine Drittlandübermittlung nach Art. 44 ff. DSGVO. Auftragsverarbeitungsvertrag, Standardvertragsklauseln und Datenminimierung prüfen. Mit MIT-Gewichten und Self-Hosting in EU-Infrastruktur bleiben Inferenzdaten unter eigener Kontrolle — relevant für regulierte Branchen, die Datensouveränität neben Benchmark-Kosten priorisieren. Reine API-Nutzung ohne PII in Prompts reduziert Risiko, ersetzt aber keine Rechtsberatung.

Fazit: DeepSeek V4 GA geht nicht darum, Claude Fable 5 oder GPT-5.6 in jedem Benchmark zu schlagen — sondern die stärkste Open-Weight-Performance zu 1/10 bis 1/100 der Kosten geschlossener Frontier-Modelle zu liefern.

DeepSeek-V4-API in ein lokales OpenClaw Gateway oder Cursor-Agent-Stack einzubinden: Schlafender Mac unterbricht lange SWE-bench-Runs; Peak-Stunden-24/7-Pipelines sind auf dem Laptop schwer planbar. Reine API-Calls brauchen keine lokale GPU, aber Hybrid-Setups (lokales Gateway + Cloud-Inferenz + Always-on-Orchestrierung) fehlt oft ein stabiler Host für Agent-Loops. Für Produktionsumgebungen mit AI-Coding-Agents, OpenClaw-Multi-Modell-Routing oder 24/7-Agent-Zyklen ist CALMVPS Bare-Metal Mac Mini Miete meist die bessere Wahl: dediziertes Apple Silicon, Metal-native Beschleunigung, flexible Monatsabrechnung, ~120 s Bereitstellung. Preisseite.