Kurzfassung: Nach drei Monaten Preview-Zugang ist DeepSeek V4 am 20. Juli 2026 offiziell in die General Availability (GA) gegangen. Die Vollversion bringt messbare Upgrades bei Agent-Tasks, Mathematik und Code — plus erstmals bei DeepSeek zeitbasierte Peak-Preise.
Dieser datengetriebene Report richtet sich an Entwickler und Produktteams, die API-Optionen, Open-Weight-Modelle und laufende Inferenzkosten evaluieren. Enthalten: Architektur-Breakdown, Benchmark-Zahlen, vollständige Preistabellen, ehrlicher Vergleich mit GPT-5.6 und Claude Fable 5 sowie eine Migrations-Checkliste vor dem 24.-Juli-Deadline.
01 Was ändert sich in der GA gegenüber der April-Preview?
Reale Pain Points vor dem Wechsel:
- Legacy-Endpunkte enden am 24. Juli:
deepseek-chatunddeepseek-reasonerwerden dauerhaft abgeschaltet. Nicht migrierte Produktionscode bricht sofort. - Peak-Preise erfordern Scheduling: Werktags 09:00–12:00 und 14:00–18:00 Peking-Zeit verdoppeln sich die Sätze. 24/7-Agent-Pipelines brauchen Umplanung.
- GA-Performance weicht von Preview ab: Agent-, Mathe- und Code-Fähigkeiten wurden gezielt verbessert. April-Benchmarks sind nicht mehr belastbar.
- Pro vs Flash Routing zählt: 1,6T und 284B unterscheiden sich stark. Falsches Routing verbrennt Budget oder kostet Qualität.
| Datum | Ereignis |
|---|---|
| 24. Apr. 2026 | V4-Preview + MIT Open Source: V4-Pro (1,6T) und V4-Flash (284B) |
| Mai 2026 | Produktionsgetunte V4-Flash und V4-Pro, API allgemein verfügbar |
| Jun. 2026 | V4-Pro Output-Preis dauerhaft um 75 % gesenkt auf $0,87/M Tokens |
| 29. Jun. 2026 | E-Mail an alle API-Nutzer: GA Mitte Juli, erste Offenlegung Peak-Valley-Preise |
| 19. Jul. 2026 | GA-Gray-Release für ausgewählte Entwickler; Medien berichten Launch |
| 20. Jul. 2026 | GA offiziell live |
| 24. Jul. 2026 | deepseek-chat / deepseek-reasoner dauerhaft eingestellt |
Die GA ist keine neue Architektur — sie ist die April-Preview mit Stabilitätsverbesserungen und formaler kommerzieller Preisstruktur in die Produktion überführt.
02 Wie DeepSeek V4 1M Tokens praktikabel skaliert
| Spezifikation | V4-Pro | V4-Flash |
|---|---|---|
| Gesamtparameter | 1,6 Billionen | 284 Milliarden |
| Aktiv pro Token | 49B (3 % des Gesamtwerts) | 13B (4,6 %) |
| Layer | 61 | 43 |
| Kontextfenster | 1.000.000 Tokens | 1.000.000 Tokens |
| Max. Output | 384K Tokens | 384K Tokens |
| Präzision | FP4 (MoE-Experten) + FP8 (Rest) | FP4 + FP8 gemischt |
| Trainingsdaten | 33T+ Tokens | 32T+ Tokens |
| Lizenz | MIT | MIT |
DeepSeek ersetzte Multi-head Latent Attention (MLA) aus V2/V3 durch ein Zwei-Spur-Hybrid-System:
- Compressed Sparse Attention (CSA): Komprimiert KV-Einträge 4× via Softmax-gated Pooling, nutzt FP4-Lightning-Indexer für Top-k-Auswahl (Top-1024 auf Pro, Top-512 auf Flash) plus 128-Token-Sliding-Window. Bei 1M Tokens benötigt Inferenz nur 27 % der V3.2-FLOPs.
- Heavily Compressed Attention (HCA): 128× Kompression gefolgt von dichtem globalem Attention. Erfasst Langstrecken-Muster, die CSA übersehen könnte. CSA und HCA alternieren über Layer.
- Manifold-Constrained Hyper-Connections (mHC): Vier Kanäle Residual-Stream, gesteuert durch doppelt-stochastische Matrix — hält Gradienten über 61 tiefe Layer stabil.
- Muon Optimizer: Newton-Schulz-Orthogonalisierung konditioniert Gradientenschritte besser als AdamW und beschleunigt Konvergenz.
Nettoeffekt: KV-Cache bei 1M Tokens sinkt auf 10 % des V3.2-Speichers (7 % auf V4-Flash).
| Modus | Beschreibung | Einsatz |
|---|---|---|
| Non-think | Schnell, ohne Chain-of-Thought | Einfache Queries, Routing, Klassifikation |
| Think High | Explizites Reasoning in Thinking-Blöcken | Debugging, mittlere Komplexität |
| Think Max | Maximale Reasoning-Anstrengung (384K+ Kontext) | Komplexe Mathematik, Multi-Step-Agent-Planung |
Offizielle Sampling-Empfehlung: temperature=1.0, top_p=1.0 für alle Modi.
03 Ist DeepSeek V4 besser als GPT-5.6? Benchmark-Zahlen
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % (Open-Weight-Rekord) | 96,0 % | N/A | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3.206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
Laut Artificial Analysis bei Strategy-&-Ops-Tasks: Claude Fable 5 erreicht 50 Punkte bei $3,48 pro Task; DeepSeek V4-Pro 38 Punkte bei $0,03 pro Task. Das sind 116× günstiger bei 24 % Performance-Lücke.
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open Weights / Self-Hosting | Ja (MIT) | Nein | Nein |
| 1M Kontext | Ja | Nicht bestätigt | Ja |
| Output-Kosten (Off-Peak) | $0,87/M | ~$15/M | ~$50/M |
| Output-Kosten (Peak) | $1,74/M | — | — |
| Bestes Coding gesamt | Zweite Liga | Zweite Liga | Führt SWE-bench Pro |
| Datensouveränität | Self-Host möglich | Nein | Nein |
V4-Pro oder V4-Flash für Budget, hohes Volumen oder Self-Hosted-Workloads. Claude Fable 5 für schwierigste Multi-File-Repo-Arbeit. GPT-5.6 für terminal-lastige Agent-Workflows und M365/Azure-Integration.
04 DeepSeek Peak-Valley-Preise: Was sie bedeuten und wie Sie sparen
Die bedeutendste GA-Änderung: zeitbasierte Preise. Sätze verdoppeln sich werktags Peking-Zeit in 09:00–12:00 und 14:00–18:00.
| Modell | Position | Off-Peak | Peak |
|---|---|---|---|
| V4-Pro | Input (Cache Hit) | $0,0035/1M | 2× |
| V4-Pro | Input (Cache Miss) | $0,435/1M | $0,87/1M |
| V4-Pro | Output | $0,87/1M | $1,74/1M |
| V4-Flash | Input (Cache Hit) | $0,0028/1M | 2× |
| V4-Flash | Input (Cache Miss) | $0,14/1M | $0,28/1M |
| V4-Flash | Output | $0,28/1M | $0,56/1M |
Vier praktische Kostensenker:
- Batch-Jobs Off-Peak planen: Bulk-Summaries, Code-Review und Daten-Pipelines nach 18:00 oder vor 09:00 Peking-Zeit.
- Cache-Hit-Rate maximieren: Statische System-Prompts zuerst. V4-Flash Cache Hits kosten nur $0,0028/M.
- Einfache Queries auf V4-Flash routen: Intent-Klassifikation und FAQ auf Flash; komplexes Reasoning an Pro eskalieren.
- Abrechnungs-E-Mails beobachten: DeepSeek kündigt Preisänderungen 24 Stunden im Voraus an.
Selbst im Peak kostet V4-Pro Output bei $1,74/M 8,6× weniger als Claude Opus 4.8 ($15/M) und GPT-5.6 Sol (~$15/M).
05 Migration von deepseek-chat vor dem 24. Juli — FAQ und DSGVO
Deadline: 24. Juli 2026, 15:59 UTC. Legacy-Namen deepseek-chat und deepseek-reasoner werden dauerhaft deaktiviert.
| Altes Modell | Neues Äquivalent | Hinweis |
|---|---|---|
| deepseek-chat | deepseek-v4-flash (Non-thinking) | Drop-in für die meisten Chat-Use-Cases |
| deepseek-reasoner | deepseek-v4-flash (Thinking-Modus) | Oder Upgrade auf deepseek-v4-pro |
Alte Variante (endet 24.07.)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
Neue Variante
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
V4 unterstützt OpenAI ChatCompletions und Anthropic Messages API. Base URL bleibt gleich; nur Modellname aktualisieren.
Primärquellen — Links vor Zitaten erneut prüfen:
https://arxiv.org/abs/2606.19348
https://huggingface.co/deepseek-ai
Sechs Schritte zur Migration:
- Codebase durchsuchen: Alle Referenzen auf
deepseek-chatunddeepseek-reasonerin Code, CI-Konfigurationen und Umgebungsvariablen finden. - Ersetzungen zuordnen: Leichtes Chat auf
deepseek-v4-flash(Non-think); Reasoning auf Flash Thinking-Modus oderdeepseek-v4-pro. - SDK-Aufrufe aktualisieren: OpenAI-kompatible Clients brauchen nur Modellnamen-Wechsel. Anthropic SDK behält
base_url=https://api.deepseek.com. - Thinking-Modus konfigurieren: Ehemalige Reasoner-Nutzer aktivieren Thinking via
extra_body. Think Max erfordert 384K+ Kontext. - In Staging testen: End-to-End-Validierung vor dem 24. Juli. Peak-Preis-Impact auf Budget prüfen.
- Batch-Jobs Off-Peak cronen: Dokumentenverarbeitung und Code-Review nach 18:00 oder am Wochenende. Mit Prompt Cache kombinieren.
Zitierbare Kennzahlen (EEAT):
- SWE-bench Verified 80,6 %: Beste Open-Weight-Punktzahl, gleichauf mit Gemini 3.1 Pro (Quelle: DeepSeek offizielle Docs, Jul. 2026).
- KV-Cache bei 10 %: 1M-Token-Szenarien nutzen nur 10 % V3.2-Speicher; V4-Flash bis 7 % (Quelle: arXiv:2606.19348).
- 116× Kosten-Vorteil: Artificial Analysis Strategy & Ops: V4-Pro $0,03/Task vs Fable 5 $3,48/Task (Quelle: Artificial Analysis, Jul. 2026).
FAQ:
- F1: Ist DeepSeek V4 kostenlos? A: Gewichte MIT-lizenziert und downloadbar; API pay-per-token mit Peak-Valley-Staffelung.
- F2: Lokal lauffähig? A: Ja — V4-Pro und V4-Flash ab April auf Hugging Face; Produktion braucht dedizierte GPU/Accelerator-Farm, kein Laptop.
- F3: V4-Pro vs V4-Flash? A: Pro für schweres Reasoning und Agent-Planung; Flash für hohes Volumen, Routing und einfache Chat-Tasks — deutlich günstiger.
- F4: Was passiert am 24. Juli? A:
deepseek-chatunddeepseek-reasonerantworten nicht mehr; nur V4-Modellnamen gültig. - F5: Peak-Preise in EU-Zeitzone? A: Staffelung folgt Peking-Zeit (UTC+8); Cron-Jobs und Budget-Alerts entsprechend umrechnen.
- F6: OpenAI SDK kompatibel? A: Ja — ChatCompletions und Anthropic Messages; Base URL unverändert, nur
modelanpassen.
DSGVO, Self-Hosting und Datenschutz: Die DeepSeek-Cloud-API (api.deepseek.com) verarbeitet Prompts, Code-Snippets und Agent-Logs in chinesischen Rechenzentren — für EU-Teams mit personenbezogenen Daten in Prompts eine Drittlandübermittlung nach Art. 44 ff. DSGVO. Auftragsverarbeitungsvertrag, Standardvertragsklauseln und Datenminimierung prüfen. Mit MIT-Gewichten und Self-Hosting in EU-Infrastruktur bleiben Inferenzdaten unter eigener Kontrolle — relevant für regulierte Branchen, die Datensouveränität neben Benchmark-Kosten priorisieren. Reine API-Nutzung ohne PII in Prompts reduziert Risiko, ersetzt aber keine Rechtsberatung.
Fazit: DeepSeek V4 GA geht nicht darum, Claude Fable 5 oder GPT-5.6 in jedem Benchmark zu schlagen — sondern die stärkste Open-Weight-Performance zu 1/10 bis 1/100 der Kosten geschlossener Frontier-Modelle zu liefern.
DeepSeek-V4-API in ein lokales OpenClaw Gateway oder Cursor-Agent-Stack einzubinden: Schlafender Mac unterbricht lange SWE-bench-Runs; Peak-Stunden-24/7-Pipelines sind auf dem Laptop schwer planbar. Reine API-Calls brauchen keine lokale GPU, aber Hybrid-Setups (lokales Gateway + Cloud-Inferenz + Always-on-Orchestrierung) fehlt oft ein stabiler Host für Agent-Loops. Für Produktionsumgebungen mit AI-Coding-Agents, OpenClaw-Multi-Modell-Routing oder 24/7-Agent-Zyklen ist CALMVPS Bare-Metal Mac Mini Miete meist die bessere Wahl: dediziertes Apple Silicon, Metal-native Beschleunigung, flexible Monatsabrechnung, ~120 s Bereitstellung. Preisseite.