Am 31. Juli 2026 hat DeepSeek V4-Flash zur offiziellen API-Version (Build 0731) befördert: 284B Gesamtparameter / 13B aktiv unverändert, Gewinne ausschließlich durch erneutes Post-Training. Auf mehreren Agent-Benchmarks übertrifft das Modell die größere V4-Pro-Preview; die API-Preise liegen bei einem Bruchteil von Claude Opus 4.8. Flaggschiff V4-Pro und das Agent-Framework Harness sind weiterhin nicht GA.
Dieser datengetriebene Report richtet sich an Teams mit DeepSeek-API-Anbindung, Agent-Pipelines und Kostenvergleich chinesischer Open-Weight-Modelle. Enthalten: Zeitachse April–August, Herstellerpreise vs. Artificial Analysis Intelligence Index, CSA+HCA-Architektur, Harness-Sensitivität, Matrix Kimi K3 / GLM-5.2 / Qwen3.8-Max, Kill-Line-Kontext, sechs Migrations-Schritte und FAQ. Ziel: klare Entscheidung Flash vs. Pro, belastbare vs. fragwürdige Benchmarks, saubere API-Umstellung.
01 DeepSeek V4 Flash offiziell: Zeitachse von der April-Preview bis zur Juli-API
Kein Architekturwechsel, sondern iterative Verfeinerung derselben 284B-MoE-Plattform über ein dreimonatiges Fenster:
- 24. April 2026: DeepSeek-V4-Preview mit V4-Pro (1,6T / 49B aktiv) und V4-Flash (284B / 13B), jeweils 1M Token Kontext, MIT-Lizenz.
- 24. Juli 2026: Legacy-Aliase
deepseek-chatunddeepseek-reasonerabgeschaltet; Traffic auf V4-Familie umgestellt. - 27. Juli 2026: Moonshot AI veröffentlicht Kimi K3 (2,8T) als Open Weights auf Hugging Face — direkter Wettbewerbsdruck Tage vor dem DeepSeek-Update.
- 31. Juli 2026:
deepseek-v4-flashoffizielle API-Beta (0731); Open Weights synchron auf Hugging Face. Changelog nennt erstmals DeepSeek Harness. Nur API — App und Web-Chat unverändert. - Stand 5. August 2026: Offizielles V4-Pro weiterhin „so bald wie möglich“, ohne bestätigtes Datum. Chinesische Medien zitieren anonyme Quellen für ein GA-Fenster 10.–20. August — von DeepSeek nicht bestätigt.
Die Leistungssteigerung stammt ausschließlich aus Post-Training, nicht aus Skalierung — 284B Flash schlägt 1,6T V4-Pro-Preview auf Agent-Tasks. Der Wettbewerb 2. Halbjahr 2026 verschiebt sich von Parameter-Größe zu Trainingsqualität.
02 DeepSeek V4 Flash Preise und Parameter vs. Wettbewerb (August 2026)
Alle Preise sind Herstellerangaben. DeepSeek kündigt künftig 2x Peak-Zuschlag werktags 09:00–12:00 und 14:00–18:00 Peking-Zeit an — ohne festes Startdatum.
| Modell | Status | Gesamt / aktiv | Input (Cache-Miss / Hit) | Output |
|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | Offiziell (31.07.) | 284B / 13B | $0,14 / $0,0028 | $0,28 |
| DeepSeek-V4-Pro | Nur Preview | 1,6T / 49B | $0,435 / $0,003625 | $0,87 |
| Kimi K3 | Open Weights (27.07.) | 2,8T / ~104B (Community-Schätzung) | $3,00 / $0,30 | $15,00 |
| GLM-5.2 | Open Source (Juni 2026) | ~744B / ~40B | Nicht unabhängig verifiziert | |
| Qwen3.8-Max | API GA (02.08.), Gewichte ausstehend | 2,4T / 95B | $2,00 / ~$0,17–0,25 | $6,00 |
Der unabhängige Artificial Analysis Intelligence Index und die durchschnittlichen Kosten pro Task (über Finanzmedien zitiert) ergänzen die Herstellerperspektive:
| Modell | Intelligence Index | Ø Kosten pro Task |
|---|---|---|
| DeepSeek-V4-Flash-0731 | 50 | $0,03 |
| Kimi K3 | 57 | $0,86 |
| GPT-5.6 Sol | ~9 Punkte über Flash | $1,86 |
| Claude Fable 5 | ~9 Punkte über Flash | $3,15 |
V4-Flash führt den Index nicht an, kostet pro Task aber etwa 1/29 von Kimi K3 und 1/105 von Claude Fable 5 — DeepSeek optimiert auf „ausreichende Intelligenz zum niedrigsten Preis“, nicht auf Benchmark-Spitzenplätze.
03 Post-Training, CSA+HCA und Harness: wie aus derselben Architektur mehr Benchmark wird
Architektur unverändert — Post-Training liefert die Differenz. DeepSeek bestätigt: V4-Flash-0731 hat dieselbe Parameterzahl und Struktur wie die April-Preview. Der Technical Report „DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence“ beschreibt drei Kernbausteine (seit Preview):
- Hybrid Attention (CSA + HCA): als DSA Sparse Attention vermarktet; senkt Compute und Speicher bei langem Kontext.
- Manifold-Constrained Hyper-Connections (mHC): verbesserte Residual-Pfade.
- Muon-Optimierer: schnellere Konvergenz und stabilere Trainingsdynamik.
Herstellerangaben (noch ohne unabhängige Reproduktion): Bei 1M Token benötigt V4-Pro nur 27 % der per-Token-FLOPs von V3.2 und 10 % des KV-Cache-Footprints.
Harness-Debüt. Der Changelog vom 31. Juli benennt erstmals DeepSeek Harness — ein internes Agent-Framework als Gegenstück zu Claude Code für Dateizugriff, Tool-Calls und End-to-End-Engineering. Alle veröffentlichten Agent-Benchmarks (Terminal Bench 2.0, Toolathlon u. a.) liefen im Harness Minimal Mode mit max-Effort, top_p=0,95, temperature=1,0. Der Changelog warnt ausdrücklich: „Benchmarks sind extrem sensitiv gegenüber der Harness-Wahl“ — das sollte in jeder Kaufentscheidung mitgerechnet werden.
Laut 21st Century Business Herald berichten Entwickler von niedrigen Input-Cache-Hit-Raten und gelegentlichen Timeouts des Safety-Classifiers — ein Gegengewicht zur „Benchmark-Explosion“-Narrative.
04 Kimi K3, GLM-5.2, Qwen3.8-Max und sechs Schritte zur V4-Flash-0731-Migration
V4-Flash-0731 landet im dichtesten Open-Weight-Fenster des Jahres. Für Agent- und Batch-Workloads lautet die Frage nicht mehr „wer hat den höchsten Score“, sondern „wer hält die Rechnung unter einer akzeptablen Intelligenzuntergrenze“.
Sechs Schritte zur Migration auf V4-Flash-0731:
- Legacy-Modellnamen prüfen: Seit 24. Juli sind
deepseek-chatunddeepseek-reasonerabgeschaltet — Routing aufdeepseek-v4-flashoderdeepseek-v4-pro(Preview). - API-Oberfläche bestätigen: Build 0731 ist nur API; App und Web können hinterherhinken — Produktion folgt dem API-Changelog.
- SDK-Kompatibilität nutzen: OpenAI ChatCompletions und Anthropic-Format bleiben unverändert;
deepseek-v4-flashzeigt automatisch auf den neuen offiziellen Build. - Benchmark-Klassen trennen: SWE-bench Verified und ähnliche Drittanbieter-Suites sind belastbarer als Terminal Bench 2.0 mit nicht öffentlichem Harness — nicht 1:1 auf Claude Code oder Cursor übertragen.
- A/B auf eigenen Repos: Flash, Kimi K3 und Qwen3.8-Max in realen Agent-Workflows gegenüberstellen — Erfolgsrate und Token-Kosten, nicht nur Herstellerfolien.
- V4-Pro und Harness GA verfolgen: Offiziell nur „so bald wie möglich“; jedes August-10–20-Fenster ist Gerücht bis Changelog-Bestätigung.
Offizielle Dokumentation und Changelog:
05 Benchmark-Kontroversen, Kill-Line und Agent-Infrastruktur-Entscheidung
- Terminal Bench 2.0 (Hersteller): V4-Flash-0731 82,7 vs. V4-Pro-Preview 67,9 — gemessen mit nicht öffentlichem Harness Minimal Mode; als framework-spezifisch einstufen.
- Preisfaktoren vs. Claude Opus 4.8 (21st Century Business Herald): Cache-Miss-Input ca. 36x günstiger, Cache-Hit-Input ca. 179x, Output ca. 89x — Herstellerlistenpreise, keine Prüfung.
- „Kill-Line“ (斩杀线): chinesischer Entwickler-Jargon für die Kombination aus „ausreichender Leistung + extrem niedrigem Preis“, die Wettbewerber ohne klaren Qualitäts- oder Kostenvorteil aus Routing-Tabellen verdrängt.
FAQ
- Größter Unterschied V4 vs. V3.2? Native 1M-Token-Kontext, deutlich reduzierte FLOPs und KV-Cache bei langem Kontext; Agent-Fähigkeiten für Claude Code, OpenCode u. a. optimiert.
- Flash oder Pro im Alltag? Bulk- und Agent-Pipelines: Flash-0731; tiefere Reasoning-Anforderungen vorübergehend Pro-Preview — nach offiziellem Pro neu bewerten.
- Ist offizielles V4-Pro verfügbar? Stand 5. August nein; nur Flash-0731 offiziell, API-only.
- Benchmarks vertrauenswürdig? Breit adoptierte Drittanbieter-Suites ja; Harness-abhängige Agent-Scores erst nach unabhängiger Reproduktion mit Claude Code oder Cursor.
Wer Agent-Workflows vollständig über Cloud-APIs fährt, trägt Latenz-, Abrechnungs- und Routing-Risiken. Reine lokale Hugging-Face-Deployments stoßen an Unified-Memory-Grenzen, 24/7-Stabilität und Multi-Node-Skalierung. Für Teams mit vollem macOS-Stack (Claude Code, OpenCode, OpenClaw, Xcode CI/CD) und dauerhaft online Agent-Knoten ist CALMVPS Bare-Metal Mac Mini M4 Miete die produktionsreifere Option: dediziertes Apple Silicon, sechs Regionen, 120-Sekunden-Bereitstellung. Modelle und Live-Preise: CALMVPS Mietpreise.
DSGVO und Cloud-Daten: Die DeepSeek-Cloud-API verarbeitet Prompts, Code und Agent-Logs in chinesischen Rechenzentren — für EU-Teams mit personenbezogenen Daten in Prompts eine Drittlandübermittlung nach Art. 44 ff. DSGVO. AV-Vertrag, Standardvertragsklauseln und Datenminimierung prüfen. Mit MIT-Gewichten und Self-Hosting auf eigener Infrastruktur bleiben Inferenzdaten unter Kontrolle — relevant neben Token-Kosten. Reine API-Nutzung ohne PII reduziert Risiko, ersetzt keine Rechtsberatung.
Vor dem Rollout aktuelle Preise, Benchmarks und V4-Pro-/Harness-Status verifizieren — Datenstand 5. August 2026.