DeepSeek V4 Flash offiziell:
Benchmarks nahe Opus 4.8, Preis ein Bruchteil — Pro bleibt ausstehend

Am 31. Juli 2026 hat DeepSeek V4-Flash zur offiziellen API-Version (Build 0731) befördert: 284B Gesamtparameter / 13B aktiv unverändert, Gewinne ausschließlich durch erneutes Post-Training. Auf mehreren Agent-Benchmarks übertrifft das Modell die größere V4-Pro-Preview; die API-Preise liegen bei einem Bruchteil von Claude Opus 4.8. Flaggschiff V4-Pro und das Agent-Framework Harness sind weiterhin nicht GA.

Dieser datengetriebene Report richtet sich an Teams mit DeepSeek-API-Anbindung, Agent-Pipelines und Kostenvergleich chinesischer Open-Weight-Modelle. Enthalten: Zeitachse April–August, Herstellerpreise vs. Artificial Analysis Intelligence Index, CSA+HCA-Architektur, Harness-Sensitivität, Matrix Kimi K3 / GLM-5.2 / Qwen3.8-Max, Kill-Line-Kontext, sechs Migrations-Schritte und FAQ. Ziel: klare Entscheidung Flash vs. Pro, belastbare vs. fragwürdige Benchmarks, saubere API-Umstellung.

01 DeepSeek V4 Flash offiziell: Zeitachse von der April-Preview bis zur Juli-API

Kein Architekturwechsel, sondern iterative Verfeinerung derselben 284B-MoE-Plattform über ein dreimonatiges Fenster:

  • 24. April 2026: DeepSeek-V4-Preview mit V4-Pro (1,6T / 49B aktiv) und V4-Flash (284B / 13B), jeweils 1M Token Kontext, MIT-Lizenz.
  • 24. Juli 2026: Legacy-Aliase deepseek-chat und deepseek-reasoner abgeschaltet; Traffic auf V4-Familie umgestellt.
  • 27. Juli 2026: Moonshot AI veröffentlicht Kimi K3 (2,8T) als Open Weights auf Hugging Face — direkter Wettbewerbsdruck Tage vor dem DeepSeek-Update.
  • 31. Juli 2026: deepseek-v4-flash offizielle API-Beta (0731); Open Weights synchron auf Hugging Face. Changelog nennt erstmals DeepSeek Harness. Nur API — App und Web-Chat unverändert.
  • Stand 5. August 2026: Offizielles V4-Pro weiterhin „so bald wie möglich“, ohne bestätigtes Datum. Chinesische Medien zitieren anonyme Quellen für ein GA-Fenster 10.–20. August — von DeepSeek nicht bestätigt.

Die Leistungssteigerung stammt ausschließlich aus Post-Training, nicht aus Skalierung — 284B Flash schlägt 1,6T V4-Pro-Preview auf Agent-Tasks. Der Wettbewerb 2. Halbjahr 2026 verschiebt sich von Parameter-Größe zu Trainingsqualität.

02 DeepSeek V4 Flash Preise und Parameter vs. Wettbewerb (August 2026)

Alle Preise sind Herstellerangaben. DeepSeek kündigt künftig 2x Peak-Zuschlag werktags 09:00–12:00 und 14:00–18:00 Peking-Zeit an — ohne festes Startdatum.

DeepSeek V4 Flash vs. chinesische Open-Weight-Flaggschiffe (pro 1M Token)
Modell Status Gesamt / aktiv Input (Cache-Miss / Hit) Output
DeepSeek-V4-Flash-0731Offiziell (31.07.)284B / 13B$0,14 / $0,0028$0,28
DeepSeek-V4-ProNur Preview1,6T / 49B$0,435 / $0,003625$0,87
Kimi K3Open Weights (27.07.)2,8T / ~104B (Community-Schätzung)$3,00 / $0,30$15,00
GLM-5.2Open Source (Juni 2026)~744B / ~40BNicht unabhängig verifiziert
Qwen3.8-MaxAPI GA (02.08.), Gewichte ausstehend2,4T / 95B$2,00 / ~$0,17–0,25$6,00

Der unabhängige Artificial Analysis Intelligence Index und die durchschnittlichen Kosten pro Task (über Finanzmedien zitiert) ergänzen die Herstellerperspektive:

Artificial Analysis Index vs. Kosten pro Task (andere Methodik als Hersteller-Agent-Benchmarks)
Modell Intelligence Index Ø Kosten pro Task
DeepSeek-V4-Flash-073150$0,03
Kimi K357$0,86
GPT-5.6 Sol~9 Punkte über Flash$1,86
Claude Fable 5~9 Punkte über Flash$3,15

V4-Flash führt den Index nicht an, kostet pro Task aber etwa 1/29 von Kimi K3 und 1/105 von Claude Fable 5 — DeepSeek optimiert auf „ausreichende Intelligenz zum niedrigsten Preis“, nicht auf Benchmark-Spitzenplätze.

03 Post-Training, CSA+HCA und Harness: wie aus derselben Architektur mehr Benchmark wird

Architektur unverändert — Post-Training liefert die Differenz. DeepSeek bestätigt: V4-Flash-0731 hat dieselbe Parameterzahl und Struktur wie die April-Preview. Der Technical Report „DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence“ beschreibt drei Kernbausteine (seit Preview):

  • Hybrid Attention (CSA + HCA): als DSA Sparse Attention vermarktet; senkt Compute und Speicher bei langem Kontext.
  • Manifold-Constrained Hyper-Connections (mHC): verbesserte Residual-Pfade.
  • Muon-Optimierer: schnellere Konvergenz und stabilere Trainingsdynamik.

Herstellerangaben (noch ohne unabhängige Reproduktion): Bei 1M Token benötigt V4-Pro nur 27 % der per-Token-FLOPs von V3.2 und 10 % des KV-Cache-Footprints.

Harness-Debüt. Der Changelog vom 31. Juli benennt erstmals DeepSeek Harness — ein internes Agent-Framework als Gegenstück zu Claude Code für Dateizugriff, Tool-Calls und End-to-End-Engineering. Alle veröffentlichten Agent-Benchmarks (Terminal Bench 2.0, Toolathlon u. a.) liefen im Harness Minimal Mode mit max-Effort, top_p=0,95, temperature=1,0. Der Changelog warnt ausdrücklich: „Benchmarks sind extrem sensitiv gegenüber der Harness-Wahl“ — das sollte in jeder Kaufentscheidung mitgerechnet werden.

Laut 21st Century Business Herald berichten Entwickler von niedrigen Input-Cache-Hit-Raten und gelegentlichen Timeouts des Safety-Classifiers — ein Gegengewicht zur „Benchmark-Explosion“-Narrative.

04 Kimi K3, GLM-5.2, Qwen3.8-Max und sechs Schritte zur V4-Flash-0731-Migration

V4-Flash-0731 landet im dichtesten Open-Weight-Fenster des Jahres. Für Agent- und Batch-Workloads lautet die Frage nicht mehr „wer hat den höchsten Score“, sondern „wer hält die Rechnung unter einer akzeptablen Intelligenzuntergrenze“.

Sechs Schritte zur Migration auf V4-Flash-0731:

  1. Legacy-Modellnamen prüfen: Seit 24. Juli sind deepseek-chat und deepseek-reasoner abgeschaltet — Routing auf deepseek-v4-flash oder deepseek-v4-pro (Preview).
  2. API-Oberfläche bestätigen: Build 0731 ist nur API; App und Web können hinterherhinken — Produktion folgt dem API-Changelog.
  3. SDK-Kompatibilität nutzen: OpenAI ChatCompletions und Anthropic-Format bleiben unverändert; deepseek-v4-flash zeigt automatisch auf den neuen offiziellen Build.
  4. Benchmark-Klassen trennen: SWE-bench Verified und ähnliche Drittanbieter-Suites sind belastbarer als Terminal Bench 2.0 mit nicht öffentlichem Harness — nicht 1:1 auf Claude Code oder Cursor übertragen.
  5. A/B auf eigenen Repos: Flash, Kimi K3 und Qwen3.8-Max in realen Agent-Workflows gegenüberstellen — Erfolgsrate und Token-Kosten, nicht nur Herstellerfolien.
  6. V4-Pro und Harness GA verfolgen: Offiziell nur „so bald wie möglich“; jedes August-10–20-Fenster ist Gerücht bis Changelog-Bestätigung.

Offizielle Dokumentation und Changelog:

https://api-docs.deepseek.com/

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash

05 Benchmark-Kontroversen, Kill-Line und Agent-Infrastruktur-Entscheidung

  • Terminal Bench 2.0 (Hersteller): V4-Flash-0731 82,7 vs. V4-Pro-Preview 67,9 — gemessen mit nicht öffentlichem Harness Minimal Mode; als framework-spezifisch einstufen.
  • Preisfaktoren vs. Claude Opus 4.8 (21st Century Business Herald): Cache-Miss-Input ca. 36x günstiger, Cache-Hit-Input ca. 179x, Output ca. 89x — Herstellerlistenpreise, keine Prüfung.
  • „Kill-Line“ (斩杀线): chinesischer Entwickler-Jargon für die Kombination aus „ausreichender Leistung + extrem niedrigem Preis“, die Wettbewerber ohne klaren Qualitäts- oder Kostenvorteil aus Routing-Tabellen verdrängt.

FAQ

  • Größter Unterschied V4 vs. V3.2? Native 1M-Token-Kontext, deutlich reduzierte FLOPs und KV-Cache bei langem Kontext; Agent-Fähigkeiten für Claude Code, OpenCode u. a. optimiert.
  • Flash oder Pro im Alltag? Bulk- und Agent-Pipelines: Flash-0731; tiefere Reasoning-Anforderungen vorübergehend Pro-Preview — nach offiziellem Pro neu bewerten.
  • Ist offizielles V4-Pro verfügbar? Stand 5. August nein; nur Flash-0731 offiziell, API-only.
  • Benchmarks vertrauenswürdig? Breit adoptierte Drittanbieter-Suites ja; Harness-abhängige Agent-Scores erst nach unabhängiger Reproduktion mit Claude Code oder Cursor.

Wer Agent-Workflows vollständig über Cloud-APIs fährt, trägt Latenz-, Abrechnungs- und Routing-Risiken. Reine lokale Hugging-Face-Deployments stoßen an Unified-Memory-Grenzen, 24/7-Stabilität und Multi-Node-Skalierung. Für Teams mit vollem macOS-Stack (Claude Code, OpenCode, OpenClaw, Xcode CI/CD) und dauerhaft online Agent-Knoten ist CALMVPS Bare-Metal Mac Mini M4 Miete die produktionsreifere Option: dediziertes Apple Silicon, sechs Regionen, 120-Sekunden-Bereitstellung. Modelle und Live-Preise: CALMVPS Mietpreise.

DSGVO und Cloud-Daten: Die DeepSeek-Cloud-API verarbeitet Prompts, Code und Agent-Logs in chinesischen Rechenzentren — für EU-Teams mit personenbezogenen Daten in Prompts eine Drittlandübermittlung nach Art. 44 ff. DSGVO. AV-Vertrag, Standardvertragsklauseln und Datenminimierung prüfen. Mit MIT-Gewichten und Self-Hosting auf eigener Infrastruktur bleiben Inferenzdaten unter Kontrolle — relevant neben Token-Kosten. Reine API-Nutzung ohne PII reduziert Risiko, ersetzt keine Rechtsberatung.

Vor dem Rollout aktuelle Preise, Benchmarks und V4-Pro-/Harness-Status verifizieren — Datenstand 5. August 2026.