Alibaba Qwen3.8-Max GA:
2,4T Parameter, Arena Platz 5 — Gewichte noch nicht offen

Am 3. August 2026 hat Alibaba das Flaggschiff Qwen3.8-Max allgemein verfügbar gemacht und das Agent-Produkt „Qwen Office“ gestartet — 2,4 Billionen Gesamtparameter, 95 Milliarden aktiv pro Token, 1M-Token-Kontext, Arena Text Platz 5 (einziges Nicht-Anthropic-Modell in den Top 8).

Dieser Artikel richtet sich an Entwickler und technische Entscheider, die API-Routing, Open-Weight-Zeitpläne und Agent-Toolchain-Migration bewerten. Enthalten: Timeline 16. Juli–3. August, Spezifikations- und Benchmark-Tabelle, MoE-Architekturlogik, Vergleich mit Kimi K3 / DeepSeek V4 / Claude, Open-Source-Label-Kontroverse sowie sechs Rollout-Schritte und FAQ. Nach dem Lesen wissen Sie: nutzbar heute, Gewichte offen, Stärke vs. Kimi K3.

01 Zwei-Wochen-Timeline: Kimi K3, Qwen-Preview, DeepSeek Flash, Alibaba GA

Ende Juli 2026 lieferten chinesische Frontier-Labs in rasantem Tempo:

  • 16. Juli: Moonshot AI veröffentlicht Kimi K3 (2,8T MoE, 896 Experten / 16 aktiv) — Fokus auf unabhängige Benchmarks und technischen Report.
  • 19. Juli: Alibaba Qwen3.8-Max-Preview über Token Plan, Qoder, QoderWork zu 10 % des späteren Standardpreises — ohne Aktivparameter, ohne Benchmark-Tabelle, ToS verbietet automatisierte Produktionsnutzung.
  • 27. Juli: Kimi K3 legt Open Weights planmäßig auf Hugging Face frei, inkl. Teilen der Serving-Infrastruktur.
  • 31. Juli: DeepSeek V4-Flash schlägt die eigene V4-Pro-Preview auf neun Agent-/Code-Benchmarks — ohne Parameterzuwachs.
  • 3. August: Qwen3.8-Max GA mit vollständiger Benchmark-Tabelle und „Qwen Office“. Alibaba HK-Aktie +7 %, US-Listing +4,5 %.
  • „Nächste Woche“ (ca. 10. August erwartet): Open Weights für Qwen3.8-Max und Qwen3.8-27B auf Hugging Face und ModelScope versprochen — kein Repository, keine Lizenz, kein festes Datum zum Redaktionsschluss.

Die „alles skalieren“-Erzählung weicht einem Architektur-Effizienz-Wettlauf — DeepSeek V4-Flash verbesserte ohne mehr Parameter; Qwen3.8-Max setzt auf „groß gesamt, klein aktiv“.

02 Qwen3.8-Max Kerndaten und Benchmarks (August 2026)

Daten aus Alibabas Launch-Materialien. Zeilen „Alibaba-intern“ sind zum Redaktionsschluss nicht unabhängig reproduziert. Vor Produktionsmigration offizielle Quellen prüfen.

Qwen3.8-Max Kernspezifikationen (GA, 3. August 2026)
Merkmal Wert
GA-Datum3. August 2026
Gesamt- / Aktivparameter2,4T / 95B
ArchitekturSparse MoE + Hybrid-Attention auf Qwen3.5-Basis
Kontextfenster1M Token (≈983K mit Thinking; max. 131K Output)
EingabemodalitätenText, Bild, Video
API-Preis (international)$2 / $6 pro Mio. Input/Output-Token
Arena Text Arena (Snapshot 1. Aug.)Platz 5, 1.496 Punkte (Preliminary) — einziges Nicht-Anthropic in Top 8
Arena Vision ArenaPlatz 2, hinter Claude Fable 5
PaperBench (Alibaba-intern)93,0 (+28,2 vs. Vorgänger)
SWE-bench Pro (Alibaba-intern)67,7 — hinter Fable 5 mit 80,0
Open Weights„Nächste Woche“ versprochen; zum Redaktionsschluss nicht live

03 Architekturlogik und vier Transparenz-Probleme

Warum Sparse MoE statt dichte Skalierung? Qwen3.8-Max erreicht 2,4T Gesamtparameter bei nur 95B Aktivierung pro Token. Inferenzkosten folgen der Aktivzahl, nicht der Gesamtzahl — daher API-Preis $2/$6 pro Mio. Token, deutlich unter Claude Opus 5 ($5/$25) und Fable 5 ($10/$50).

reasoning_effort als Kostenhebel: Drei Stufen — low, medium, xhigh (Standard) — steuern Latenz vs. Tiefe. Native API über enable_thinking, Anthropic-kompatibel über reasoning.effort.

Langfrist-Autonomie als Kernargument: Showcase-Fälle: 16-tägiges Coding ohne menschlichen Eingriff, 500+ Schritte Chip-Design-Optimierung, RecreationBench (App-Rekonstruktion nur aus Black-Box-Interaktion). Benchmarks sind Alibaba-intern; partielle Traces auf GitHub (qwen-code-dev-bot/oh-my-cli), aber nicht unabhängig auditiert.

Distribution: Qwen3.8-Max in „Qwen Office“, OpenAI- und Anthropic-kompatible API — Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw per Base-URL-Wechsel.

Vier Transparenz-Probleme:

  • „Open-Source“-Label vor Gewichten: qwen.ai markierte GA-Tag als Open Source — kein Hugging-Face- oder ModelScope-Repository, keine Lizenz, kein Ship-Datum.
  • Benchmarks nur Hersteller-intern: PaperBench, QwenSWEBench, RecreationBench — keine neutrale Plattform hat GA-Zahlen reproduziert.
  • Preview-Transparenzlücken: Preview vom 19. Juli ohne Aktivparameter, Model Card, Safety-Eval — unabhängige Evaluatoren rieten von Produktionsmigration ab.
  • Verzögerte Aktivparameter-Offenlegung: Kimi K3 ~50B, DeepSeek V4-Pro 49B — Alibaba erst bei GA „95B“, in der Preview nichts.

Im einzigen vergleichbaren unabhängigen Test (blind, Software-Architektur, 269 Dateien): Kimi K3 83/100, Qwen3.8-Max 80/100 — Gleichstand, kein klarer Sieger.

04 Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude

Frontier-Modellvergleich (August 2026)
Modell Gesamt / aktiv Preis (In/Out pro 1M Token) Open Weights? Unabhängiger Benchmark
Qwen3.8-Max2,4T / 95B$2 / $6Versprochen, nicht geliefertNoch keine
Kimi K32,8T / ~50B$3 / $1527. Juli geliefertAA Intelligence Index ≈ 57,11
DeepSeek V4-FlashWie V4-ProNicht vollständig publiziertGeliefert9 Agent/Code-Benchmarks > V4-Pro
Claude Opus 5Nicht offengelegt$5 / $25GeschlossenArena-Spitze
Claude Fable 5Nicht offengelegt$10 / $50Geschlossen#1 Arena Text Arena

Sechs Schritte zum Rollout (passt Qwen3.8-Max zu Ihrem Stack?):

  1. Zugangsweg wählen: QwenCloud-API (OpenAI- oder Anthropic-kompatibel) für Hosted Inference; für On-Prem Qwen3.8-27B abwarten oder Kimi K3 Open Weights evaluieren.
  2. Open-Weight-Status prüfen: Stand 4. August keine Gewichte veröffentlicht. qwen.ai-„Open-Source“-Label ≠ herunterladbares Artefakt bis Repository existiert.
  3. reasoning_effort konfigurieren: low / medium / xhigh an Task-Komplexität koppeln — low für einfache Calls, xhigh für tiefe Agent-Workflows.
  4. Agent-Toolchain anbinden: Base URL und API Key in Claude Code, Qoder CLI oder OpenClaw über Anthropic-kompatiblen Endpoint tauschen.
  5. Workload-A/B-Tests: Nicht allein auf Hersteller-Benchmarks migrieren. Qwen3.8-Max vs. Kimi K3 vs. DeepSeek V4 auf echten Codebases und Agent-Flows vergleichen.
  6. Unabhängige Reproduktion abwarten: Artificial Analysis und Arena.ai für GA-Drittanbieter-Scores tracken, bevor Qwen3.8-Max Standard-Produktionsroute wird.

05 Zitierbare Kennzahlen, FAQ, DSGVO und Agent-Infra

  • Gesamt vs. aktiv: 2,4T gesamt, 95B pro Token aktiv — Inferenzkosten wie ~100B-dichtes Modell, nicht voller 2,4T-Call.
  • API-Preiswettbewerb: $2/$6 pro Mio. Token unter Claude Opus 5 ($5/$25) und Fable 5 ($10/$50); impliziter Cache ab $0,25/Mio. Token.
  • Consumer-Reichweite: Apple Intelligence in China läuft auf Qwen — komprimiertes ~27B-Checkpoint unter 4 GB on-device auf iPhone 15+, Qwen-Reichweite über API-Benchmarks hinaus.

FAQ

  • Ist Qwen3.8-Max jetzt Open Source? Nein. API live über Alibaba Cloud Model Studio; Gewichte nicht publiziert. „Open-Source“ auf qwen.ai beschreibt derzeit Absicht, kein Artefakt.
  • Vergleich Kimi K3? Kein autoritativer Head-to-Head. Einziger unabhängiger Test: Kimi K3 83/100 vs. Qwen 80/100. K3-Vorteil: öffentliche Gewichte + AA-Score; Qwen-Vorteil: günstigere API, breiteres Multimodal.
  • Brauche ich ein Rechenzentrum für 2,4T? Für vollen Checkpoint ja. API umgeht das. On-Prem: Qwen3.8-27B abwarten.
  • Alibaba-Benchmarks vertrauenswürdig? Als Herstellerangaben behandeln. Drittanbieter-Reproduktion oder eigene Workloads vor Migration.

DSGVO: QwenCloud-API verarbeitet Prompts in chinesischen Rechenzentren — Drittlandübermittlung nach Art. 44 ff. DSGVO für EU-Teams mit personenbezogenen Daten in Prompts. Self-Hosting nach Open-Weight-Release in EU reduziert Cloud-Exposition; Auftragsverarbeitung, Standardvertragsklauseln und Datenschutz-Folgenabschätzung prüfen.

Reine Cloud-API-Abhängigkeit für Agent-Workflows bedeutet Latenz, unvorhersehbare Token-Rechnungen und Migrationskosten bei Routing-Wechsel. Lokales Ollama stößt an Unified-Memory-Grenzen, 24/7-Stabilität und Multi-Region-Skalierung. Für Teams mit vollem macOS-Stack (Claude Code, Qoder CLI, OpenClaw, Xcode CI/CD) und dauerhaft online Agent-Nodes ist CALMVPS Bare-Metal Mac Mini M4 Miete meist die bessere Wahl: dediziertes Apple Silicon, sechs Regionen, ~120 s Provisioning. CALMVPS Preisseite.

Vor Migration aktuelle Qwen3.8-Max-Preise, Open-Weight-Status und Benchmarks gegen offizielle Quellen prüfen. Stand: Anfang August 2026.