Am 3. August 2026 hat Alibaba das Flaggschiff Qwen3.8-Max allgemein verfügbar gemacht und das Agent-Produkt „Qwen Office“ gestartet — 2,4 Billionen Gesamtparameter, 95 Milliarden aktiv pro Token, 1M-Token-Kontext, Arena Text Platz 5 (einziges Nicht-Anthropic-Modell in den Top 8).
Dieser Artikel richtet sich an Entwickler und technische Entscheider, die API-Routing, Open-Weight-Zeitpläne und Agent-Toolchain-Migration bewerten. Enthalten: Timeline 16. Juli–3. August, Spezifikations- und Benchmark-Tabelle, MoE-Architekturlogik, Vergleich mit Kimi K3 / DeepSeek V4 / Claude, Open-Source-Label-Kontroverse sowie sechs Rollout-Schritte und FAQ. Nach dem Lesen wissen Sie: nutzbar heute, Gewichte offen, Stärke vs. Kimi K3.
01 Zwei-Wochen-Timeline: Kimi K3, Qwen-Preview, DeepSeek Flash, Alibaba GA
Ende Juli 2026 lieferten chinesische Frontier-Labs in rasantem Tempo:
- 16. Juli: Moonshot AI veröffentlicht Kimi K3 (2,8T MoE, 896 Experten / 16 aktiv) — Fokus auf unabhängige Benchmarks und technischen Report.
- 19. Juli: Alibaba Qwen3.8-Max-Preview über Token Plan, Qoder, QoderWork zu 10 % des späteren Standardpreises — ohne Aktivparameter, ohne Benchmark-Tabelle, ToS verbietet automatisierte Produktionsnutzung.
- 27. Juli: Kimi K3 legt Open Weights planmäßig auf Hugging Face frei, inkl. Teilen der Serving-Infrastruktur.
- 31. Juli: DeepSeek V4-Flash schlägt die eigene V4-Pro-Preview auf neun Agent-/Code-Benchmarks — ohne Parameterzuwachs.
- 3. August: Qwen3.8-Max GA mit vollständiger Benchmark-Tabelle und „Qwen Office“. Alibaba HK-Aktie +7 %, US-Listing +4,5 %.
- „Nächste Woche“ (ca. 10. August erwartet): Open Weights für Qwen3.8-Max und Qwen3.8-27B auf Hugging Face und ModelScope versprochen — kein Repository, keine Lizenz, kein festes Datum zum Redaktionsschluss.
Die „alles skalieren“-Erzählung weicht einem Architektur-Effizienz-Wettlauf — DeepSeek V4-Flash verbesserte ohne mehr Parameter; Qwen3.8-Max setzt auf „groß gesamt, klein aktiv“.
02 Qwen3.8-Max Kerndaten und Benchmarks (August 2026)
Daten aus Alibabas Launch-Materialien. Zeilen „Alibaba-intern“ sind zum Redaktionsschluss nicht unabhängig reproduziert. Vor Produktionsmigration offizielle Quellen prüfen.
| Merkmal | Wert |
|---|---|
| GA-Datum | 3. August 2026 |
| Gesamt- / Aktivparameter | 2,4T / 95B |
| Architektur | Sparse MoE + Hybrid-Attention auf Qwen3.5-Basis |
| Kontextfenster | 1M Token (≈983K mit Thinking; max. 131K Output) |
| Eingabemodalitäten | Text, Bild, Video |
| API-Preis (international) | $2 / $6 pro Mio. Input/Output-Token |
| Arena Text Arena (Snapshot 1. Aug.) | Platz 5, 1.496 Punkte (Preliminary) — einziges Nicht-Anthropic in Top 8 |
| Arena Vision Arena | Platz 2, hinter Claude Fable 5 |
| PaperBench (Alibaba-intern) | 93,0 (+28,2 vs. Vorgänger) |
| SWE-bench Pro (Alibaba-intern) | 67,7 — hinter Fable 5 mit 80,0 |
| Open Weights | „Nächste Woche“ versprochen; zum Redaktionsschluss nicht live |
03 Architekturlogik und vier Transparenz-Probleme
Warum Sparse MoE statt dichte Skalierung? Qwen3.8-Max erreicht 2,4T Gesamtparameter bei nur 95B Aktivierung pro Token. Inferenzkosten folgen der Aktivzahl, nicht der Gesamtzahl — daher API-Preis $2/$6 pro Mio. Token, deutlich unter Claude Opus 5 ($5/$25) und Fable 5 ($10/$50).
reasoning_effort als Kostenhebel: Drei Stufen — low, medium, xhigh (Standard) — steuern Latenz vs. Tiefe. Native API über enable_thinking, Anthropic-kompatibel über reasoning.effort.
Langfrist-Autonomie als Kernargument: Showcase-Fälle: 16-tägiges Coding ohne menschlichen Eingriff, 500+ Schritte Chip-Design-Optimierung, RecreationBench (App-Rekonstruktion nur aus Black-Box-Interaktion). Benchmarks sind Alibaba-intern; partielle Traces auf GitHub (qwen-code-dev-bot/oh-my-cli), aber nicht unabhängig auditiert.
Distribution: Qwen3.8-Max in „Qwen Office“, OpenAI- und Anthropic-kompatible API — Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw per Base-URL-Wechsel.
Vier Transparenz-Probleme:
- „Open-Source“-Label vor Gewichten: qwen.ai markierte GA-Tag als Open Source — kein Hugging-Face- oder ModelScope-Repository, keine Lizenz, kein Ship-Datum.
- Benchmarks nur Hersteller-intern: PaperBench, QwenSWEBench, RecreationBench — keine neutrale Plattform hat GA-Zahlen reproduziert.
- Preview-Transparenzlücken: Preview vom 19. Juli ohne Aktivparameter, Model Card, Safety-Eval — unabhängige Evaluatoren rieten von Produktionsmigration ab.
- Verzögerte Aktivparameter-Offenlegung: Kimi K3 ~50B, DeepSeek V4-Pro 49B — Alibaba erst bei GA „95B“, in der Preview nichts.
Im einzigen vergleichbaren unabhängigen Test (blind, Software-Architektur, 269 Dateien): Kimi K3 83/100, Qwen3.8-Max 80/100 — Gleichstand, kein klarer Sieger.
04 Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude
| Modell | Gesamt / aktiv | Preis (In/Out pro 1M Token) | Open Weights? | Unabhängiger Benchmark |
|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 95B | $2 / $6 | Versprochen, nicht geliefert | Noch keine |
| Kimi K3 | 2,8T / ~50B | $3 / $15 | 27. Juli geliefert | AA Intelligence Index ≈ 57,11 |
| DeepSeek V4-Flash | Wie V4-Pro | Nicht vollständig publiziert | Geliefert | 9 Agent/Code-Benchmarks > V4-Pro |
| Claude Opus 5 | Nicht offengelegt | $5 / $25 | Geschlossen | Arena-Spitze |
| Claude Fable 5 | Nicht offengelegt | $10 / $50 | Geschlossen | #1 Arena Text Arena |
Sechs Schritte zum Rollout (passt Qwen3.8-Max zu Ihrem Stack?):
- Zugangsweg wählen: QwenCloud-API (OpenAI- oder Anthropic-kompatibel) für Hosted Inference; für On-Prem Qwen3.8-27B abwarten oder Kimi K3 Open Weights evaluieren.
- Open-Weight-Status prüfen: Stand 4. August keine Gewichte veröffentlicht. qwen.ai-„Open-Source“-Label ≠ herunterladbares Artefakt bis Repository existiert.
- reasoning_effort konfigurieren: low / medium / xhigh an Task-Komplexität koppeln — low für einfache Calls, xhigh für tiefe Agent-Workflows.
- Agent-Toolchain anbinden: Base URL und API Key in Claude Code, Qoder CLI oder OpenClaw über Anthropic-kompatiblen Endpoint tauschen.
- Workload-A/B-Tests: Nicht allein auf Hersteller-Benchmarks migrieren. Qwen3.8-Max vs. Kimi K3 vs. DeepSeek V4 auf echten Codebases und Agent-Flows vergleichen.
- Unabhängige Reproduktion abwarten: Artificial Analysis und Arena.ai für GA-Drittanbieter-Scores tracken, bevor Qwen3.8-Max Standard-Produktionsroute wird.
05 Zitierbare Kennzahlen, FAQ, DSGVO und Agent-Infra
- Gesamt vs. aktiv: 2,4T gesamt, 95B pro Token aktiv — Inferenzkosten wie ~100B-dichtes Modell, nicht voller 2,4T-Call.
- API-Preiswettbewerb: $2/$6 pro Mio. Token unter Claude Opus 5 ($5/$25) und Fable 5 ($10/$50); impliziter Cache ab $0,25/Mio. Token.
- Consumer-Reichweite: Apple Intelligence in China läuft auf Qwen — komprimiertes ~27B-Checkpoint unter 4 GB on-device auf iPhone 15+, Qwen-Reichweite über API-Benchmarks hinaus.
FAQ
- Ist Qwen3.8-Max jetzt Open Source? Nein. API live über Alibaba Cloud Model Studio; Gewichte nicht publiziert. „Open-Source“ auf qwen.ai beschreibt derzeit Absicht, kein Artefakt.
- Vergleich Kimi K3? Kein autoritativer Head-to-Head. Einziger unabhängiger Test: Kimi K3 83/100 vs. Qwen 80/100. K3-Vorteil: öffentliche Gewichte + AA-Score; Qwen-Vorteil: günstigere API, breiteres Multimodal.
- Brauche ich ein Rechenzentrum für 2,4T? Für vollen Checkpoint ja. API umgeht das. On-Prem: Qwen3.8-27B abwarten.
- Alibaba-Benchmarks vertrauenswürdig? Als Herstellerangaben behandeln. Drittanbieter-Reproduktion oder eigene Workloads vor Migration.
DSGVO: QwenCloud-API verarbeitet Prompts in chinesischen Rechenzentren — Drittlandübermittlung nach Art. 44 ff. DSGVO für EU-Teams mit personenbezogenen Daten in Prompts. Self-Hosting nach Open-Weight-Release in EU reduziert Cloud-Exposition; Auftragsverarbeitung, Standardvertragsklauseln und Datenschutz-Folgenabschätzung prüfen.
Reine Cloud-API-Abhängigkeit für Agent-Workflows bedeutet Latenz, unvorhersehbare Token-Rechnungen und Migrationskosten bei Routing-Wechsel. Lokales Ollama stößt an Unified-Memory-Grenzen, 24/7-Stabilität und Multi-Region-Skalierung. Für Teams mit vollem macOS-Stack (Claude Code, Qoder CLI, OpenClaw, Xcode CI/CD) und dauerhaft online Agent-Nodes ist CALMVPS Bare-Metal Mac Mini M4 Miete meist die bessere Wahl: dediziertes Apple Silicon, sechs Regionen, ~120 s Provisioning. CALMVPS Preisseite.
Vor Migration aktuelle Qwen3.8-Max-Preise, Open-Weight-Status und Benchmarks gegen offizielle Quellen prüfen. Stand: Anfang August 2026.