Am 30. Juni 2026 hielt Huawei das HDC-2026-Versprechen ein: openPangu-2.0-Flash Gewichte, Inferenzcode und Trainingsoperatoren sind auf GitCode live. Es ist das erste Frontier-LLM in dieser Größenordnung, das nach vollständigem Training auf Nicht-NVIDIA-Hardware offen veröffentlicht wurde — und eines der wenigen mit geplanter Freigabe der gesamten Trainingspipeline.
Dieser Artikel richtet sich an Entwickler und Tech-Entscheider, die souveräne KI, 512K-Kontext-Workloads oder Ascend-/Huawei-Cloud-Deployments prüfen. Enthalten sind Zeitlinie, Pro-/Flash-Parameter, Architektur mit mHC / Muon / ModAttn / DSA+SWA, Ascend-910B-Training, Vergleichsmatrix gegen DeepSeek, Qwen und Kimi, ModelArts API und GitCode-Self-Hosting in sechs umsetzbaren Schritten, geopolitischer Kontext, HarmonyOS-Agent-Integration und die Open-Source-Roadmap. Nach dem Lesen wissen Sie, warum das Release zählt, wann Sie es wählen und wie Sie es heute betreiben.
01 Drei Missverständnisse vor der openPangu-2.0-Bewertung
- Als „nur ein weiteres Weight-Drop“ abtun: Die meisten Modelle liefern Gewichte plus Inferenzcode. openPangu 2.0 plant die Freigabe von Pre-Training-Code, Post-Training-Code und Ascend-Trainingsoperatoren — bei 505B extrem selten.
- Souveräne KI nur über SWE-bench bewerten: DeepSeek V4 Pro (~200B aktive Parameter) führt derzeit bei Coding und tiefem Reasoning. openPangu punktet bei 512K Kontext, Ascend-nativer Durchsatz und null NVIDIA-Abhängigkeit.
- Hardware-Affinität ignorieren: Das Training lief vollständig auf Ascend-910B-NPUs. Benchmarks auf NVIDIA ohne CANN +
torch_npu-Optimierung verzerren Ergebnisse.
| Datum | Ereignis |
|---|---|
| 2026-06-12 | HDC 2026 — Richard-Yu-Keynote startet openPangu 2.0 offiziell |
| 2026-06-30 | Flash-Gewichte, Inferenzcode und Trainingsoperatoren auf GitCode |
| Juli 2026 (geplant) | Pro-Gewichte und Inferenzcode |
| H2 2026 (geplant) | Pre-/Post-Training-Code (SFT/RLHF), weitere Operatoren |
Unter US-Exportkontrollen für Advanced-AI-Chips zeigt openPangu 2.0: Frontier-Training ist ohne A100/H100 möglich — ein direkter Gegenentwurf zur These „ohne NVIDIA kein Frontier-Modell“.
Für EU-Unternehmen gilt zusätzlich: Prompts, Code und Logs aus Agent-Läufen können personenbezogene oder geschäftskritische Daten enthalten. Cloud-Inferenz über Huawei ModelArts oder andere Anbieter ohne Auftragsverarbeitungsvertrag, Datenresidenz-Konzept und Löschfristen kann DSGVO-Anforderungen verletzen — unabhängig vom gewählten Modell.
02 openPangu 2.0 Pro vs Flash: 512K Kontext und sieben Open-Source-Komponenten
| Dimension | Pro | Flash |
|---|---|---|
| Gesamtparameter | 505B | 92B |
| Aktive Parameter | 18B | 6B |
| Sparsitätsverhältnis | ~28:1 | ~15:1 (DSA+SWA ultra-sparse Attention) |
| Kontextfenster | 512K | 512K |
| Verfügbarkeit | Juli 2026 (geplant) | Live seit 30. Juni |
Beide Varianten unterstützen 512K Token — etwa acht Vollromane, eine große Codebasis oder komplette Vertragswerke in einem Prompt.
Sieben geplante Open-Source-Komponenten: Modellarchitektur (veröffentlicht), Gewichte (Flash live, Pro im Juli), technischer Report (veröffentlicht), Inferenzcode + Trainingsoperatoren (veröffentlicht), Pre-Training-Code (H2 2026), Post-Training-Code mit SFT/RLHF (H2 2026), Ascend-Custom-Trainingsoperatoren (H2 2026).
Lizenziert unter der permissiven openPangu License: kommerzielle Nutzung erlaubt, lizenzfrei, nicht-exklusiv. Exakte Bedingungen siehe GitCode LICENSE.
03 Technische Architektur: mHC-Routing, Muon-Optimizer und Ascend-Stack
- mHC (Multi-Head Combinatorial) Routing: Verbessertes Expert-Routing mit reduzierter Last-Ungleichheit.
- Muon-Optimizer: Second-Order-Momentum-Optimizer (Microsoft-Forschung), für große Skalen stabilisiert.
- ModAttn (Modular Attention): Ermöglicht 512K Kontext effizient.
- DSA+SWA ultra-sparse Attention (nur Flash): Extreme Sparsität — 6B aktiv von 92B Gesamt pro Token.
Ascend-Trainingsergebnisse (kein NVIDIA-Silizium in der Pipeline):
- 2× Single-Card-Durchsatz vs. Mainstream-Open-Modelle auf Ascend
- +30 % Hypernode-Trainingseffizienz
- +50 % 512K-Langsequenz-Training-Durchsatz
- >99 % Train/Infer-Distributions-Konsistenz (bekanntes MoE-Problem)
- Flash-Int8 Quantisierung: ~40 % weniger Speicher, <10 % Qualitätsverlust (W4A8)
Developer-Stack: CANN (CUDA-äquivalente Huawei-Runtime) + torch_npu. Standard-PyTorch wechselt Backends mit import torch_npu. Deployment-Pfade: Huawei Cloud ModelArts API, GitCode Self-Host, HarmonyOS nativ am Edge.
Edge-Variante: 30B On-Device-Modell — ~50 % schnellere Inferenz, ~20 % weniger Speicher, offline auf Kirin-Mobilchips.
Repository-Hub (nach jedem Release prüfen):
04 openPangu 2.0 vs DeepSeek, Qwen und Kimi: wo welches Modell gewinnt
Unabhängige Dritt-Benchmarks liegen noch nicht vor (Release 30. Juni). Die Matrix unten basiert auf Architektur; Scores werden aktualisiert, sobald öffentliche Leaderboards Ergebnisse veröffentlichen.
| Modell | Gesamt | Aktiv | Kontext | Training-HW | Open-Tiefe |
|---|---|---|---|---|---|
| openPangu 2.0 Pro | 505B | 18B | 512K | Ascend NPU | Volle Pipeline (7 Teile) |
| openPangu 2.0 Flash | 92B | 6B | 512K | Ascend NPU | Volle Pipeline (7 Teile) |
| DeepSeek V4 Pro | 1,6T | ~200B | 128K | NVIDIA | Gewichte + Inferenz |
| Qwen 3.7 Max | ~400B+ | variiert | 128K | NVIDIA | Gewichte + partielles Training |
| Kimi K2.7 | 1T | 32B | 256K | NVIDIA | Gewichte + Inferenz |
- Coding / tiefes Reasoning: DeepSeek V4 Pro führt heute.
- Agent / MCP-Tooling: Kimi-K2.7-Ökosystem ist reifer.
- Dokumente über 256K Token: openPangu 2.0 Pro (512K) ist die klare Wahl.
- Souveränität / keine US-Tech-Abhängigkeit: openPangu 2.0 ist die einzige Frontier-Option.
- Ascend / Huawei Cloud: openPangu liefert nativ 2× Durchsatz.
- Lokale Inferenz bei begrenztem VRAM: Flash (6B aktiv, ~96GB Unified Memory).
05 openPangu 2.0 betreiben: Sechs-Schritte-Guide für ModelArts und GitCode
Option 1 — Huawei Cloud ModelArts (schnellster Weg, keine Hardware)
- Huawei-Cloud-Konto registrieren und Verifizierung abschließen.
- ModelArts → AI Gallery öffnen und nach openPangu 2.0 suchen.
- Flash oder Pro abonnieren und API-Endpoint plus Auth-Token erhalten.
- Chat-Completions-Request bauen mit model, messages und max_tokens.
- Testaufruf senden per curl oder SDK zur Latenzvalidierung.
- In Produktions-Routing einbinden mit Retries, Rate Limits und Logging für Agent-/RAG-Workloads — dabei DSGVO-konforme Verarbeitung und Datenresidenz prüfen.
curl -X POST "https://modelarts.${REGION}.myhuaweicloud.com/v1/infers/openpangu-2-flash/chat/completions" \
-H "Content-Type: application/json" \
-H "X-Auth-Token: ${TOKEN}" \
-d '{
"model": "openpangu-2.0-flash",
"messages": [{"role": "user", "content": "Erkläre MoE-Architektur in einfachen Worten"}],
"max_tokens": 1024
}'
Option 2 — Self-Hosted via GitCode
Repos: openPangu-2.0-Flash, openPangu-2.0-Flash-Int8, openPangu-2.0-Infer, openPangu-2.0-Op.
python inference.py \
--model_path ./openPangu-Flash \
--device npu:0 \
--context_length 512000 \
--precision bf16
| Variante | Empfohlen | Minimum |
|---|---|---|
| Flash (6B aktiv) | Einzelner Ascend 910B | ~96GB Unified Memory |
| Flash-Int8 | Einzelner Ascend Atlas A2 | ~48GB VRAM |
| Pro (18B aktiv) | 4+ Ascend-910B-Cluster | Multi-Card-Cluster |
Huawei Cloud ModelArts:
https://www.huaweicloud.com/product/modelarts.html
HDC 2026 offizielle Ankündigung:
06 Strategische Bedeutung, Roadmap und zitierfähige Technikdaten
Volle Pipeline als Open Source ermöglicht akademische Reproduktion, unternehmensspezifisches Domain-Pre-Training und senkt die Einstiegshürde für Ascend — und erweitert Chinas domestic-AI-Hardware-Ökosystem.
HarmonyOS-Agent-Fundament: HarmonyOS 7 tritt in die Agent-Ära ein; openPangu 2.0 ist die native KI-Engine. HarmonyOS Agent Framework 2.0 meldet >90 % Erfolg bei komplexen Tasks; das 30B-On-Device-Modell läuft lokal ohne Netzwerk.
Roadmap: 30. Juni Flash-Release (erledigt) → Juli Pro-Gewichte → H2 2026 Pre-/Post-Training-Code und weitere Operatoren.
- Parameter: Pro 505B/18B aktiv; Flash 92B/6B aktiv
- Kontext: 512K Token bei beiden Varianten
- Ascend-Durchsatz: ~2× Mainstream-Open-Modelle auf Ascend-Hardware
- Train/Infer-Konsistenz: >99 %
- Flash-Int8: ~40 % Speicherreduktion, <10 % Qualitätsverlust
- Edge 30B: ~50 % schnellere Inferenz, ~20 % weniger Speicher
Hinweis: Einige Fähigkeitsbewertungen basieren auf Architektur-Inferenz. Unabhängige Benchmarks werden ergänzt, sobald veröffentlicht. Veröffentlicht: 1. Juli 2026.
Wenn Ihr Stack openPangu-API-Aufrufe für Langdokumente mit iOS-CI/CD, lokalen Agent-Frameworks oder Mac-Automation kombiniert, ist die API-Schicht nur die Hälfte. Laptops und VMs leiden unter Metal-Scheduling-Instabilität, thermischem Throttling und schlechter 7×24-Verfügbarkeit. Für produktive iOS-Builds und KI-Agent-Automation ist CALMVPS Bare-Metal-Mac-Mini-Miete meist die bessere Wahl: dediziertes Apple Silicon, Multi-Region-Nodes, monatliche Elastizität, ~120 Sekunden Bereitstellung. Preise: Mietpreise, Betrieb: Hilfezentrum, Bestellung: Mac mini M4 bestellen.