Huawei openPangu 2.0 ist Open Source —
trainiert ohne eine einzige NVIDIA-GPU

Am 30. Juni 2026 hielt Huawei das HDC-2026-Versprechen ein: openPangu-2.0-Flash Gewichte, Inferenzcode und Trainingsoperatoren sind auf GitCode live. Es ist das erste Frontier-LLM in dieser Größenordnung, das nach vollständigem Training auf Nicht-NVIDIA-Hardware offen veröffentlicht wurde — und eines der wenigen mit geplanter Freigabe der gesamten Trainingspipeline.

Dieser Artikel richtet sich an Entwickler und Tech-Entscheider, die souveräne KI, 512K-Kontext-Workloads oder Ascend-/Huawei-Cloud-Deployments prüfen. Enthalten sind Zeitlinie, Pro-/Flash-Parameter, Architektur mit mHC / Muon / ModAttn / DSA+SWA, Ascend-910B-Training, Vergleichsmatrix gegen DeepSeek, Qwen und Kimi, ModelArts API und GitCode-Self-Hosting in sechs umsetzbaren Schritten, geopolitischer Kontext, HarmonyOS-Agent-Integration und die Open-Source-Roadmap. Nach dem Lesen wissen Sie, warum das Release zählt, wann Sie es wählen und wie Sie es heute betreiben.

01 Drei Missverständnisse vor der openPangu-2.0-Bewertung

  • Als „nur ein weiteres Weight-Drop“ abtun: Die meisten Modelle liefern Gewichte plus Inferenzcode. openPangu 2.0 plant die Freigabe von Pre-Training-Code, Post-Training-Code und Ascend-Trainingsoperatoren — bei 505B extrem selten.
  • Souveräne KI nur über SWE-bench bewerten: DeepSeek V4 Pro (~200B aktive Parameter) führt derzeit bei Coding und tiefem Reasoning. openPangu punktet bei 512K Kontext, Ascend-nativer Durchsatz und null NVIDIA-Abhängigkeit.
  • Hardware-Affinität ignorieren: Das Training lief vollständig auf Ascend-910B-NPUs. Benchmarks auf NVIDIA ohne CANN + torch_npu-Optimierung verzerren Ergebnisse.
openPangu 2.0 — zentrale Zeitlinie
Datum Ereignis
2026-06-12 HDC 2026 — Richard-Yu-Keynote startet openPangu 2.0 offiziell
2026-06-30 Flash-Gewichte, Inferenzcode und Trainingsoperatoren auf GitCode
Juli 2026 (geplant) Pro-Gewichte und Inferenzcode
H2 2026 (geplant) Pre-/Post-Training-Code (SFT/RLHF), weitere Operatoren

Unter US-Exportkontrollen für Advanced-AI-Chips zeigt openPangu 2.0: Frontier-Training ist ohne A100/H100 möglich — ein direkter Gegenentwurf zur These „ohne NVIDIA kein Frontier-Modell“.

Für EU-Unternehmen gilt zusätzlich: Prompts, Code und Logs aus Agent-Läufen können personenbezogene oder geschäftskritische Daten enthalten. Cloud-Inferenz über Huawei ModelArts oder andere Anbieter ohne Auftragsverarbeitungsvertrag, Datenresidenz-Konzept und Löschfristen kann DSGVO-Anforderungen verletzen — unabhängig vom gewählten Modell.

02 openPangu 2.0 Pro vs Flash: 512K Kontext und sieben Open-Source-Komponenten

Kernparameter: Pro vs Flash
Dimension Pro Flash
Gesamtparameter 505B 92B
Aktive Parameter 18B 6B
Sparsitätsverhältnis ~28:1 ~15:1 (DSA+SWA ultra-sparse Attention)
Kontextfenster 512K 512K
Verfügbarkeit Juli 2026 (geplant) Live seit 30. Juni

Beide Varianten unterstützen 512K Token — etwa acht Vollromane, eine große Codebasis oder komplette Vertragswerke in einem Prompt.

Sieben geplante Open-Source-Komponenten: Modellarchitektur (veröffentlicht), Gewichte (Flash live, Pro im Juli), technischer Report (veröffentlicht), Inferenzcode + Trainingsoperatoren (veröffentlicht), Pre-Training-Code (H2 2026), Post-Training-Code mit SFT/RLHF (H2 2026), Ascend-Custom-Trainingsoperatoren (H2 2026).

Lizenziert unter der permissiven openPangu License: kommerzielle Nutzung erlaubt, lizenzfrei, nicht-exklusiv. Exakte Bedingungen siehe GitCode LICENSE.

03 Technische Architektur: mHC-Routing, Muon-Optimizer und Ascend-Stack

  • mHC (Multi-Head Combinatorial) Routing: Verbessertes Expert-Routing mit reduzierter Last-Ungleichheit.
  • Muon-Optimizer: Second-Order-Momentum-Optimizer (Microsoft-Forschung), für große Skalen stabilisiert.
  • ModAttn (Modular Attention): Ermöglicht 512K Kontext effizient.
  • DSA+SWA ultra-sparse Attention (nur Flash): Extreme Sparsität — 6B aktiv von 92B Gesamt pro Token.

Ascend-Trainingsergebnisse (kein NVIDIA-Silizium in der Pipeline):

  • Single-Card-Durchsatz vs. Mainstream-Open-Modelle auf Ascend
  • +30 % Hypernode-Trainingseffizienz
  • +50 % 512K-Langsequenz-Training-Durchsatz
  • >99 % Train/Infer-Distributions-Konsistenz (bekanntes MoE-Problem)
  • Flash-Int8 Quantisierung: ~40 % weniger Speicher, <10 % Qualitätsverlust (W4A8)

Developer-Stack: CANN (CUDA-äquivalente Huawei-Runtime) + torch_npu. Standard-PyTorch wechselt Backends mit import torch_npu. Deployment-Pfade: Huawei Cloud ModelArts API, GitCode Self-Host, HarmonyOS nativ am Edge.

Edge-Variante: 30B On-Device-Modell — ~50 % schnellere Inferenz, ~20 % weniger Speicher, offline auf Kirin-Mobilchips.

Repository-Hub (nach jedem Release prüfen):

https://gitcode.com/org/ascend-tribe/repos

04 openPangu 2.0 vs DeepSeek, Qwen und Kimi: wo welches Modell gewinnt

Unabhängige Dritt-Benchmarks liegen noch nicht vor (Release 30. Juni). Die Matrix unten basiert auf Architektur; Scores werden aktualisiert, sobald öffentliche Leaderboards Ergebnisse veröffentlichen.

Frontier-Open-Modelle — Parametervergleich
Modell Gesamt Aktiv Kontext Training-HW Open-Tiefe
openPangu 2.0 Pro 505B 18B 512K Ascend NPU Volle Pipeline (7 Teile)
openPangu 2.0 Flash 92B 6B 512K Ascend NPU Volle Pipeline (7 Teile)
DeepSeek V4 Pro 1,6T ~200B 128K NVIDIA Gewichte + Inferenz
Qwen 3.7 Max ~400B+ variiert 128K NVIDIA Gewichte + partielles Training
Kimi K2.7 1T 32B 256K NVIDIA Gewichte + Inferenz
  • Coding / tiefes Reasoning: DeepSeek V4 Pro führt heute.
  • Agent / MCP-Tooling: Kimi-K2.7-Ökosystem ist reifer.
  • Dokumente über 256K Token: openPangu 2.0 Pro (512K) ist die klare Wahl.
  • Souveränität / keine US-Tech-Abhängigkeit: openPangu 2.0 ist die einzige Frontier-Option.
  • Ascend / Huawei Cloud: openPangu liefert nativ 2× Durchsatz.
  • Lokale Inferenz bei begrenztem VRAM: Flash (6B aktiv, ~96GB Unified Memory).

05 openPangu 2.0 betreiben: Sechs-Schritte-Guide für ModelArts und GitCode

Option 1 — Huawei Cloud ModelArts (schnellster Weg, keine Hardware)

  1. Huawei-Cloud-Konto registrieren und Verifizierung abschließen.
  2. ModelArts → AI Gallery öffnen und nach openPangu 2.0 suchen.
  3. Flash oder Pro abonnieren und API-Endpoint plus Auth-Token erhalten.
  4. Chat-Completions-Request bauen mit model, messages und max_tokens.
  5. Testaufruf senden per curl oder SDK zur Latenzvalidierung.
  6. In Produktions-Routing einbinden mit Retries, Rate Limits und Logging für Agent-/RAG-Workloads — dabei DSGVO-konforme Verarbeitung und Datenresidenz prüfen.
modelarts-api.sh
curl -X POST "https://modelarts.${REGION}.myhuaweicloud.com/v1/infers/openpangu-2-flash/chat/completions" \
  -H "Content-Type: application/json" \
  -H "X-Auth-Token: ${TOKEN}" \
  -d '{
    "model": "openpangu-2.0-flash",
    "messages": [{"role": "user", "content": "Erkläre MoE-Architektur in einfachen Worten"}],
    "max_tokens": 1024
  }'

Option 2 — Self-Hosted via GitCode

Repos: openPangu-2.0-Flash, openPangu-2.0-Flash-Int8, openPangu-2.0-Infer, openPangu-2.0-Op.

inference.py
python inference.py \
  --model_path ./openPangu-Flash \
  --device npu:0 \
  --context_length 512000 \
  --precision bf16
Hardware-Anforderungen
Variante Empfohlen Minimum
Flash (6B aktiv) Einzelner Ascend 910B ~96GB Unified Memory
Flash-Int8 Einzelner Ascend Atlas A2 ~48GB VRAM
Pro (18B aktiv) 4+ Ascend-910B-Cluster Multi-Card-Cluster

Huawei Cloud ModelArts:

https://www.huaweicloud.com/product/modelarts.html

HDC 2026 offizielle Ankündigung:

https://developer.huawei.com/consumer/cn/hdc/

06 Strategische Bedeutung, Roadmap und zitierfähige Technikdaten

Volle Pipeline als Open Source ermöglicht akademische Reproduktion, unternehmensspezifisches Domain-Pre-Training und senkt die Einstiegshürde für Ascend — und erweitert Chinas domestic-AI-Hardware-Ökosystem.

HarmonyOS-Agent-Fundament: HarmonyOS 7 tritt in die Agent-Ära ein; openPangu 2.0 ist die native KI-Engine. HarmonyOS Agent Framework 2.0 meldet >90 % Erfolg bei komplexen Tasks; das 30B-On-Device-Modell läuft lokal ohne Netzwerk.

Roadmap: 30. Juni Flash-Release (erledigt) → Juli Pro-Gewichte → H2 2026 Pre-/Post-Training-Code und weitere Operatoren.

  • Parameter: Pro 505B/18B aktiv; Flash 92B/6B aktiv
  • Kontext: 512K Token bei beiden Varianten
  • Ascend-Durchsatz: ~2× Mainstream-Open-Modelle auf Ascend-Hardware
  • Train/Infer-Konsistenz: >99 %
  • Flash-Int8: ~40 % Speicherreduktion, <10 % Qualitätsverlust
  • Edge 30B: ~50 % schnellere Inferenz, ~20 % weniger Speicher

Hinweis: Einige Fähigkeitsbewertungen basieren auf Architektur-Inferenz. Unabhängige Benchmarks werden ergänzt, sobald veröffentlicht. Veröffentlicht: 1. Juli 2026.

Wenn Ihr Stack openPangu-API-Aufrufe für Langdokumente mit iOS-CI/CD, lokalen Agent-Frameworks oder Mac-Automation kombiniert, ist die API-Schicht nur die Hälfte. Laptops und VMs leiden unter Metal-Scheduling-Instabilität, thermischem Throttling und schlechter 7×24-Verfügbarkeit. Für produktive iOS-Builds und KI-Agent-Automation ist CALMVPS Bare-Metal-Mac-Mini-Miete meist die bessere Wahl: dediziertes Apple Silicon, Multi-Region-Nodes, monatliche Elastizität, ~120 Sekunden Bereitstellung. Preise: Mietpreise, Betrieb: Hilfezentrum, Bestellung: Mac mini M4 bestellen.