Huawei openPangu 2.0 est open source —
entraîné sans aucun GPU NVIDIA

Le 30 juin 2026, Huawei tient la promesse du HDC 2026 : les poids openPangu-2.0-Flash, le code d'inférence et les opérateurs d'entraînement sont en ligne sur GitCode. C'est le premier LLM frontier de cette échelle publié après un entraînement intégral sur matériel non-NVIDIA — et l'un des rares à prévoir la publication complète de la pipeline d'entraînement.

Cet article s'adresse aux développeurs et décideurs techniques qui évaluent l'IA souveraine, les charges 512K de contexte ou les déploiements Ascend/Huawei Cloud. Il couvre la chronologie, les paramètres Pro/Flash, l'architecture mHC / Muon / ModAttn / DSA+SWA, l'entraînement Ascend 910B, une matrice face à DeepSeek, Qwen et Kimi, l'API ModelArts et l'auto-hébergement GitCode en six étapes actionnables, le contexte géopolitique, l'intégration HarmonyOS Agent et la roadmap open source. À la fin, vous saurez pourquoi cette release compte, quand la choisir et comment l'exploiter dès aujourd'hui.

01 Trois idées reçues avant d'évaluer openPangu 2.0

  • Le traiter comme « un simple drop de poids » : La plupart des modèles publient poids et code d'inférence. openPangu 2.0 prévoit de libérer le code de pré-entraînement, de post-entraînement et les opérateurs Ascend — extrêmement rare à l'échelle 505B.
  • Juger l'IA souveraine uniquement via SWE-bench : DeepSeek V4 Pro (~200B paramètres actifs) mène aujourd'hui en code et raisonnement profond. openPangu gagne sur le contexte 512K, le débit natif Ascend et l'absence de dépendance NVIDIA.
  • Ignorer l'affinité matérielle : L'entraînement s'est déroulé entièrement sur des NPU Ascend 910B. Benchmarker sur NVIDIA sans CANN + torch_npu fausse les conclusions.
Chronologie clé openPangu 2.0
Date Événement
2026-06-12 HDC 2026 — keynote Richard Yu lance officiellement openPangu 2.0
2026-06-30 Poids Flash, code d'inférence et opérateurs d'entraînement ouverts sur GitCode
Juillet 2026 (prévu) Poids Pro et code d'inférence
S2 2026 (prévu) Code pré/post-entraînement (SFT/RLHF), opérateurs supplémentaires

Sous les contrôles d'exportation US sur les puces IA avancées, openPangu 2.0 démontre qu'un entraînement frontier est possible sans A100/H100 — un défi direct au récit « sans NVIDIA, pas de modèle frontier ».

02 openPangu 2.0 Pro vs Flash : contexte 512K et sept composants open source

Paramètres clés : Pro vs Flash
Dimension Pro Flash
Paramètres totaux 505B 92B
Paramètres actifs 18B 6B
Ratio de sparsité ~28:1 ~15:1 (attention ultra-sparse DSA+SWA)
Fenêtre de contexte 512K 512K
Disponibilité Juillet 2026 (prévu) En ligne depuis le 30 juin

Les deux variantes supportent 512K tokens — environ huit romans complets, une grande base de code ou des contrats juridiques entiers en un seul prompt.

Sept composants open source prévus : architecture du modèle (publiée), poids (Flash en ligne, Pro en juillet), rapport technique (publié), code d'inférence + opérateurs d'entraînement (publiés), code de pré-entraînement (S2 2026), code de post-entraînement avec SFT/RLHF (S2 2026), opérateurs d'entraînement Ascend custom (S2 2026).

Sous licence permissive openPangu License : usage commercial autorisé, sans redevance, non exclusif. Voir LICENSE sur GitCode pour les termes exacts.

03 Architecture technique : routage mHC, optimiseur Muon et stack Ascend

  • Routage mHC (Multi-Head Combinatorial) : Routage d'experts amélioré avec moins de déséquilibre de charge.
  • Optimiseur Muon : Optimiseur à momentum de second ordre (recherche Microsoft), adapté pour la stabilité à grande échelle.
  • ModAttn (Modular Attention) : Permet un contexte 512K efficacement.
  • Attention ultra-sparse DSA+SWA (Flash uniquement) : Sparsité extrême — 6B actifs sur 92B total par token.

Résultats d'entraînement Ascend (aucun silicium NVIDIA dans la pipeline) :

  • débit single-card vs modèles open mainstream sur Ascend
  • +30 % efficacité d'entraînement hypernode
  • +50 % débit d'entraînement longues séquences 512K
  • >99 % cohérence train/inférence (problème MoE classique)
  • Flash-Int8 quantification : ~40 % moins de mémoire, <10 % perte de qualité (W4A8)

Stack développeur : CANN (runtime Huawei équivalent CUDA) + torch_npu. PyTorch standard change de backend avec import torch_npu. Chemins de déploiement : API Huawei Cloud ModelArts, auto-hébergement GitCode, edge natif HarmonyOS.

Variante edge : modèle 30B on-device — inférence ~50 % plus rapide, ~20 % moins de mémoire, hors ligne sur puces mobiles Kirin.

Hub des dépôts (vérifier après chaque release) :

https://gitcode.com/org/ascend-tribe/repos

04 openPangu 2.0 vs DeepSeek, Qwen et Kimi : où chaque modèle gagne

Les benchmarks tiers indépendants ne sont pas encore disponibles (release du 30 juin). La matrice ci-dessous est basée sur l'architecture ; les scores seront mis à jour dès publication sur les leaderboards publics.

Comparaison paramètres — modèles open frontier
Modèle Total Actif Contexte HW entraînement Profondeur open
openPangu 2.0 Pro 505B 18B 512K NPU Ascend Pipeline complète (7 parties)
openPangu 2.0 Flash 92B 6B 512K NPU Ascend Pipeline complète (7 parties)
DeepSeek V4 Pro 1,6T ~200B 128K NVIDIA Poids + inférence
Qwen 3.7 Max ~400B+ variable 128K NVIDIA Poids + entraînement partiel
Kimi K2.7 1T 32B 256K NVIDIA Poids + inférence
  • Code / raisonnement profond : DeepSeek V4 Pro mène aujourd'hui.
  • Agent / outillage MCP : l'écosystème Kimi K2.7 est plus mature.
  • Documents au-delà de 256K tokens : openPangu 2.0 Pro (512K) est le choix évident.
  • Souveraineté / zéro dépendance tech US : openPangu 2.0 est la seule option frontier.
  • Ascend / Huawei Cloud : openPangu offre 2× débit en natif.
  • Inférence locale avec VRAM limitée : Flash (6B actifs, ~96 Go mémoire unifiée).

05 Exécuter openPangu 2.0 : guide ModelArts et GitCode en six étapes

Option 1 — Huawei Cloud ModelArts (le plus rapide, sans matériel)

  1. Créer un compte Huawei Cloud et finaliser la vérification.
  2. Ouvrir ModelArts → AI Gallery et rechercher openPangu 2.0.
  3. Souscrire à Flash ou Pro et obtenir endpoint API plus jeton d'auth.
  4. Construire une requête Chat Completions avec model, messages et max_tokens.
  5. Envoyer un appel test via curl ou SDK pour valider la latence.
  6. Brancher en routage production avec retries, rate limits et logging pour charges Agent/RAG.
modelarts-api.sh
curl -X POST "https://modelarts.${REGION}.myhuaweicloud.com/v1/infers/openpangu-2-flash/chat/completions" \
  -H "Content-Type: application/json" \
  -H "X-Auth-Token: ${TOKEN}" \
  -d '{
    "model": "openpangu-2.0-flash",
    "messages": [{"role": "user", "content": "Explique l architecture MoE en termes simples"}],
    "max_tokens": 1024
  }'

Option 2 — Auto-hébergement via GitCode

Dépôts : openPangu-2.0-Flash, openPangu-2.0-Flash-Int8, openPangu-2.0-Infer, openPangu-2.0-Op.

inference.py
python inference.py \
  --model_path ./openPangu-Flash \
  --device npu:0 \
  --context_length 512000 \
  --precision bf16
Exigences matérielles
Variante Recommandé Minimum
Flash (6B actifs) Ascend 910B unique ~96 Go mémoire unifiée
Flash-Int8 Ascend Atlas A2 unique ~48 Go VRAM
Pro (18B actifs) Cluster 4+ Ascend 910B Cluster multi-cartes

Huawei Cloud ModelArts :

https://www.huaweicloud.com/product/modelarts.html

Annonce officielle HDC 2026 :

https://developer.huawei.com/consumer/cn/hdc/

06 Signification stratégique, roadmap et données techniques citables

Open source de pipeline complète : reproduction académique, pré-entraînement domaine entreprise, barrière d'entrée Ascend abaissée — élargissant l'écosystème matériel IA domestique chinois.

Fondation HarmonyOS Agent : HarmonyOS 7 entre dans l'ère Agent ; openPangu 2.0 en est le moteur IA natif. HarmonyOS Agent Framework 2.0 annonce >90 % de succès sur tâches complexes ; le modèle 30B on-device tourne localement sans réseau.

Roadmap : release Flash 30 juin (fait) → poids Pro en juillet → code pré/post-entraînement et opérateurs supplémentaires S2 2026.

  • Paramètres : Pro 505B/18B actifs ; Flash 92B/6B actifs
  • Contexte : 512K tokens sur les deux variantes
  • Débit Ascend : ~2× modèles open mainstream sur matériel Ascend
  • Cohérence train/inférence : >99 %
  • Flash-Int8 : ~40 % réduction mémoire, <10 % perte qualité
  • Edge 30B : inférence ~50 % plus rapide, ~20 % moins de mémoire

Avertissement : certaines évaluations de capacité sont des inférences architecturales. Benchmarks indépendants seront ajoutés à publication. Publié le 1er juillet 2026.

Si votre stack combine appels API openPangu pour longs documents avec CI/CD iOS, frameworks Agent locaux ou automation Mac, la couche API n'est que la moitié du chemin. Portables et VM souffrent d'instabilité Metal, throttling thermique et mauvaise disponibilité 7×24. Pour builds iOS production et automation Agent IA, la location Mac bare-metal CALMVPS convient mieux : Apple Silicon dédié, nœuds multi-régions, élasticité mensuelle, provisioning ~120 secondes. Tarifs : tarifs location, aide : centre d'aide, commande : commander Mac mini M4.