Huawei openPangu 2.0 вышел в open source —
обучен без единого GPU NVIDIA

30 июня 2026 Huawei выполнил обещание HDC 2026: веса openPangu-2.0-Flash, inference-код и training operators опубликованы на GitCode. Это первый frontier LLM такого масштаба, открыто выпущенный после полного обучения на не-NVIDIA железе — и один из немногих с планом публикации всей training pipeline.

Статья для разработчиков и технических лидеров, оценивающих суверенный AI, нагрузки с контекстом 512K или развёртывание на Ascend/Huawei Cloud. Внутри: хронология, параметры Pro/Flash, архитектура mHC / Muon / ModAttn / DSA+SWA, обучение на Ascend 910B, матрица сравнения с DeepSeek, Qwen и Kimi, ModelArts API и self-host через GitCode в шести практических шагах, геополитический контекст, интеграция HarmonyOS Agent и open-source roadmap. После прочтения вы поймёте, зачем этот релиз важен, когда его выбирать и как запустить уже сегодня.

01 Три заблуждения перед оценкой openPangu 2.0

  • Считать релиз «ещё одним weight drop»: Большинство моделей публикуют веса и inference-код. openPangu 2.0 планирует открыть pre-training code, post-training code и Ascend training operators — крайне редко на масштабе 505B.
  • Оценивать суверенный AI только по SWE-bench: DeepSeek V4 Pro (~200B active parameters) сегодня лидирует в coding и deep reasoning. openPangu выигрывает по 512K контексту, native throughput на Ascend и нулевой зависимости от NVIDIA.
  • Игнорировать hardware affinity: Обучение прошло полностью на Ascend 910B NPU. Бенчмарки на NVIDIA без CANN + torch_npu искажают выводы.
Ключевая хронология openPangu 2.0
Дата Событие
2026-06-12 HDC 2026 — keynote Richard Yu официально запускает openPangu 2.0
2026-06-30 Flash weights, inference code и training operators на GitCode
Июль 2026 (план) Pro weights и inference code
H2 2026 (план) Pre/post-training code (SFT/RLHF), дополнительные operators

Под US export controls на advanced AI chips openPangu 2.0 доказывает: frontier-scale training возможен без A100/H100 — прямой вызов тезису «без NVIDIA нет frontier model».

02 openPangu 2.0 Pro vs Flash: контекст 512K и семь open-source компонентов

Ключевые параметры: Pro vs Flash
Параметр Pro Flash
Total parameters 505B 92B
Active parameters 18B 6B
Sparsity ratio ~28:1 ~15:1 (ultra-sparse attention DSA+SWA)
Context window 512K 512K
Доступность Июль 2026 (план) Live с 30 июня

Обе версии поддерживают 512K tokens — примерно восемь полноценных романов, крупную code base или полный пакет юридических контрактов в одном prompt.

Семь планируемых open-source компонентов: model architecture (опубликована), weights (Flash live, Pro в июле), technical report (опубликован), inference code + training operators (опубликованы), pre-training code (H2 2026), post-training code с SFT/RLHF (H2 2026), Ascend custom training operators (H2 2026).

Лицензия openPangu License (permissive): commercial use разрешён, royalty-free, non-exclusive. Точные условия — в LICENSE на GitCode.

03 Техническая архитектура: mHC routing, Muon optimizer и Ascend stack

  • mHC (Multi-Head Combinatorial) routing: Улучшенный expert routing с меньшим load imbalance.
  • Muon optimizer: Second-order momentum optimizer (Microsoft research), адаптирован для stability на больших масштабах.
  • ModAttn (Modular Attention): Эффективно обеспечивает контекст 512K.
  • DSA+SWA ultra-sparse attention (только Flash): Экстремальная sparsity — 6B active из 92B total на token.

Результаты обучения на Ascend (NVIDIA silicon не использовался):

  • single-card throughput vs mainstream open models на Ascend
  • +30% hypernode training efficiency
  • +50% 512K long-sequence training throughput
  • >99% train/inference distribution consistency (известная MoE-проблема)
  • Flash-Int8 quantization: ~40% меньше памяти, <10% quality loss (W4A8)

Developer stack: CANN (Huawei runtime уровня CUDA) + torch_npu. Стандартный PyTorch переключает backend через import torch_npu. Пути deployment: Huawei Cloud ModelArts API, GitCode self-host, HarmonyOS native edge.

Edge variant: 30B on-device model — inference ~50% быстрее, ~20% меньше памяти, offline на Kirin mobile chips.

Hub репозиториев (проверять после каждого release):

https://gitcode.com/org/ascend-tribe/repos

04 openPangu 2.0 vs DeepSeek, Qwen и Kimi: где какая модель сильнее

Независимые third-party benchmarks пока недоступны (release 30 июня). Матрица ниже основана на архитектуре; scores обновим после публикации на public leaderboards.

Сравнение параметров frontier open models
Модель Total Active Context Training HW Open depth
openPangu 2.0 Pro 505B 18B 512K Ascend NPU Full pipeline (7 частей)
openPangu 2.0 Flash 92B 6B 512K Ascend NPU Full pipeline (7 частей)
DeepSeek V4 Pro 1.6T ~200B 128K NVIDIA Weights + inference
Qwen 3.7 Max ~400B+ varies 128K NVIDIA Weights + partial training
Kimi K2.7 1T 32B 256K NVIDIA Weights + inference
  • Coding / deep reasoning: DeepSeek V4 Pro лидирует сегодня.
  • Agent / MCP tooling: экосистема Kimi K2.7 зрелее.
  • Документы свыше 256K tokens: openPangu 2.0 Pro (512K) — очевидный выбор.
  • Sovereignty / без зависимости от US tech: openPangu 2.0 — единственный frontier option.
  • Ascend / Huawei Cloud: openPangu даёт 2× native throughput.
  • Local inference при ограниченном VRAM: Flash (6B active, ~96GB unified memory).

05 Как запустить openPangu 2.0: шесть шагов для ModelArts и GitCode

Option 1 — Huawei Cloud ModelArts (быстрее всего, без железа)

  1. Зарегистрировать Huawei Cloud account и пройти verification.
  2. Открыть ModelArts → AI Gallery и найти openPangu 2.0.
  3. Подписаться на Flash или Pro и получить API endpoint плюс auth token.
  4. Собрать Chat Completions request с model, messages и max_tokens.
  5. Отправить test call через curl или SDK для проверки latency.
  6. Подключить к production routing с retries, rate limits и logging для Agent/RAG workloads.
modelarts-api.sh
curl -X POST "https://modelarts.${REGION}.myhuaweicloud.com/v1/infers/openpangu-2-flash/chat/completions" \
  -H "Content-Type: application/json" \
  -H "X-Auth-Token: ${TOKEN}" \
  -d '{
    "model": "openpangu-2.0-flash",
    "messages": [{"role": "user", "content": "Объясни MoE architecture простыми словами"}],
    "max_tokens": 1024
  }'

Option 2 — Self-hosted через GitCode

Repos: openPangu-2.0-Flash, openPangu-2.0-Flash-Int8, openPangu-2.0-Infer, openPangu-2.0-Op.

inference.py
python inference.py \
  --model_path ./openPangu-Flash \
  --device npu:0 \
  --context_length 512000 \
  --precision bf16
Требования к железу
Версия Рекомендуется Минимум
Flash (6B active) Single Ascend 910B ~96GB unified memory
Flash-Int8 Single Ascend Atlas A2 ~48GB VRAM
Pro (18B active) Cluster 4+ Ascend 910B Multi-card cluster

Huawei Cloud ModelArts:

https://www.huaweicloud.com/product/modelarts.html

Официальное объявление HDC 2026:

https://developer.huawei.com/consumer/cn/hdc/

06 Стратегическое значение, roadmap и цитируемые технические данные

Full-pipeline open source даёт академическое воспроизведение, enterprise domain pre-training и снижает барьер входа в Ascend — расширяя domestic AI hardware ecosystem Китая.

HarmonyOS Agent foundation: HarmonyOS 7 входит в эру Agent; openPangu 2.0 — native AI engine. HarmonyOS Agent Framework 2.0 сообщает >90% success на complex tasks; 30B on-device model работает локально без сети.

Roadmap: Flash release 30 июня (готово) → Pro weights в июле → H2 2026 pre/post-training code и дополнительные operators.

  • Parameters: Pro 505B/18B active; Flash 92B/6B active
  • Context: 512K tokens на обеих версиях
  • Ascend throughput: ~2× mainstream open models на Ascend hardware
  • Train/infer consistency: >99%
  • Flash-Int8: ~40% memory reduction, <10% quality loss
  • Edge 30B: inference ~50% быстрее, ~20% меньше памяти

Disclaimer: часть capability assessments — architecture-based inferences. Independent benchmarks добавим после публикации. Опубликовано: 1 июля 2026.

Если ваш stack сочетает openPangu API для long documents с iOS CI/CD, local Agent frameworks или Mac automation, API layer — только половина задачи. Laptops и VM страдают от Metal scheduling instability, thermal throttling и плохого 7×24 uptime. Для production iOS builds и AI Agent automation аренда bare-metal Mac CALMVPS обычно лучше: dedicated Apple Silicon, multi-region nodes, monthly elasticity, provisioning ~120 секунд. Цены: цены аренды, эксплуатация: центр помощи, заказ: оформить заказ Mac mini M4.