30 июня 2026 Huawei выполнил обещание HDC 2026: веса openPangu-2.0-Flash, inference-код и training operators опубликованы на GitCode. Это первый frontier LLM такого масштаба, открыто выпущенный после полного обучения на не-NVIDIA железе — и один из немногих с планом публикации всей training pipeline.
Статья для разработчиков и технических лидеров, оценивающих суверенный AI, нагрузки с контекстом 512K или развёртывание на Ascend/Huawei Cloud. Внутри: хронология, параметры Pro/Flash, архитектура mHC / Muon / ModAttn / DSA+SWA, обучение на Ascend 910B, матрица сравнения с DeepSeek, Qwen и Kimi, ModelArts API и self-host через GitCode в шести практических шагах, геополитический контекст, интеграция HarmonyOS Agent и open-source roadmap. После прочтения вы поймёте, зачем этот релиз важен, когда его выбирать и как запустить уже сегодня.
01 Три заблуждения перед оценкой openPangu 2.0
- Считать релиз «ещё одним weight drop»: Большинство моделей публикуют веса и inference-код. openPangu 2.0 планирует открыть pre-training code, post-training code и Ascend training operators — крайне редко на масштабе 505B.
- Оценивать суверенный AI только по SWE-bench: DeepSeek V4 Pro (~200B active parameters) сегодня лидирует в coding и deep reasoning. openPangu выигрывает по 512K контексту, native throughput на Ascend и нулевой зависимости от NVIDIA.
- Игнорировать hardware affinity: Обучение прошло полностью на Ascend 910B NPU. Бенчмарки на NVIDIA без CANN +
torch_npuискажают выводы.
| Дата | Событие |
|---|---|
| 2026-06-12 | HDC 2026 — keynote Richard Yu официально запускает openPangu 2.0 |
| 2026-06-30 | Flash weights, inference code и training operators на GitCode |
| Июль 2026 (план) | Pro weights и inference code |
| H2 2026 (план) | Pre/post-training code (SFT/RLHF), дополнительные operators |
Под US export controls на advanced AI chips openPangu 2.0 доказывает: frontier-scale training возможен без A100/H100 — прямой вызов тезису «без NVIDIA нет frontier model».
02 openPangu 2.0 Pro vs Flash: контекст 512K и семь open-source компонентов
| Параметр | Pro | Flash |
|---|---|---|
| Total parameters | 505B | 92B |
| Active parameters | 18B | 6B |
| Sparsity ratio | ~28:1 | ~15:1 (ultra-sparse attention DSA+SWA) |
| Context window | 512K | 512K |
| Доступность | Июль 2026 (план) | Live с 30 июня |
Обе версии поддерживают 512K tokens — примерно восемь полноценных романов, крупную code base или полный пакет юридических контрактов в одном prompt.
Семь планируемых open-source компонентов: model architecture (опубликована), weights (Flash live, Pro в июле), technical report (опубликован), inference code + training operators (опубликованы), pre-training code (H2 2026), post-training code с SFT/RLHF (H2 2026), Ascend custom training operators (H2 2026).
Лицензия openPangu License (permissive): commercial use разрешён, royalty-free, non-exclusive. Точные условия — в LICENSE на GitCode.
03 Техническая архитектура: mHC routing, Muon optimizer и Ascend stack
- mHC (Multi-Head Combinatorial) routing: Улучшенный expert routing с меньшим load imbalance.
- Muon optimizer: Second-order momentum optimizer (Microsoft research), адаптирован для stability на больших масштабах.
- ModAttn (Modular Attention): Эффективно обеспечивает контекст 512K.
- DSA+SWA ultra-sparse attention (только Flash): Экстремальная sparsity — 6B active из 92B total на token.
Результаты обучения на Ascend (NVIDIA silicon не использовался):
- 2× single-card throughput vs mainstream open models на Ascend
- +30% hypernode training efficiency
- +50% 512K long-sequence training throughput
- >99% train/inference distribution consistency (известная MoE-проблема)
- Flash-Int8 quantization: ~40% меньше памяти, <10% quality loss (W4A8)
Developer stack: CANN (Huawei runtime уровня CUDA) + torch_npu. Стандартный PyTorch переключает backend через import torch_npu. Пути deployment: Huawei Cloud ModelArts API, GitCode self-host, HarmonyOS native edge.
Edge variant: 30B on-device model — inference ~50% быстрее, ~20% меньше памяти, offline на Kirin mobile chips.
Hub репозиториев (проверять после каждого release):
04 openPangu 2.0 vs DeepSeek, Qwen и Kimi: где какая модель сильнее
Независимые third-party benchmarks пока недоступны (release 30 июня). Матрица ниже основана на архитектуре; scores обновим после публикации на public leaderboards.
| Модель | Total | Active | Context | Training HW | Open depth |
|---|---|---|---|---|---|
| openPangu 2.0 Pro | 505B | 18B | 512K | Ascend NPU | Full pipeline (7 частей) |
| openPangu 2.0 Flash | 92B | 6B | 512K | Ascend NPU | Full pipeline (7 частей) |
| DeepSeek V4 Pro | 1.6T | ~200B | 128K | NVIDIA | Weights + inference |
| Qwen 3.7 Max | ~400B+ | varies | 128K | NVIDIA | Weights + partial training |
| Kimi K2.7 | 1T | 32B | 256K | NVIDIA | Weights + inference |
- Coding / deep reasoning: DeepSeek V4 Pro лидирует сегодня.
- Agent / MCP tooling: экосистема Kimi K2.7 зрелее.
- Документы свыше 256K tokens: openPangu 2.0 Pro (512K) — очевидный выбор.
- Sovereignty / без зависимости от US tech: openPangu 2.0 — единственный frontier option.
- Ascend / Huawei Cloud: openPangu даёт 2× native throughput.
- Local inference при ограниченном VRAM: Flash (6B active, ~96GB unified memory).
05 Как запустить openPangu 2.0: шесть шагов для ModelArts и GitCode
Option 1 — Huawei Cloud ModelArts (быстрее всего, без железа)
- Зарегистрировать Huawei Cloud account и пройти verification.
- Открыть ModelArts → AI Gallery и найти openPangu 2.0.
- Подписаться на Flash или Pro и получить API endpoint плюс auth token.
- Собрать Chat Completions request с model, messages и max_tokens.
- Отправить test call через curl или SDK для проверки latency.
- Подключить к production routing с retries, rate limits и logging для Agent/RAG workloads.
curl -X POST "https://modelarts.${REGION}.myhuaweicloud.com/v1/infers/openpangu-2-flash/chat/completions" \
-H "Content-Type: application/json" \
-H "X-Auth-Token: ${TOKEN}" \
-d '{
"model": "openpangu-2.0-flash",
"messages": [{"role": "user", "content": "Объясни MoE architecture простыми словами"}],
"max_tokens": 1024
}'
Option 2 — Self-hosted через GitCode
Repos: openPangu-2.0-Flash, openPangu-2.0-Flash-Int8, openPangu-2.0-Infer, openPangu-2.0-Op.
python inference.py \
--model_path ./openPangu-Flash \
--device npu:0 \
--context_length 512000 \
--precision bf16
| Версия | Рекомендуется | Минимум |
|---|---|---|
| Flash (6B active) | Single Ascend 910B | ~96GB unified memory |
| Flash-Int8 | Single Ascend Atlas A2 | ~48GB VRAM |
| Pro (18B active) | Cluster 4+ Ascend 910B | Multi-card cluster |
Huawei Cloud ModelArts:
https://www.huaweicloud.com/product/modelarts.html
Официальное объявление HDC 2026:
06 Стратегическое значение, roadmap и цитируемые технические данные
Full-pipeline open source даёт академическое воспроизведение, enterprise domain pre-training и снижает барьер входа в Ascend — расширяя domestic AI hardware ecosystem Китая.
HarmonyOS Agent foundation: HarmonyOS 7 входит в эру Agent; openPangu 2.0 — native AI engine. HarmonyOS Agent Framework 2.0 сообщает >90% success на complex tasks; 30B on-device model работает локально без сети.
Roadmap: Flash release 30 июня (готово) → Pro weights в июле → H2 2026 pre/post-training code и дополнительные operators.
- Parameters: Pro 505B/18B active; Flash 92B/6B active
- Context: 512K tokens на обеих версиях
- Ascend throughput: ~2× mainstream open models на Ascend hardware
- Train/infer consistency: >99%
- Flash-Int8: ~40% memory reduction, <10% quality loss
- Edge 30B: inference ~50% быстрее, ~20% меньше памяти
Disclaimer: часть capability assessments — architecture-based inferences. Independent benchmarks добавим после публикации. Опубликовано: 1 июля 2026.
Если ваш stack сочетает openPangu API для long documents с iOS CI/CD, local Agent frameworks или Mac automation, API layer — только половина задачи. Laptops и VM страдают от Metal scheduling instability, thermal throttling и плохого 7×24 uptime. Для production iOS builds и AI Agent automation аренда bare-metal Mac CALMVPS обычно лучше: dedicated Apple Silicon, multi-region nodes, monthly elasticity, provisioning ~120 секунд. Цены: цены аренды, эксплуатация: центр помощи, заказ: оформить заказ Mac mini M4.