2026년 6월 30일 Huawei는 HDC 2026에서 약속한 openPangu-2.0-Flash 가중치, 추론 코드, 학습 오퍼레이터를 GitCode에 공개했습니다. 이는 NVIDIA 이외 하드웨어로만 학습한 프론티어 규모 LLM 가운데 최초로 공개된 사례이며, 학습 파이프라인 전체 공개를 계획하는 소수 모델 중 하나입니다.
본문은 주권 AI, 512K 컨텍스트, Ascend·Huawei Cloud 도입을 검토하는 개발자와 기술 의사결정자를 대상으로 합니다. 타임라인, Pro/Flash 파라미터, mHC / Muon / ModAttn / DSA+SWA 아키텍처, Ascend 910B 학습 성과, DeepSeek·Qwen·Kimi 비교표, ModelArts API와 GitCode 셀프호스팅 6단계 절차, HarmonyOS Agent 연동, 오픈소스 로드맵을 다룹니다. 읽은 뒤 왜 중요한지, 언제 선택할지, 오늘부터 어떻게 실행할지 판단할 수 있어야 합니다.
01 openPangu 2.0 평가 전에 풀어야 할 세 가지 오해
- 「또 하나의 가중치 공개」로 치부:대부분 모델은 가중치와 추론 코드에 그칩니다. openPangu 2.0은 사전학습 코드, 사후학습 코드, Ascend 학습 오퍼레이터까지 공개 예정이며 505B 규모에서는 매우 드뭅니다.
- SWE-bench만으로 주권 AI를 판단:DeepSeek V4 Pro(활성 약 200B)가 코딩·심층 추론에서 현재 선두입니다. openPangu는 512K 컨텍스트, Ascend 네이티브 처리량, NVIDIA 의존 제로에서 강점을 보입니다.
- 하드웨어 친화성 무시:학습은 Ascend 910B NPU만 사용했습니다. CANN +
torch_npu최적화를 반영하지 않고 NVIDIA에서 벤치마크하면 결론이 왜곡됩니다.
| 날짜 | 이벤트 |
|---|---|
| 2026-06-12 | HDC 2026 — Yu Chengdong 키노트로 openPangu 2.0 공식 출시 |
| 2026-06-30 | Flash 가중치·추론 코드·학습 오퍼레이터 GitCode 공개 |
| 2026년 7월(예정) | Pro 가중치 및 추론 코드 |
| 2026년 하반기(예정) | 사전학습 코드, 사후학습 코드(SFT/RLHF), 추가 오퍼레이터 |
미국 선단 AI 칩 수출 통제 하에서도 openPangu 2.0은 A100/H100 없이 프론티어 규모 학습이 가능함을 보여 「NVIDIA 없이는 프론티어 모델 불가」라는 서사에 정면으로 도전합니다.
02 openPangu 2.0 Pro vs Flash: 512K 컨텍스트와 7개 오픈소스 컴포넌트
| 항목 | Pro | Flash |
|---|---|---|
| 총 파라미터 | 505B | 92B |
| 활성 파라미터 | 18B | 6B |
| 희소 비율 | 약 28:1 | 약 15:1(DSA+SWA 초희소 어텐션) |
| 컨텍스트 윈도 | 512K | 512K |
| 제공 상태 | 2026년 7월(예정) | 6월 30일부터 제공 |
두 변형 모두 512K 토큰을 지원합니다. 장편 소설 8권 분량, 대규모 코드베이스 전체, 계약서 묶음을 한 프롬프트에 담을 수 있습니다.
계획된 7개 오픈소스 컴포넌트:모델 아키텍처(공개), 가중치(Flash 제공 중, Pro 7월), 기술 보고서(공개), 추론 코드 + 학습 오퍼레이터(공개), 사전학습 코드(2026년 하반기), SFT/RLHF 포함 사후학습 코드(2026년 하반기), Ascend 커스텀 학습 오퍼레이터(2026년 하반기).
라이선스는 관대한 openPangu License입니다. 상업적 이용 허용, 로열티 프리, 비독점. 정확한 조건은 GitCode LICENSE를 참조하세요.
03 기술 아키텍처: mHC 라우팅, Muon 옵티마이저, Ascend 스택
- mHC(Multi-Head Combinatorial) 라우팅:전문가 라우팅을 개선해 부하 불균형을 줄입니다.
- Muon 옵티마이저:Microsoft 연구 기반 2차 모멘텀 옵티마이저를 대규모 학습에 맞게 적용했습니다.
- ModAttn(Modular Attention):512K 컨텍스트를 효율적으로 처리합니다.
- DSA+SWA 초희소 어텐션(Flash 전용):92B 총 파라미터 중 토큰당 6B 활성이라는 극단적 희소성을 구현합니다.
Ascend 학습 성과(파이프라인에 NVIDIA 실리콘 미사용):
- 2배 — Ascend 기준 주류 오픈 모델 대비 단일 카드 처리량
- +30% — 하이퍼노드 학습 효율
- +50% — 512K 장시퀀스 학습 처리량
- >99% — 학습/추론 분포 일치율(MoE에서 문제 되기 쉬운 지표)
- Flash-Int8 양자화 — 메모리 약 40% 절감, 품질 손실 <10%(W4A8)
개발 스택은 CANN(Huawei CUDA급 런타임) + torch_npu입니다. 표준 PyTorch는 import torch_npu로 백엔드를 전환합니다. 배포 경로는 Huawei Cloud ModelArts API, GitCode 셀프호스트, HarmonyOS 네이티브 엣지 세 가지입니다.
엣지용 30B 온디바이스 모델은 추론 약 50% 가속, 메모리 약 20% 절감으로 Kirin 모바일 칩에서 오프라인 동작합니다.
주요 리포지토리 허브(각 릴리스 후 확인):
04 openPangu 2.0 vs DeepSeek·Qwen·Kimi: 모델별 강점
독립 제3자 벤치마크는 아직 없습니다(6월 30일 공개). 아래 표는 아키텍처 기반 비교이며 공개 리더보드가 나오면 점수를 갱신합니다.
| 모델 | 총량 | 활성 | 컨텍스트 | 학습 HW | 공개 깊이 |
|---|---|---|---|---|---|
| openPangu 2.0 Pro | 505B | 18B | 512K | Ascend NPU | 전체 파이프라인(7부) |
| openPangu 2.0 Flash | 92B | 6B | 512K | Ascend NPU | 전체 파이프라인(7부) |
| DeepSeek V4 Pro | 1.6T | 약 200B | 128K | NVIDIA | 가중치 + 추론 |
| Qwen 3.7 Max | 약 400B+ | 가변 | 128K | NVIDIA | 가중치 + 부분 학습 |
| Kimi K2.7 | 1T | 32B | 256K | NVIDIA | 가중치 + 추론 |
- 코딩 / 심층 추론:현재 DeepSeek V4 Pro가 앞섭니다.
- Agent / MCP 도구:Kimi K2.7 생태계가 더 성숙합니다.
- 256K 초과 장문서:512K를 지원하는 openPangu 2.0 Pro가 명확한 선택입니다.
- 주권 / 미국 기술 의존 없음:프론티어급에서는 openPangu 2.0만 해당합니다.
- Ascend / Huawei Cloud:openPangu는 네이티브로 2배 처리량을 제공합니다.
- 제한된 VRAM 로컬 추론:Flash(6B 활성, 통합 메모리 약 96GB).
05 openPangu 2.0 실행 방법: ModelArts·GitCode 6단계 가이드
옵션 1 — Huawei Cloud ModelArts(가장 빠름, 하드웨어 불필요)
- Huawei Cloud 계정을 등록하고 본인 인증을 완료합니다.
- ModelArts → AI Gallery에서 openPangu 2.0을 검색합니다.
- Flash 또는 Pro를 구독하고 API 엔드포인트와 인증 토큰을 받습니다.
- Chat Completions 요청을 model, messages, max_tokens로 구성합니다.
- curl 또는 SDK로 테스트 호출을 보내 지연 시간을 확인합니다.
- 프로덕션 라우팅에 연결하고 Agent/RAG용 재시도·속도 제한·로깅을 설정합니다.
curl -X POST "https://modelarts.${REGION}.myhuaweicloud.com/v1/infers/openpangu-2-flash/chat/completions" \
-H "Content-Type: application/json" \
-H "X-Auth-Token: ${TOKEN}" \
-d '{
"model": "openpangu-2.0-flash",
"messages": [{"role": "user", "content": "MoE 아키텍처를 쉽게 설명해 주세요"}],
"max_tokens": 1024
}'
옵션 2 — GitCode 셀프호스트
리포지토리: openPangu-2.0-Flash, openPangu-2.0-Flash-Int8, openPangu-2.0-Infer, openPangu-2.0-Op.
python inference.py \
--model_path ./openPangu-Flash \
--device npu:0 \
--context_length 512000 \
--precision bf16
| 변형 | 권장 | 최소 |
|---|---|---|
| Flash(6B 활성) | Ascend 910B 단일 카드 | 통합 메모리 약 96GB |
| Flash-Int8 | Ascend Atlas A2 단일 카드 | VRAM 약 48GB |
| Pro(18B 활성) | Ascend 910B 4카드 이상 클러스터 | 멀티카드 클러스터 |
Huawei Cloud ModelArts:
https://www.huaweicloud.com/product/modelarts.html
HDC 2026 공식 발표:
06 전략적 의미, 로드맵, 인용 가능한 기술 데이터
파이프라인 전체 오픈소스는 학술 재현, 기업 도메인 사전학습, Ascend 도입 장벽 완화를 가능하게 하며 중국 내 AI 하드웨어 생태계를 확장합니다.
HarmonyOS Agent 기반:HarmonyOS 7은 Agent 시대에 진입했으며 openPangu 2.0이 네이티브 AI 엔진입니다. HarmonyOS Agent Framework 2.0은 복잡 작업에서 >90% 성공률을 보고하며 30B 온디바이스 모델은 네트워크 없이 로컬 실행됩니다.
로드맵:6월 30일 Flash 공개(완료) → 7월 Pro 가중치 → 2026년 하반기 사전/사후학습 코드 및 추가 오퍼레이터.
- 파라미터:Pro 505B/18B 활성, Flash 92B/6B 활성
- 컨텍스트:두 변형 모두 512K 토큰
- Ascend 처리량:Ascend 하드웨어에서 주류 오픈 모델 대비 약 2배
- 학습/추론 일치율:>99%
- Flash-Int8:메모리 약 40% 절감, 품질 손실 <10%
- 엣지 30B:추론 약 50% 가속, 메모리 약 20% 절감
면책 조항: 일부 역량 평가는 아키텍처 기반 추론입니다. 독립 벤치마크가 공개되면 추가합니다. 게시일: 2026년 7월 1일.
openPangu API로 장문서를 처리하면서 iOS CI/CD, 로컬 Agent 프레임워크, Mac 측 자동화를 병행한다면 API 계층만으로는 부족합니다. 노트북과 VM에서는 Metal 스케줄링 불안정, 발열 스로틀링, 24/7 가동 취약이 병목이 됩니다. 프로덕션 iOS 빌드와 AI Agent 자동화에는 CALMVPS 베어메탈 Mac mini 렌탈이 적합합니다. 전용 Apple Silicon, 멀티리전 노드, 월 단위 탄력 과금, 약 120초 프로비저닝. 가격 페이지에서 Ascend API 워크플로와 병행할 Mac 측 컴퓨트 예산을 확인하세요.