Huawei openPangu 2.0 오픈소스 공개 —
NVIDIA GPU 한 장 없이 학습한 프론티어 LLM

2026년 6월 30일 Huawei는 HDC 2026에서 약속한 openPangu-2.0-Flash 가중치, 추론 코드, 학습 오퍼레이터를 GitCode에 공개했습니다. 이는 NVIDIA 이외 하드웨어로만 학습한 프론티어 규모 LLM 가운데 최초로 공개된 사례이며, 학습 파이프라인 전체 공개를 계획하는 소수 모델 중 하나입니다.

본문은 주권 AI, 512K 컨텍스트, Ascend·Huawei Cloud 도입을 검토하는 개발자와 기술 의사결정자를 대상으로 합니다. 타임라인, Pro/Flash 파라미터, mHC / Muon / ModAttn / DSA+SWA 아키텍처, Ascend 910B 학습 성과, DeepSeek·Qwen·Kimi 비교표, ModelArts API와 GitCode 셀프호스팅 6단계 절차, HarmonyOS Agent 연동, 오픈소스 로드맵을 다룹니다. 읽은 뒤 왜 중요한지, 언제 선택할지, 오늘부터 어떻게 실행할지 판단할 수 있어야 합니다.

01 openPangu 2.0 평가 전에 풀어야 할 세 가지 오해

  • 「또 하나의 가중치 공개」로 치부:대부분 모델은 가중치와 추론 코드에 그칩니다. openPangu 2.0은 사전학습 코드, 사후학습 코드, Ascend 학습 오퍼레이터까지 공개 예정이며 505B 규모에서는 매우 드뭅니다.
  • SWE-bench만으로 주권 AI를 판단:DeepSeek V4 Pro(활성 약 200B)가 코딩·심층 추론에서 현재 선두입니다. openPangu는 512K 컨텍스트, Ascend 네이티브 처리량, NVIDIA 의존 제로에서 강점을 보입니다.
  • 하드웨어 친화성 무시:학습은 Ascend 910B NPU만 사용했습니다. CANN + torch_npu 최적화를 반영하지 않고 NVIDIA에서 벤치마크하면 결론이 왜곡됩니다.
openPangu 2.0 주요 타임라인
날짜 이벤트
2026-06-12 HDC 2026 — Yu Chengdong 키노트로 openPangu 2.0 공식 출시
2026-06-30 Flash 가중치·추론 코드·학습 오퍼레이터 GitCode 공개
2026년 7월(예정) Pro 가중치 및 추론 코드
2026년 하반기(예정) 사전학습 코드, 사후학습 코드(SFT/RLHF), 추가 오퍼레이터

미국 선단 AI 칩 수출 통제 하에서도 openPangu 2.0은 A100/H100 없이 프론티어 규모 학습이 가능함을 보여 「NVIDIA 없이는 프론티어 모델 불가」라는 서사에 정면으로 도전합니다.

02 openPangu 2.0 Pro vs Flash: 512K 컨텍스트와 7개 오픈소스 컴포넌트

핵심 파라미터: Pro vs Flash
항목 Pro Flash
총 파라미터 505B 92B
활성 파라미터 18B 6B
희소 비율 약 28:1 약 15:1(DSA+SWA 초희소 어텐션)
컨텍스트 윈도 512K 512K
제공 상태 2026년 7월(예정) 6월 30일부터 제공

두 변형 모두 512K 토큰을 지원합니다. 장편 소설 8권 분량, 대규모 코드베이스 전체, 계약서 묶음을 한 프롬프트에 담을 수 있습니다.

계획된 7개 오픈소스 컴포넌트:모델 아키텍처(공개), 가중치(Flash 제공 중, Pro 7월), 기술 보고서(공개), 추론 코드 + 학습 오퍼레이터(공개), 사전학습 코드(2026년 하반기), SFT/RLHF 포함 사후학습 코드(2026년 하반기), Ascend 커스텀 학습 오퍼레이터(2026년 하반기).

라이선스는 관대한 openPangu License입니다. 상업적 이용 허용, 로열티 프리, 비독점. 정확한 조건은 GitCode LICENSE를 참조하세요.

03 기술 아키텍처: mHC 라우팅, Muon 옵티마이저, Ascend 스택

  • mHC(Multi-Head Combinatorial) 라우팅:전문가 라우팅을 개선해 부하 불균형을 줄입니다.
  • Muon 옵티마이저:Microsoft 연구 기반 2차 모멘텀 옵티마이저를 대규모 학습에 맞게 적용했습니다.
  • ModAttn(Modular Attention):512K 컨텍스트를 효율적으로 처리합니다.
  • DSA+SWA 초희소 어텐션(Flash 전용):92B 총 파라미터 중 토큰당 6B 활성이라는 극단적 희소성을 구현합니다.

Ascend 학습 성과(파이프라인에 NVIDIA 실리콘 미사용):

  • 2배 — Ascend 기준 주류 오픈 모델 대비 단일 카드 처리량
  • +30% — 하이퍼노드 학습 효율
  • +50% — 512K 장시퀀스 학습 처리량
  • >99% — 학습/추론 분포 일치율(MoE에서 문제 되기 쉬운 지표)
  • Flash-Int8 양자화 — 메모리 약 40% 절감, 품질 손실 <10%(W4A8)

개발 스택은 CANN(Huawei CUDA급 런타임) + torch_npu입니다. 표준 PyTorch는 import torch_npu로 백엔드를 전환합니다. 배포 경로는 Huawei Cloud ModelArts API, GitCode 셀프호스트, HarmonyOS 네이티브 엣지 세 가지입니다.

엣지용 30B 온디바이스 모델은 추론 약 50% 가속, 메모리 약 20% 절감으로 Kirin 모바일 칩에서 오프라인 동작합니다.

주요 리포지토리 허브(각 릴리스 후 확인):

https://gitcode.com/org/ascend-tribe/repos

04 openPangu 2.0 vs DeepSeek·Qwen·Kimi: 모델별 강점

독립 제3자 벤치마크는 아직 없습니다(6월 30일 공개). 아래 표는 아키텍처 기반 비교이며 공개 리더보드가 나오면 점수를 갱신합니다.

프론티어 오픈 모델 파라미터 비교
모델 총량 활성 컨텍스트 학습 HW 공개 깊이
openPangu 2.0 Pro 505B 18B 512K Ascend NPU 전체 파이프라인(7부)
openPangu 2.0 Flash 92B 6B 512K Ascend NPU 전체 파이프라인(7부)
DeepSeek V4 Pro 1.6T 약 200B 128K NVIDIA 가중치 + 추론
Qwen 3.7 Max 약 400B+ 가변 128K NVIDIA 가중치 + 부분 학습
Kimi K2.7 1T 32B 256K NVIDIA 가중치 + 추론
  • 코딩 / 심층 추론:현재 DeepSeek V4 Pro가 앞섭니다.
  • Agent / MCP 도구:Kimi K2.7 생태계가 더 성숙합니다.
  • 256K 초과 장문서:512K를 지원하는 openPangu 2.0 Pro가 명확한 선택입니다.
  • 주권 / 미국 기술 의존 없음:프론티어급에서는 openPangu 2.0만 해당합니다.
  • Ascend / Huawei Cloud:openPangu는 네이티브로 2배 처리량을 제공합니다.
  • 제한된 VRAM 로컬 추론:Flash(6B 활성, 통합 메모리 약 96GB).

05 openPangu 2.0 실행 방법: ModelArts·GitCode 6단계 가이드

옵션 1 — Huawei Cloud ModelArts(가장 빠름, 하드웨어 불필요)

  1. Huawei Cloud 계정을 등록하고 본인 인증을 완료합니다.
  2. ModelArts → AI Gallery에서 openPangu 2.0을 검색합니다.
  3. Flash 또는 Pro를 구독하고 API 엔드포인트와 인증 토큰을 받습니다.
  4. Chat Completions 요청을 model, messages, max_tokens로 구성합니다.
  5. curl 또는 SDK로 테스트 호출을 보내 지연 시간을 확인합니다.
  6. 프로덕션 라우팅에 연결하고 Agent/RAG용 재시도·속도 제한·로깅을 설정합니다.
modelarts-api.sh
curl -X POST "https://modelarts.${REGION}.myhuaweicloud.com/v1/infers/openpangu-2-flash/chat/completions" \
  -H "Content-Type: application/json" \
  -H "X-Auth-Token: ${TOKEN}" \
  -d '{
    "model": "openpangu-2.0-flash",
    "messages": [{"role": "user", "content": "MoE 아키텍처를 쉽게 설명해 주세요"}],
    "max_tokens": 1024
  }'

옵션 2 — GitCode 셀프호스트

리포지토리: openPangu-2.0-Flash, openPangu-2.0-Flash-Int8, openPangu-2.0-Infer, openPangu-2.0-Op.

inference.py
python inference.py \
  --model_path ./openPangu-Flash \
  --device npu:0 \
  --context_length 512000 \
  --precision bf16
하드웨어 요구사항
변형 권장 최소
Flash(6B 활성) Ascend 910B 단일 카드 통합 메모리 약 96GB
Flash-Int8 Ascend Atlas A2 단일 카드 VRAM 약 48GB
Pro(18B 활성) Ascend 910B 4카드 이상 클러스터 멀티카드 클러스터

Huawei Cloud ModelArts:

https://www.huaweicloud.com/product/modelarts.html

HDC 2026 공식 발표:

https://developer.huawei.com/consumer/cn/hdc/

06 전략적 의미, 로드맵, 인용 가능한 기술 데이터

파이프라인 전체 오픈소스는 학술 재현, 기업 도메인 사전학습, Ascend 도입 장벽 완화를 가능하게 하며 중국 내 AI 하드웨어 생태계를 확장합니다.

HarmonyOS Agent 기반:HarmonyOS 7은 Agent 시대에 진입했으며 openPangu 2.0이 네이티브 AI 엔진입니다. HarmonyOS Agent Framework 2.0은 복잡 작업에서 >90% 성공률을 보고하며 30B 온디바이스 모델은 네트워크 없이 로컬 실행됩니다.

로드맵:6월 30일 Flash 공개(완료) → 7월 Pro 가중치 → 2026년 하반기 사전/사후학습 코드 및 추가 오퍼레이터.

  • 파라미터:Pro 505B/18B 활성, Flash 92B/6B 활성
  • 컨텍스트:두 변형 모두 512K 토큰
  • Ascend 처리량:Ascend 하드웨어에서 주류 오픈 모델 대비 약 2배
  • 학습/추론 일치율:>99%
  • Flash-Int8:메모리 약 40% 절감, 품질 손실 <10%
  • 엣지 30B:추론 약 50% 가속, 메모리 약 20% 절감

면책 조항: 일부 역량 평가는 아키텍처 기반 추론입니다. 독립 벤치마크가 공개되면 추가합니다. 게시일: 2026년 7월 1일.

openPangu API로 장문서를 처리하면서 iOS CI/CD, 로컬 Agent 프레임워크, Mac 측 자동화를 병행한다면 API 계층만으로는 부족합니다. 노트북과 VM에서는 Metal 스케줄링 불안정, 발열 스로틀링, 24/7 가동 취약이 병목이 됩니다. 프로덕션 iOS 빌드와 AI Agent 자동화에는 CALMVPS 베어메탈 Mac mini 렌탈이 적합합니다. 전용 Apple Silicon, 멀티리전 노드, 월 단위 탄력 과금, 약 120초 프로비저닝. 가격 페이지에서 Ascend API 워크플로와 병행할 Mac 측 컴퓨트 예산을 확인하세요.