알리바바 Qwen3.8-Max GA:
2.4조 파라미터 Arena Text #5, 오픈 가중치 예정

2026년 8월 3일 알리바바는 차세대 플래그십 대형언어모델 Qwen3.8-Max를 정식 GA하고 Agent 제품 Qwen Office를 동시에 출시했습니다. 총 파라미터 2.4조, 활성 950억, 100만 token 컨텍스트, Arena Text Arena 5위——상위 8위 중 유일한 비 Anthropic 모델입니다.

본 글은 API 선정, 오픈 가중치 공개 시점, Agent 도구체인 마이그레이션을 검토하는 개발자와 기술 의사결정자를 위합니다. 7월 16일부터 8월 3일까지의 전체 타임라인, 핵심 스펙·벤치마크 표, MoE 아키텍처 설계 논리, Kimi K3·DeepSeek V4·Claude와의 비교, 「오픈소스」 라벨 논란, 6단계 도입 체크리스트와 FAQ를 정리합니다. 읽은 뒤 지금 사용 가능한지, 가중치가 공개됐는지, Kimi K3와 어느 쪽이 유리한지 답할 수 있어야 합니다.

01 2주 타임라인: Kimi K3 오픈 가중치, Qwen 프리뷰, DeepSeek 역전, 알리바바 GA

GA 전에 반드시 짚어야 할 Pain Point:

  • 「오픈소스」 라벨 선행: qwen.ai GA 당일 이미 Open-Source 표기가 있으나 Hugging Face·ModelScope에 저장소·라이선스·확정 일정이 없습니다. 의도와 실제 산출물을 혼동하면 컴플라이언스 오판 위험이 있습니다.
  • 벤더 자체 벤치마크 의존: PaperBench, QwenSWEBench, RecreationBench 등은 알리바바 자체 프레임워크입니다. Artificial Analysis·Arena.ai가 GA 정식판 독립 재검증을 아직 공개하지 않았습니다.
  • 프리뷰 투명성 부족: 7월 19일 프리뷰는 활성 파라미터·모델 카드·안전 평가를 공개하지 않았고, 서비스 약관은 자동화 프로덕션 호출을 금지했습니다. 당시 다수 독립 평가 기관이 프로덕션 마이그레이션을 권하지 않았습니다.
  • 활성 파라미터 공개 지연: Kimi K3는 약 1040억, DeepSeek는 약 490억 활성을 사전 공개했으나, 알리바바는 GA 단계에서야 「950억」을 보충 공개했습니다.

2026년 7월 중순 이후 국산 LLM은 짧은 간격으로 연속 출시되었습니다.

  • 7월 16일: Moonshot AI Kimi K3 공개. 2.8조 파라미터(896 전문가 중 16 활성), 독립 재검증·기술 보고서 투명성을 강조했습니다.
  • 7월 19일: Qwen3.8-Max 프리뷰가 Token Plan·Qoder·QoderWork에 선행 개방. 예상 정가의 10% 요금이나 활성 파라미터·벤치 표·모델 카드는 미공개, 약관상 자동화 프로덕션 호출 금지.
  • 7월 27일: Kimi K3 약속대로 전체 가중치 Hugging Face 공개, MoonEP·FlashKDA·AgentEnv 등 일부 Infra 동시 오픈소스.
  • 7월 31일: DeepSeek V4-Flash 정식판 출시. 파라미터 규모 불변 상태에서 아키텍처·학습 최적화만으로 Agent·코딩 벤치에서 V4-Pro 프리뷰를 대폭 상회.
  • 8월 3일: Qwen3.8-Max 정식 GA, 전체 벤치 표 공개, Qwen Office Agent 동시 출시. 텐센트 WorkBuddy·Moonshot Kimi Work와 직접 경쟁. 당일 알리바바 홍콩 주가 약 7%, 미국 상장 주가 약 4.5% 상승.
  • 8월 10일 전후(예상): Qwen3.8-Max와 경량 Qwen3.8-27B 가중치가 Hugging Face·ModelScope에 공개 예정이나, 작성 시점 기준 확정 일정·라이선스 조항은 미공개입니다.

「파라미터 경쟁」 서사는 「아키텍처 효율 경쟁」으로 대체되고 있습니다. DeepSeek V4-Flash는 파라미터를 늘리지 않고 전작을 역전했고, Qwen3.8-Max의 「대용량·저활성」 설계는 같은 베팅의 연장선입니다.

02 Qwen3.8-Max 핵심 데이터와 벤치마크(2026년 8월)

아래는 알리바바 공식 GA 자료를 바탕으로 정리했습니다. 「알리바바 자체 측정」 항목은 제3자 독립 재검증이 아직 없으므로 참고용으로만 사용하세요. 배포·마이그레이션 전 공식 최신 공지를 재확인해야 합니다.

Qwen3.8-Max 핵심 스펙과 벤치마크(2026년 8월 3일 GA)
항목
출시일 2026년 8월 3일(GA)
총 파라미터 / 활성 파라미터 2.4조 / 950억
아키텍처 Qwen3.5 기반 희소 MoE + 혼합 어텐션
컨텍스트 윈도우 100만 token(사고 모드 약 98.3만, 출력 상한 13.1만)
입력 모달리티 텍스트 / 이미지 / 비디오
API 가격(국제) 입력 $2/100만 token, 출력 $6/100만 token
API 가격(중국) 입력 12위안/100만 token, 출력 36위안/100만 token
Arena Text Arena(8월 1일 스냅샷) 5위, 1496점(Preliminary), 상위 8위 중 유일 비 Anthropic
Arena Vision Arena 2위, Claude Fable 5에 이음
PaperBench(알리바바 자체 측정) 93.0(전작 대비 +28.2점)
SWE-bench Pro(알리바바 자체 측정) 67.7(Fable 5 80.0에 열세)
가중치 공개 상태 「다음 주」 약속, 작성 시점 미공개

03 2.4조 파라미터 뒤: 아키텍처 논리와 4대 논란

왜 Dense 적층이 아니라 MoE + 혼합 어텐션인가? Qwen3.8-Max는 희소 MoE로 총 파라미터 2.4조를 달성하면서 token당 실제 활성은 950억에 그칩니다. 추론 비용은 2.4조 전량 호출이 아니라 천억급 모델에 가깝습니다. API가 입력 $2·출력 $6/100만 token(Claude Opus 5 $5/$25, Fable 5 $10/$50 대비 낮음)까지 압축된 근본 이유입니다.

reasoning_effort 3단 설계는 비용 통제를 해결합니다. low / medium / xhigh 3단(기본 xhigh)으로 과업 복잡도에 따라 속도·깊이를 조절합니다. enable_thinking 파라미터 또는 Anthropic 호환 reasoning.effort 필드로 호출할 수 있습니다.

장기 자율 과업이 핵심 셀링 포인트이나 검증 방식에 주의가 필요합니다. 알리바바 사례에는 16일 무인 개입 자율 코딩, 500단계 이상 칩 설계 최적화, 자체 RecreationBench(블랙박스 환경에서 상호작용·시각 피드백만으로 실제 앱 재현)가 포함됩니다. 이 벤치는 모두 자체 구축이며 공개 범위가 제한적입니다.

생태계 포지셔닝: Qwen3.8-Max는 Qwen Office Agent 플랫폼과 동시 연동되며, OpenAI·Anthropic 양쪽 API 프로토콜을 지원합니다. Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw 등 주류 Agent 도구체인에 base URL 교체만으로 붙일 수 있습니다.

4대 논란과 투명성 Pain Point:

  • 「Open-Source」 라벨이 가중치보다 먼저: GA 당일 공식 사이트에 오픈소스 표기가 있으나 Hugging Face·ModelScope에 해당 저장소·라이선스·확정 일정이 없습니다.
  • 벤치마크가 자체 프레임워크에 편중: PaperBench, QwenSWEBench, RecreationBench 등은 내부 기준입니다. Artificial Analysis·Arena.ai가 GA 정식판 독립 재현을 아직 공개하지 않았습니다.
  • 프리뷰 투명성 부족: 7월 19일 프리뷰는 활성 파라미터·모델 카드·안전 평가를 공개하지 않았고, 다수 독립 평가 기관이 프로덕션 마이그레이션을 권하지 않았습니다.
  • 활성 파라미터 공개 지연: Kimi K3·DeepSeek는 사전 공개했으나 알리바바는 GA까지 「950억」을 보충하지 않았습니다.

유일하게 비교 가능한 독립 블라인드 테스트(269개 파일 실제 프로젝트 아키텍처 설계)에서 Kimi K3 83점, Qwen3.8-Max 프리뷰 80점——격차는 작으며 「일방적 압도」가 아니라 「양측이 승패를 나누는」 수준입니다.

04 Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude

2026년 8월 프론티어 모델 비교
모델 총/활성 파라미터 가격(입력/출력, 100만 token) 가중치 공개 독립 제3자 평가
Qwen3.8-Max 2.4T / 950억 $2 / $6 미공개(약속 중) 없음
Kimi K3 2.8T / 약 1040억 $3 / $15 공개(7월 27일) AA Intelligence Index 약 57
DeepSeek V4-Flash V4-Pro 동일 규모 전체 표 미공개 공개 Agent·코딩 9항목 V4-Pro 상회
Claude Opus 5 미공개 $5 / $25 폐쇄 Arena 상위권
Claude Fable 5 미공개 $10 / $50 폐쇄 Arena Text 1위

6단계 프로덕션 도입(Qwen3.8-Max가 스택에 맞는지 평가):

  1. 호출 경로 확정: API는 QwenCloud에서 OpenAI·Anthropic 호환 프로토콜로 호출합니다. 온프레미스는 Qwen3.8-27B 경량판 가중치 공개를 기다리거나 Kimi K3 공개 가중치를 평가합니다.
  2. 오픈 가중치 상태 확인: 8월 4일 기준 가중치 미공개. 공식 「Open-Source」 표기를 다운로드 가능한 체크포인트와 동일시하지 마세요. Hugging Face·ModelScope 공식 저장소 공지를 추적합니다.
  3. reasoning_effort 설정: 과업 복잡도에 따라 low / medium / xhigh를 선택합니다. 단순 과업은 low로 비용을 줄이고, 복잡 Agent는 xhigh로 깊은 추론을 확보합니다.
  4. Agent 도구체인 연동: Claude Code, Qoder CLI, OpenClaw 등에서 base URL·API Key를 교체합니다. Anthropic 호환 인터페이스로 마이그레이션 비용을 낮춥니다.
  5. 워크로드 A/B 테스트: 알리바바 자체 벤치만으로 마이그레이션하지 마세요. 실제 코드베이스·Agent 워크플로에서 Qwen3.8-Max와 Kimi K3·DeepSeek V4를 직접 비교합니다.
  6. 독립 재검증 대기: Artificial Analysis·Arena.ai GA 정식판 재측정 결과를 확인한 뒤 프로덕션 기본 라우트 편입 여부를 결정합니다.

아래는 주요 공식 출처입니다. 릴리스 후 링크·엔드포인트를 재확인하세요.

https://qwen.ai

https://modelstudio.aliyun.com

05 인용 가능 데이터, FAQ, 정리

인용 가능 핵심 데이터(EEAT):

  • 총 vs 활성 파라미터: Qwen3.8-Max 총 2.4조, token당 활성 950억. 추론 비용은 2.4T 전량이 아니라 천억급 Dense에 가깝습니다(출처: 알리바바 GA 공지, 2026-08-03).
  • API 가격 경쟁력: 입력 $2/100만 token, 출력 $6/100만 token. Claude Opus 5($5/$25)·Fable 5($10/$50) 대비 낮으며, 암시적 캐시 히트 시 $0.25/100만 token까지 하락(출처: QwenCloud 요금표, GA 시점).
  • 소비자 사례: 중국 Apple Intelligence 생성 AI는 Qwen 기반(압축 후 iPhone 15 이상 온디바이스). Qwen 계열이 수억 대 iPhone의 시스템급 AI 엔진으로 확장(출처: Apple Intelligence 중국 승인 관련 보도).

자주 묻는 질문 FAQ:

  • Q: Qwen3.8-Max를 지금 바로 쓸 수 있습니까? 오픈소스입니까? A: API는 QwenCloud로 호출 가능합니다. 가중치는 아직 미공개이며 8월 10일 전후 공개가 예상되나 확정 일정은 공식 공지를 따릅니다. qwen.ai 「Open-Source」 표기는 현재 의도를 나타내며 다운로드 가능한 아티팩트와는 다릅니다.
  • Q: Kimi K3와 어느 쪽이 더 강합니까? A: 권위 있는 단일 헤드투헤드는 없습니다. 유일한 독립 블라인드 테스트는 Kimi K3 83점 vs Qwen 프리뷰 80점으로 접전입니다. Kimi K3 강점은 공개 가중치·제3자 평가, Qwen3.8-Max 강점은 낮은 API 가격·풍부한 네이티브 멀티모달입니다.
  • Q: 2.4조 파라미터면 일반 개발자가 감당할 수 없습니까? A: API 호출 비용은 천억급 모델에 가깝습니다. 전체 체크포인트 온프레미스는 다중 노드 데이터센터가 필요하며, 현실적 선택은 Qwen3.8-27B 경량판 가중치 공개를 기다리는 것입니다.
  • Q: 알리바바 공개 벤치마크를 신뢰해도 됩니까? A: 참고는 가능하나 결론으로 삼지 마세요. 독립 재검증 또는 자체 A/B 테스트를 병행해야 합니다.

정리: Qwen3.8-Max GA는 국산 LLM 「3T 클럽」 경쟁의 새 이정표입니다. Arena Text #5와 $2/$6 API는 매력적이나, 가중치 미공개·자체 벤치 편중·오픈소스 라벨 선행은 프로덕션 기본 라우트 편입 전 반드시 검증해야 할 변수입니다.

Agent 워크플로를 클라우드 API 호출에만 의존하면 네트워크 지연·Token 비용·모델 라우트 변경 시 마이그레이션 비용이 누적됩니다. 순수 로컬 Ollama는 통합 메모리 한도·7×24 안정성·다노드 확장에 제약이 있습니다. Claude Code, Qoder CLI, OpenClaw, Xcode CI/CD를 완전한 macOS 환경에서 7×24 가동해야 하는 팀에게 CALMVPS Mac Mini M4 베어메탈 임대가 일반적으로 더 나은 선택입니다. Apple Silicon 독점, 6개 리전 탄력 전환, 약 120초 배포로 Agent 노드를 클라우드에 두고 로컬은 리뷰만 담당할 수 있습니다. 자세한 내용은 가격 페이지를 참고하세요.

배포·마이그레이션 전 Qwen3.8-Max 최신 요금, 오픈 가중치 공개 시점, 벤치 수치를 공식 출처와 대조하세요. 본문은 2026년 8월 초 공개 자료 기준입니다.