Kimi K3 전체 오픈 가중치 공개:
2.8조 파라미터와 100만 컨텍스트의 전모

7월 27일 23시경 Moonshot AI(月之暗面)는 Kimi K3 전체 모델 가중치와 기술 보고서를 공개하고, MoonEP, FlashKDA, AgentEnv 세 가지 핵심 인프라를 동시에 오픈소스화했습니다. 세계 최초로 완전 공개된 3조 파라미터급 모델이며, 가중치 용량은 약 1.56TB입니다. 공개 30분 만에 Hugging Face 트렌드 1위를 기록했습니다.

본 글은 Kimi K3 상업 라이선스, 자체 배포 장벽, API 선정을 검토하는 AI 개발자와 기술 의사결정자를 위합니다. 공식 발표와 제3자 재검증 데이터를 바탕으로 K3가 「오픈소스」인지 「오픈 가중치」인지, 아키텍처·Infra 혁신의 가치, 지금 어떻게 연동해야 하는지 세 가지를 정리합니다.

01 Kimi K3 API 최초 공개부터 전체 오픈 가중치까지: 11일 타임라인과 선정 Pain Point

가중치 공개 전 반드시 짚어야 할 Pain Point:

  • 「오픈소스」와 「오픈 가중치」 혼동: 언론은 대부분 「오픈소스」로 표기하지만 Moonshot은 open source 표현을 쓰지 않고 open weight만 사용합니다. OSI 기준으로 법무 평가 시 컴플라이언스 오판 위험이 있습니다.
  • 라이선스 2대 상업 임계값 간과: K3 커스텀 라이선스는 MaaS 연간 매출 2000만 달러 초과와 MAU 1억 초과 표시 의무를 신설했습니다. K2 시대 Modified MIT와 다릅니다.
  • 총 파라미터만 보고 활성화 비용 무시: 2.8T 총 파라미터, 896 전문가 중 16개만 활성화. 자체 배포에는 64 GPU 이상 슈퍼노드가 필요하며 소비자급 하드웨어로는 비현실적입니다.
  • 증류 논란을 노이즈로 치부: 7월 22–23일 미·중 「모델 증류」 분쟁과 7월 28일 상무부 대응이 WAIC 2026과 겹칩니다. 지정학과 엔지니어링은 분리 평가해야 합니다.

이번 전체 오픈 가중치 공개는 kimi.com과 API에서 Kimi K3가 처음 공개된 지 불과 11일 만에 이뤄졌습니다.

  • 7월 16일 밤(WAIC 2026 전야): K3가 kimi.com, Kimi Work, Kimi Code, Kimi API에서 최초 공개. 가중치는 미공개. 공식 기술 블로그 제목은 《Kimi K3: Open Frontier Intelligence》.
  • 7월 17일: 업계가 아키텍처를 집중 분석. 신화통신은 「현재 세계 최대 파라미터 오픈소스 모델」이라고 보도했습니다.
  • 7월 22–23일: 미·중 「모델 증류」 분쟁 격화. 백악관 기술 고문 Michael Kratsios가 Moonshot의 Anthropic Fable 모델 「대규모·은밀한 산업 규모 증류」를 비난. 재무장관 Scott Bessent는 제재와 엔티티 리스트 제한 검토를 밝혔습니다.
  • 7월 27일 23시: K3 전체 가중치와 기술 보고서 정식 공개. MoonEP, AgentEnv 오픈소스화(FlashKDA는 이미 공개).
  • 7월 28일: 중국 상무부가 미국의 「AI 패권주의」를 비판하는 공개 대응. 국내 매체가 오픈소스 세부를 후속 보도. 3일 후 알리바바가 24조 파라미터 Qwen3.8-Max-Preview를 발표, 국산 LLM 경쟁이 「3T 클럽」 단계에 진입했습니다.
Kimi K3 핵심 스펙 요약
항목
총 파라미터 2.8조(2.8T)
활성화 파라미터 약 1040억
아키텍처 혼합 전문가(MoE)
전문가 구성 896 라우팅 전문가, token당 16 활성화(공유 전문가 별도)
어텐션 메커니즘 Kimi Delta Attention(KDA) + Gated MLA
컨텍스트 윈도우 100만 token
멀티모달 네이티브 시각 이해(ViT-V2, 27층)
가중치 형식 MXFP4 가중치 + MXFP8 활성화(SFT 단계부터 양자화 인식 학습)
가중치 용량 약 1.56TB(Hugging Face)
License 커스텀 라이선스(공식 표현 open weight, open source 아님)

02 Kimi K3 아키텍처 혁신: KDA, AttnRes, 3대 Infra 오픈소스

Kimi K3는 딥러닝의 3대 전통 요소——어텐션, 잔차 연결, 옵티마이저——를 재설계했으며, 단순 파라미터 적층과는 본질적으로 다릅니다.

Kimi Delta Attention(KDA): 기존 Gated DeltaNet은 스칼라 망각 게이트를 사용합니다. KDA는 채널 단위 게이트로 바꿔 각 특징 차원이 독립 감쇠율을 갖습니다. chunkwise Diagonal-Plus-Low-Rank(DPLR)로 선형 시간 재귀를 구현합니다. K3는 KDA와 소수 Gated MLA 글로벌 어텐션 층을 교대 혼합해 100만 token 컨텍스트를 지원하면서 KV Cache 비용을 극소화합니다.

Attention Residuals(AttnRes): 기존 잔차 연결은 층마다 균등 누적해 깊은 층에서 초기 정보가 희석됩니다. AttnRes는 입력에 따라 앞선 모든 층 출력을 선택적으로 집계합니다. 층당 RMSNorm 1개와 pseudo-query 벡터 1개 추가로 약 25% 학습 효율 향상(비용 2% 미만).

Per-Head Muon: 각 어텐션 헤드를 독립 최적화해 수렴 경로를 적응합니다. 순수 학습기 기술로 API 호출에는 영향 없지만, 적은 활성화 파라미터로 최상위 폐쇄 모델에 근접한 성능을 냅니다.

Stable LatentMoE: 896 중 16 선택 희소 설계(희소도 약 1.8%). Quantile Balancing과 MoonEP로 각 연산 노드의 중복 전문가 수 이론 상한을 수학적으로 증명했습니다.

Moonshot은 가중치 파일만이 아니라 K3 학습 효율을 뒷받침하는 3대 핵심 Infra도 함께 공개했습니다.

3대 오픈소스 Infra
기술 역할 핵심 역량
MoonEP 초대규모 세밀 MoE 고성능 통신 라이브러리 과부하 전문가를 일시 복제해 노드별 token 수 균등화. 중복 전문가 수 이론 상한 증명, 부하 불균형 시에도 고통신 효율 유지
FlashKDA NVIDIA CUTLASS 기반 KDA 고성능 커널(이미 공개) NVIDIA H20에서 prefill이 flash-linear-attention 기준 1.72–2.22배 빠름. chunk_kda 백엔드로 직접 대체 가능
AgentEnv KVCache.ai 공동 개발 Agent 샌드박스(Firecracker microVM) 대규모 병렬 Agent RL 학습용. 공식 수치: checkpoint 지연 133ms, 복구 49ms, 메모리 오버커밋 최대 6.5배(제3자 독립 검증 미실시)

아키텍처와 Infra 동시 공개는 개발자 커뮤니티에서 높은 평가를 받았습니다. 가중치 던지기가 아니라 엔지니어링 역량 전체의 개방으로 보는 시각이 지배적입니다.

03 Kimi K3 벤치마크는 어떤가? 오픈 가중치 라이선스 2대 상업 임계값

아래는 독립 제3자 재검증 데이터를 우선 인용하며, 벤더 자체 보고는 별도 표기합니다.

SWE-bench Verified(독립 재검증, Vals AI, 2026년 7월 기준)
모델 점수 공개일
Claude Opus 5 97% 2026-07-24
GPT-5.6 Sol 96.2% 2026-07-09
Claude Fable 5 95% 2026-06-09
Kimi K3 93.4% 2026-07-16
Qwen3.7-Max 79.4% 2026-05-19
DeepSeek-V4 76.2% 2026-04-23

Artificial Analysis Intelligence Index(max 추론 모드): Claude Fable 5(max + fallback) 60; GPT-5.6 Sol(max) 59; Kimi K3(max) 약 57, 세계 3위·오픈 가중치 1위; GLM-5.2(max) 51; DeepSeek V4 Pro(max) 44. K3 태스크당 비용 약 $0.95로 Claude Fable 5(약 $2.4/태스크) 대비 약 60% 저렴하지만 GLM-5.2(약 $0.47/태스크)보다 비쌉니다——오픈 가중치 진영 능력 상한은 최고이나 가성비 1위는 아님. K3는 Arena.ai Frontend Code Arena 현재 1위입니다.

오픈 가중치 vs 오픈소스: OSI 기준 진정한 오픈소스는 학습 데이터, 학습 코드, 완전 재현 파이프라인 공개가 필요합니다. K3는 가중치, 기술 보고서, 추론 Infra만 공개했고 학습 데이터·전체 학습 코드는 비공개입니다. 라이선스도 Modified MIT가 아닌 완전 커스텀 문서이며 2대 상업 임계값이 있습니다.

  • Model-as-a-Service 매출 임계값: 피허가자가 MaaS 사업을 운영하고 연속 12개월 누적 매출이 2000만 달러를 초과하면 Moonshot과 별도 상업 계약이 필요합니다.
  • 규모 표시 임계값: 제품 MAU가 1억을 초과하거나 월 매출이 2000만 달러를 초과하면 UI에 「Kimi K3」를 눈에 띄게 표시해야 합니다.

대다수 중소 팀에는 2대 임계값이 거의 해당되지 않습니다. 다만 「K3로 Moonshot과 경쟁하는 MaaS를 띄우겠다」는 계획이라면 첫 번째 임계값이 법무상 핵심 레드라인입니다.

Kimi K3 API 가격(100만 token당)
Token 유형 가격
입력(캐시 히트) $0.30
입력(캐시 미스) $3.00
출력(추론 과정 포함) $15.00

Mooncake 분리형 추론 아키텍처는 전형적 코딩 워크로드에서 캐시 히트율 90% 이상을 달성해 실효 비용은 $0.30 구간에 가깝습니다. 자체 배포는 공식 권장 64 GPU 이상 슈퍼노드. 개인·중소 팀에는 공식 API 또는 OpenRouter(7개 프로바이더 이미 제공)가 현실적입니다.

04 Kimi K3 사용법: API 연동과 6단계 프로덕션 도입

Moonshot은 OpenAI SDK 호환 Chat Completions API를 제공합니다. 모델 ID는 kimi-k3이며, 기존 프로젝트는 base URL과 API 키만 바꾸면 연동할 수 있습니다.

kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "이 코드를 분석해..."}]
)

아래는 주요 공식 출처입니다. 릴리스나 페이지 업데이트 후 링크를 다시 확인하세요.

https://kimi.com/blog/kimi-k3

https://api.moonshot.ai/v1

https://huggingface.co/moonshotai

6단계 프로덕션 도입:

  1. 라이선스 경계 확인: MaaS 연간 매출 2000만 달러 초과 또는 MAU 1억 초과 해당 여부 확인. 임계값에 근접하면 법무와 커스텀 라이선스 조항을 사전 평가합니다.
  2. 연동 경로 선택: Moonshot API 직결(https://api.moonshot.ai/v1) 또는 OpenRouter(moonshotai/kimi-k3) 통합 라우팅. OpenAI SDK로 마이그레이션합니다.
  3. Prompt 캐시 활성화: 대형 코드베이스와 Agent 루프에서 캐시 키 설정. 90% 이상 히트율로 실효 입력 비용을 약 $0.30/M으로 압축합니다.
  4. 자체 배포 vs API 평가: 1.56TB 가중치는 64 GPU 슈퍼노드 필요. 기존 클러스터가 없으면 API 또는 제3자 호스팅이 현실적입니다.
  5. 하이브리드 모델 라우팅: 장시간 코딩·문서 이해는 K3. 복잡 Repo 버그 수정은 Claude Fable 5 fallback. 터미널 집약형 Agent는 GPT-5.6 Sol 유지.
  6. Infra 오픈소스 추적: MoE 학습 또는 Agent RL 시 MoonEP, FlashKDA, AgentEnv와 기존 스택 통합을 평가합니다. 릴리스 후 GitHub 저장소를 재확인하세요.

05 인용 가능 데이터, FAQ, 정리

인용 가능 핵심 데이터(EEAT):

  • 파라미터 규모: 2.8T 총 파라미터, 896 전문가 중 16 활성화. 세계 최초 완전 공개 3T급 모델(출처: Moonshot AI 공식 블로그, 2026-07-27).
  • SWE-bench Verified: 독립 재검증 93.4%. 오픈 가중치 진영 1위, Claude Opus 5 / GPT-5.6 Sol / Claude Fable 5에 이음(출처: Vals AI, 2026-07).
  • FlashKDA 가속: NVIDIA H20에서 prefill이 기준 대비 1.72–2.22배(출처: Moonshot GitHub FlashKDA, 릴리스 후 재확인).

자주 묻는 질문 FAQ:

  • Q: Kimi K3는 진짜 오픈소스 모델입니까? A: 엄밀히는 아닙니다. 「오픈 가중치」에 해당합니다. 가중치, 기술 보고서, 일부 Infra는 공개했으나 학습 데이터와 전체 학습 코드는 비공개로 OSI 「오픈소스」 정의를 충족하지 않습니다.
  • Q: Kimi K3를 무료 상업 이용할 수 있습니까? A: 대다수 상업 시나리오는 제한 없습니다. MaaS 연간 매출 2000만 달러 초과 또는 MAU 1억 초과/월 매출 2000만 달러 초과 시 라이선스 특정 조항을 준수해야 합니다.
  • Q: 자체 배포에 GPU가 몇 장 필요합니까? A: 공식 권장 64 GPU 이상 슈퍼노드. 개인과 대부분 기업에는 API 또는 OpenRouter가 현실적입니다.
  • Q: 성능이 정말 강합니까? A: 오픈 가중치 진영 종합 1위, AA 지수 세계 3위. 다만 GLM-5.2보다 비용이 높아 능력 상한형이지 가성비 1위는 아닙니다.
  • Q: Kimi K2와 차이는? A: K3는 K2.5의 약 3배 파라미터. AttnRes와 Per-Head Muon 신설. 컨텍스트·멀티모달 대폭 향상. 라이선스에 MaaS 매출 임계값 추가로 상업 제한이 더 세분화되었습니다.

정리: Kimi K3 전체 오픈 가중치 공개는 국산 LLM 「3T 클럽」의 이정표입니다. KDA, AttnRes, MoonEP 등 엔지니어링 디테일과 지정학적 배경이 얽혀 있지만, 기업 사용자에게는 오픈 가중치 라이선스를 먼저 이해하고 API 또는 호스팅 경로를 선택하는 것이 1.56TB 가중치를 맹목적으로 내려받는 것보다 실무적입니다.

Kimi K3를 로컬 Agent 워크플로에 연결하면 개인 Mac 슬립으로 장시간 코딩 태스크가 끊기고, 64 GPU 클러스터 자체 배포는 개인 개발자에게 비현실적입니다. AI 코딩 Agent, Kimi Code 워크플로, OpenClaw Gateway 7×24 안정 가동이 필요한 프로덕션 환경에서는 CALMVPS Mac Mini 베어메탈 대여가 일반적으로 더 나은 선택입니다. Apple Silicon 독점, Metal 네이티브 가속, 월 단위 유연 계약, 약 120초 배포로 무거운 Agent 루프를 클라우드에 오프로드하고 로컬은 리뷰만 담당할 수 있습니다. 자세한 내용은 가격 페이지를 참고하세요.