2026년 7월 16일 자정 무렵, Moonshot AI(月之暗面)가 API 문서 상단에 Kimi K3 출시 배너를 올렸습니다. 대규모 발표회 없이 2.8조(2.8T) 파라미터, 100만 token 컨텍스트, 네이티브 시각 이해를 갖춘 현재 세계 최대 규모 오픈소스 AI 모델이 등장했습니다. 전체 가중치는 7월 27일 Hugging Face에 공개됩니다.
본문은 API 전환을 검토 중인 AI 개발자와 프로덕트 팀을 대상으로 공식 기술 블로그·가격 페이지를 근거로 세 가지를 답합니다. Kimi K3 아키텍처의 실질 혁신, Claude Fable 5·GPT-5.6 Sol 대비 벤치마크·가격 위치, 지금 즉시 쓸 수 있는 연동 방법입니다.
01 Kimi K3란 무엇인가 — 스펙, 배경, 출시 의미
선정 전 흔한 오판:
- 총 파라미터만 본다: MoE 스파스 활성화에서는 총량과 추론 비용이 다릅니다. 활성 전문가 수와 컨텍스트 효율을 반드시 확인해야 합니다.
- harness 차이를 무시한다: Moonshot은 Kimi Code, GPT는 Codex, Claude는 Claude Code를 씁니다. 횡비교 시 출처 표기가 필수입니다.
- 1M 컨텍스트를 마케팅으로 본다: KDA 등 설계 없이는 긴 컨텍스트 KV 캐시 비용이 가격 우위를 잠식합니다.
- 가중치 공개를 기다린다: 7월 27일 이전에도 API는 가동 중입니다. 프로덕션 통합은 Hugging Face 공개를 기다릴 필요가 없습니다.
Kimi K3는 현재 세계 최대 규모 오픈소스 AI 모델입니다. 2.8T 파라미터는 기존 기록 보유자 DeepSeek V4 Pro(1.6T)보다 약 75% 크고, 샤오미 오픈소스(1.02T)의 약 2.7배, 알리(397B)의 7배 이상입니다. 896개 전문가 중 16개를 활성화하는 스파스 MoE에 100만 token 초장 컨텍스트(『홍루몽』 전권을 한 번에 읽는 수준)와 네이티브 시각 이해를 결합해 복잡한 코딩·장문서 추론·지식 업무에 맞춰 설계되었습니다.
한 줄 요약: Kimi K3는 이미지·영상을 네이티브 이해하고 초장기 기억을 갖춘 오픈소스 헤비급 코딩 AI입니다. Claude Opus 4.8 대비 약 40% 저렴하며 7월 27일 전체 가중치가 공개됩니다.
| 항목 | 값 |
|---|---|
| 총 파라미터 | 2.8조(2.8T) |
| 아키텍처 | Kimi Delta Attention + Attention Residuals + Stable LatentMoE |
| 활성 전문가 | 16 / 896(스파스도 1.8%) |
| 컨텍스트 창 | 1,048,576 tokens(1M) |
| 입력 모달리티 | 텍스트, 이미지, 영상 |
| API 모델 ID | kimi-k3 |
| 추론 모드 | 현재 max만(low/high 추후 추가) |
| 오픈 가중치 | 2026-07-27 Hugging Face |
이번 출시가 중요한 이유: Moonshot AI는 지난 18개월 DeepSeek 급부상 충격을 겪었고 K3는 기술 반격입니다. 최근 12개월 중 Kimi 시리즈가 9개월 오픈소스 규모 상한을 점유했습니다. 공개 시점은 2026 세계 인공지능 대회(WAIC) 개막 전야입니다. 2026년 6월 ARR 3억 달러 돌파, 올해 6라운드 투자 완료, 투자 전 밸류에이션 315억 달러입니다. API 매출 70% 이상, 해외 유료 사용자 400% 증가. 규모 과시가 아니라 상용화 폭발기의 기술 주권 선언입니다.
02 Kimi K3 아키텍처 혁신 — KDA, AttnRes, Stable LatentMoE
대부분의 「최대 모델」 발표는 연산 추가에 그칩니다. K3는 엔지니어링 층면에서 검증 가능한 3대 혁신으로 장컨텍스트·초스파스 MoE 학습 난제를 해결합니다.
3.1 Kimi Delta Attention(KDA) — 하이브리드 선형 Attention
기존 Full Attention은 장컨텍스트에서 KV 캐시 메모리가 제곱급 증가합니다. KDA는 3:1 비율로 선형 Attention 층과 전체 Attention 층을 교차 배치합니다. 선형 3층이 국소 구조를 저비용 처리하고 전체 1층이 글로벌 정보 흐름을 유지합니다. KV 캐시 메모리 최대 75% 절감, 100만 token 컨텍스트 디코드 속도 최대 6.3배 향상. 단·장컨텍스트 및 RL 확장 시나리오 모두 순수 Full Attention 베이스라인을 상회합니다.
3.2 Attention Residuals(AttnRes) — 깊이 선택적 검색
표준 잔차 연결은 깊이 방향으로 균등 누적되어 얕은 층 핵심 표현이 깊은 층에서 희석됩니다. AttnRes는 선택적 검색을 도입해 깊이를 가로질러 더 얕은 층의 고가치 표현을 직접 끌어옵니다. Moonshot은 약 25% 학습 효율 향상을 보고하며 추가 연산 부담은 2% 미만입니다.
3.3 Stable LatentMoE — 1.8% 스파스도 안정 학습
| 기술 | 역할 |
|---|---|
| Quantile Balancing | 라우터 점수 분위수로 전문가 할당을 도출, 휴리스틱 하이퍼파라미터 제거 |
| Per-Head Muon | Attention 헤드별 독립 최적화로 대규모 학습 적응성 강화 |
| Sigmoid Tanh Unit(SiTU) | 활성화 함수 제어 개선 |
| Gated MLA | Attention 선택성 향상 |
종합하면 Kimi K3는 Kimi K2 대비 전체 스케일링 효율 약 2.5배 향상입니다. 동일 연산에서 더 강한 지능을 뽑습니다. MXFP4 가중치·MXFP8 활성화로 학습했으며 vLLM·SGLang 등 프레임워크 Day-0 지원을 염두에 둔 양자화 설계입니다.
03 Kimi K3 벤치마크와 API 가격 — Claude·GPT 대비 위치
아래는 Moonshot 자체 공표 핵심 벤치마크입니다(모델별 추론 harness 상이). 독립 제3자 재현은 진행 중이므로 방향성 참고로 읽어 주세요.
| 벤치마크 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 13.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | — |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 12.9 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 91.2 |
| MMMU-Pro(시각) | 81.6 | 81.2 | 83.0 | 78.9 | — |
| OmniDocBench(문서 이해) | 91.1 | 89.8 | 85.8 | 87.9 | — |
| HLE-Full | 43.5 | 53.3 | 44.5 | — | — |
해석 포인트: SWE Marathon(지속 장기 코딩)에서 K3 42.0으로 크게 앞섭니다. Program Bench 77.8로 근소 1위. FrontierSWE는 Claude Fable 5 86.6 선행이나 K3는 GPT-5.6 Sol(71.3)를 크게 상회합니다. OmniDocBench 1위는 시각+장컨텍스트 시너지입니다. Artificial Analysis Intelligence Index v4.1에서 K3 57.1점 4위, Fable 5(59.9)·GPT-5.6 Sol(58.9) 뒤이며 1위와 4위 격차 2.8점뿐입니다.
| 모델 | 입력 | 출력 | 캐시 히트 입력 | 컨텍스트 |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Sonnet 5 | $3.00(프로모 $2) | $15.00(프로모 $10) | — | 200K |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 200K |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
K3 표준가는 Claude Sonnet 5와 동일($3/$15)하나 컨텍스트는 5배입니다. 캐시 히트 $0.30/M, 코딩 시나리오 캐시 히트율 90% 초과로 실효 입력 비용이 극히 낮습니다. 중국 API: 입력 ¥20/M, 출력 ¥100/M, 캐시 히트 ¥2/M. kimi.com 무료 계정 K3 이용 가능, 선불 ¥199부터(할인 8월 11일까지). Opus 4.8 대비 K3는 다수 벤치마크 우위·동급, 입력 비용 약 60%·출력 약 40% 수준입니다.
04 Kimi K3 사용법 — 4가지 연동 경로와 6단계 프로덕션 도입
즉시 사용 가능한 4가지 경로:
- Kimi 웹/App: kimi.com 접속, Google 계정 가입 가능. K3 기본 최대 추론 강도, 신용카드 불필요.
- 공식 API: OpenAI 호환 인터페이스. platform.kimi.ai에서 Key 발급.
- OpenRouter: 모델 ID
moonshotai/kimi-k3, 공식 가격 마크업 없음, 전체 1M 컨텍스트. - 7월 27일 가중치 대기: Hugging Face 전체 가중치 공개. 프로덕션급 로컬 배포는 64장 이상 가속카드 슈퍼노드 필요, 노트북급 아님.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "이 코드를 분석해 주세요..."}]
)
주요 공식 출처입니다. 발표·페이지 갱신 후 링크를 다시 확인하세요.
6단계 프로덕션 도입:
- API 가입·개통: platform.kimi.ai 계정 생성, 충전, API Key 발급. 청구 리전·컴플라이언스 확인.
- 연동 경로 선택: Moonshot API 직연 또는 OpenRouter(
moonshotai/kimi-k3) 라우팅, 기존 OpenAI SDK로 마이그레이션. - Prompt 캐시 활성화: 긴 코드베이스·Agent 루프에 캐시 키 설정, 90%+ 히트율로 실효 입력 비용 약 $0.55/M(OpenRouter 7일 가중 검증 가능).
- 1M 컨텍스트 설계: 전체 리포 분석, 장법무·연구 문서, 다회 Agent 메모리 — flat 가격으로 창을 끝까지 활용.
- 하이브리드 모델 라우팅: 장기 코딩·문서 이해는 K3, 복잡 Repo급 버그는 Claude Fable 5 fallback, 터미널 집약 Agent는 GPT-5.6 Sol 유지.
- 7월 27일 가중치 공개 추적: 자체 호스팅·파인튜닝 필요 시 Hugging Face MXFP4/NVFP4 양자화판·vLLM/SGLang 적응 공지 팔로우.
05 어떻게 고를까 — 선정 매트릭스, 오픈소스, FAQ
| 시나리오 | 권장 모델 | 이유 |
|---|---|---|
| 지속 장기 코딩(SWE Marathon급) | Kimi K3 | 벤치마크 1위, 최장 컨텍스트 |
| 복잡 Repo급 버그 수정 | Claude Fable 5 | FrontierSWE·SWE-bench Pro 대폭 선행 |
| 터미널·툴체인 집약 Agent | GPT-5.6 Sol | Terminal Bench·Coding Agent Index 선행 |
| 초장문서·멀티모달 문서 이해 | Kimi K3 | OmniDocBench 1위, 네이티브 시각+1M 컨텍스트 |
| 비용 민감 | DeepSeek V4 Pro | 출력 $3.48/M로 K3보다 훨씬 저렴 |
| 오픈소스 자체 호스팅(7/27 이후) | Kimi K3 | 최강 오픈 가중치, 최초 2T급 |
| 최심층 추론 연구 | Claude Fable 5 | HLE-Full 대폭 선행(53.3 vs 43.5) |
7월 27일 오픈소스 약속: Moonshot은 7월 27일 전체 모델 가중치 공개를 공식 명시했습니다. K3는 다운로드 가능 최대 오픈소스 모델·최초 2조 파라미터급 오픈 가중치·오픈 커뮤니티 학습·파인튜닝 신기반이 됩니다. Hugging Face MXFP4/NVFP4 양자화판, vLLM·SGLang 즉시 지원 예상.
인용 가능 데이터(EEAT):
- 파라미터 규모: 2.8T 총 파라미터, 896 전문가 중 16 활성, DeepSeek V4 Pro(1.6T) 대비 약 75% 상(출처: Moonshot AI 공식 블로그, 2026-07-16).
- KDA 효율: 100만 token 컨텍스트 KV 캐시 75% 감소, 디코드 최대 6.3배(출처: Moonshot 기술 문서, 2026-07-16).
- 종합 지능: Artificial Analysis Intelligence Index v4.1 57.1점, 오픈소스 모델 글로벌 1티어(출처: Artificial Analysis, 2026-07).
FAQ:
- Q: Kimi K3 무료인가요? A: kimi.com 무료 계정 이용 가능. API는 $3/$15 per 1M tokens 과금.
- Q: 로컬 실행 가능한가요? A: 7월 27일 가중치 공개 전 불가. 공개 후 64+ 가속카드 슈퍼노드 필요, 소비자급 하드웨어 아님.
- Q: DeepSeek V4 Pro와 비교? A: K3 파라미터 약 2배, 컨텍스트 1M vs 128K, 다수 벤치마크 우위. DeepSeek 출력 $3.48/M이 더 저렴.
- Q: 1M 컨텍스트 실용적인가요? A: 전체 리포 분석, 장문서 E2E 처리, 다세션 Agent 장기 기억에 적합. flat 가격으로 전체 창 활용 가능.
- Q: low/high 추론 모드는? A: Moonshot은 low/high 모드를 추후 추가한다고 밝혔습니다. 현재 max만.
결론: Kimi K3는 파라미터 쌓기용 겉치레가 아닙니다. KDA·AttnRes·Stable LatentMoE는 실제 엔지니어링 혁신이며 장기 코딩·문서 이해에서 일부 폐쇄 플래그십에 필적·상회합니다. 가격 합리적, 전체 오픈소스 약속. 중국 AI 오픈 생태가 「저가 시장 점유」에서 지능 프론티어 도전으로 전환하는 신호입니다. 주목 타임라인: 7월 17–20일 WAIC → 7월 27일 K3 전체 가중치 오픈소스.
Kimi K3 API를 로컬 OpenClaw·Cursor Agent에 연결하면 개인 Mac 슬립으로 SWE Marathon급 장기 작업이 끊기고 다중 리포 병렬이 메모리·네트워크를 경쟁합니다. AI 프로그래밍 Agent, Kimi Code 워크플로, OpenClaw Gateway 7×24 안정 운영이 필요한 프로덕션에서는 CALMVPS 베어메탈 Mac Mini 대여가 일반적으로 더 적합합니다. 전용 Apple Silicon, Metal 네이티브 가속, 월 단위 유연 과금, 약 120초 프로비저닝으로 무거운 Agent 루프를 클라우드에 오프로드하고 로컬은 검토에 집중할 수 있습니다. 가격 페이지를 확인하세요.