Claude Opus 5는 반값으로 플래그십에 근접,
Kimi K3는 「Claude 자칭」 증류 논란에 휩싸이다

이번 주 AI 업계의 두 가지 큰 이슈는 겉보기엔 무관해 보이지만, 같은 질문——가성비모델 능력의 실제 출처——을 던집니다. 2026-07-24 Anthropic은 일상용 주력 모델 Claude Opus 5를 출시했고, 당일 Claude Max 기본 모델이 되었습니다. 한편 7월 16일 공개된 Kimi K3는 백악관으로부터 「산업 규모 증류」 공개 비난을 받았고, 독립 연구자 Ryan Greenblatt는 K3가 Claude라고 자칭하며 내부 배포 ID를 출력한다는 통계를 공개했습니다.

본 글은 Claude / Kimi API 선정, 대형 모델 논란, 컴플라이언스 리스크를 검토하는 개발자와 기술 의사결정자를 위합니다. Anthropic 공식 발표, Moonshot 기술 블로그, TechCrunch 전문가 인터뷰, Greenblatt 분석을 바탕으로 Opus 5 전환 여부, K3 증류 의혹의 검증 가능한 부분, Agent 워크플로 실무 대응을 정리합니다.

01 Claude Opus 5 출시: 가격 동결, 성능 도약, Claude Max 기본 모델

선정 전 실무 과제:

  • Fable 5 고비용: 플래그십 지능은 높지만 입력 $10 / 출력 $50(100만 tokens 기준)로 일상 Agent 운영 비용이 부담됩니다.
  • Opus 4.8 한계: CursorBench, Frontier-Bench 등 어려운 작업에서 차세대 플래그십에 뒤처집니다.
  • 데이터 보존 정책: Fable 5 / Mythos 5는 30일 데이터 보존에 동의해야 하며, 컴플라이언스 민감 팀은 이용을 망설입니다.
  • 모델 ID 혼선: API, Bedrock, Vertex, Foundry 등 다중 플랫폼에서 통일 ID claude-opus-5를 확인해야 합니다.

2026-07-24(미국 태평양 시간), Anthropic은 Claude Opus 5를 공식 출시했습니다. 일상 주력 모델로, Fable 5에 근접한 지능을 Fable 5 절반 가격에 제공한다고 밝혔습니다. 가격은 Opus 4.8과 동일——입력 $5 / 100만 tokens, 출력 $25 / 100만 tokens. 컨텍스트 100만 tokens(기본이자 유일 설정). 최대 출력 128K tokens. Thinking 기본 활성, Effort 파라미터로 사고량을 조절합니다.

Claude Opus 5 주요 스펙(출처: Anthropic 공식)
항목 Claude Opus 5 비교 메모
가격(입력/출력) $5 / $25 per 100만 tokens Opus 4.8과 동일, Fable 5의 약 절반
컨텍스트 100만 tokens 기본이자 유일
이용 플랫폼 Claude API / Platform / AWS Bedrock / Google Vertex AI / Microsoft Foundry 모델 ID: claude-opus-5
제품 포지션 Claude Max 기본, Claude Pro 최상위 플래그십뿐 아니라 일상 주력을 내세우는 신호
데이터 보존 기본 이용 시 강제 보존 없음 Fable 5 / Mythos 5는 30일 보존 동의 필요
Fast 모드 약 2.5배 속도, 가격 2배 Opus 4.8과 동일 정책

공식 벤치마크 요점(출시 후 Anthropic 뉴스 페이지에서 재확인하세요):

  • Frontier-Bench v0.1: 소프트웨어 엔지니어링에서 전 모델 상회, Opus 4.8의 2배 이상, 작업당 비용은 더 낮습니다.
  • CursorBench 3.2: max effort에서 Fable 5 피크와 0.5% 미만 차이, 비용은 절반. high / xhigh / max 구간 모두 가성비 최우수.
  • ARC-AGI 3: 새로운 문제 해결에서 2위의 3배.
  • OSWorld 2.0: 임의 비용대에서 타 모델 상회, Fable 5 최고 점수를 Fable 5 비용 1/3 미만으로 넘깁니다.
  • Zapier AutomationBench: 엔드투엔드 자동화에서 2위의 약 1.5배.

정렬과 안전: 자동 행동 감사에서 Opus 5는 지금까지 가장 정렬된 Claude 모델로 평가됩니다. 사이버 공격, 바이오 보안 등 고위험 이중용도 능력은 Anthropic이 Opus 5로 프론티어 갱신을 의도적으로 피했고, 제한 배포 Mythos 5가 그 자리를 차지합니다.

공식 발표는 아래 링크를 참조하고, 업데이트 후 재확인하세요.

https://www.anthropic.com/news/claude-opus-5

02 Kimi K3 증류 논란: 백악관 공개 비난, 전문가는 타임라인에 의문

Opus 5가 「정상적인 신제품」이라면 Kimi K3 사건은 훨씬 복잡합니다. Moonshot AI는 2026-07-16 Kimi K3를 공개했습니다. 총 파라미터 2.8조(2.8T), 세계 최초 3T급 오픈소스 모델. 희소 MoE로 896 expert 중 token당 16개 활성(약 500억 상당). 100만 token 컨텍스트와 네이티브 시각 이해. Kimi Delta Attention(KDA) + Attention Residuals + Stable LatentMoE 기반. 전체 가중치는 2026-07-27 공개 예정——논란 발생 시점에는 외부 검증 불가였습니다.

K3 아키텍처와 벤치마크 상세는 당사 리뷰를 참조하세요: Kimi K3 심층 리뷰.

Kimi K3 증류 논란 타임라인
날짜 사건
2026-02 Anthropic이 Moonshot / DeepSeek / MiniMax 「산업 규모 증류 공격」 최초 공개. Moonshot에서 340만 회 초과 비정상 API 상호작용 탐지 주장
2026-07-01 Claude Fable 5 대중 공개
2026-07-16 Kimi K3 API/제품 정식 출시
2026-07-22/23 백악관 OSTP 수장 Michael Kratsios가 X에서 Moonshot의 「대규모·은밀한 산업 규모 증류」와 수출 허가 없는 Nvidia GB300 칩 사용 의혹 비난
2026-07-23 TechCrunch가 독립 연구자들의 증류설 의문 보도
2026-07-24 전후 Ryan Greenblatt 「K3 Claude 자칭」 통계 공개(GitHub: rgreenblatt/which_claude_is_k3)
2026-07-27(예정) Kimi K3 전체 가중치 공개, 외부 독립 검증 가능

2026-07-22/23, 백악관 과학기술정책실(OSTP) 수장 Michael Kratsios는 Moonshot이 「대규모·은밀한 산업 규모 증류」로 Anthropic Fable 능력을 탈취했다고 공개 비난했습니다. 수출 허가 없는 Nvidia GB300(Grace Blackwell 300)을 태국 서버 등으로 우회 취득했다는 의혹도 언급했습니다. Kratsios는 구체적 증거를 공개하지 않았고, Moonshot은 학습 과정 질문에 응답하지 않았습니다.

TechCrunch(7월 23일)는 독립 연구자 다수를 인터뷰해 「증류설」에 대한 회의가 널리 퍼졌다고 보도했습니다. Snorkel AI 공동창업자 Braden Hancock은 Fable 5가 7월 1일부터 공개 이용 가능했고 K3 출시(7월 16일)까지 2주뿐이라 충분한 데이터 증류·학습·공개는 불가능하다고 지적했습니다. Allen Institute for AI의 Nathan Lambert는 중국 모델이 프론티어에 가까워질수록 단순 SFT형 증류 한계가 드러나고, 격차를 벌리는 것은 강화학습이라고 말했습니다.

「Large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology and undermining American research is unacceptable.」—— Michael Kratsios, 백악관 OSTP 수장

배경으로 Elon Musk는 xAI가 Grok 학습 시 OpenAI 모델을 증류했다고 인정했으며, 업계에서 흔하다고 언급한 바 있습니다. 증류 자체가 불법은 아니며, 「기술적 참고」와 「은밀한 산업 규모 탈취」의 경계가 논점의 중심입니다.

03 Kimi K3가 Claude라고 자칭? Ryan Greenblatt의 기술적 증거

본 사건에서 가장 기술적으로 설득력 있는 각도는 Redwood Research 수석 과학자 Ryan Greenblatt가 2026-07-24 전후 공개한 통계 분석입니다. 여러 모델에 「당신은 누구입니까」를 물었을 때의 자기 인식 응답을 교차 엔트로피로 비교했습니다.

  • 비정상적으로 높은 Claude 자칭: Kimi K3는 정체 질문에 Claude라고 자칭하는 빈도가 두드러지며, claude-opus-4-5-20250929, claude-sonnet-4-5-20250929 등 Claude 내부 배포 ID 문자열까지 출력합니다.
  • 진짜 Claude보다 정확: 실제 Claude Sonnet 4.5는 「Claude Sonnet 4.5입니다」 정도만 말합니다. Opus 4.5는 내부 버전 ID를 스스로 보고하지 않습니다——교사 모델보다 K3가 더 정확합니다.
  • 세대 추종 패턴: K3 자칭은 「Claude 4.5 시대」(2025년 말)에 고정되며 현행 Fable/Mythos가 아닙니다. 이전 K2는 더 오래된 Claude Sonnet 4(2025년 중)를 가리킵니다——「세대마다 추종」하는 경향.
  • Greenblatt 해석: 교사의 배포 메타데이터를 교사보다 정확히 말하는 것은 「대화 스타일 모방」만으로 설명하기 어렵고, 배포 메타데이터가 붙은 Claude 데이터(API 로그·합성 데이터 등)가 학습에 섞였을 가능성을 시사합니다.
  • 중요한 단서: Greenblatt는 이 발견이 증류를 직접 증명하지 않는다고 강조합니다. 데이터 오염, 시스템 프롬프트 유출, 공개 데이터셋 합성도 설명 후보입니다.

분석 코드와 writeup은 Greenblatt GitHub를 참조하고, 업데이트 후 재확인하세요.

https://github.com/rgreenblatt/which_claude_is_k3

7월 27일 가중치 공개 전에는 아키텍처와 벤치마크를 외부가 완전 독립 검증할 수 없어 논란이 지속됩니다.

04 Claude Opus 5 vs Fable 5 vs Kimi K3: 선정 매트릭스

세 모델 주요 차원 비교(2026-07-25 집필 시점)
차원 Claude Opus 5 Claude Fable 5 Kimi K3
입력/출력 가격(100만 tokens) $5 / $25 약 $10 / $50 약 $3 / $15(API, K3 리뷰 참조)
Fable 5 대비 코딩 CursorBench 피크 차 0.5% 기준 공식은 Fable 5·GPT-5.6 Sol 다음 종합 성능
컨텍스트 100만 tokens 100만 tokens 100만 tokens + 네이티브 시각
데이터 보존 기본 강제 없음 30일 보존 동의 필요 Moonshot 정책 따름
오픈 가중치 폐쇄 폐쇄 2026-07-27 공개 예정
컴플라이언스/지정학 낮음(Anthropic 미국 폐쇄) 낮음, 보존 요건 높음 높음(증류 비난 + 칩 수출 규제 논쟁)
적합 용도 일상 Agent, 코딩, 기업 컴플라이언스 극한 지능, 보존·고가 허용 극한 비용, OSS 제어, 논란 허용

두 이슈를 나란히 보면: Opus 5는 「반값으로 플래그십에 근접」해 가성비 요구에 답하고, Kimi K3는 「OSS + 저가」로 시장을 흔듭니다. K3를 둘러싼 논란의 본질은 저가가 엔지니어링 최적화인지, 타사 모델 무단 활용인지를 공개적으로 따지는 것입니다.

05 개발자 6단계: Opus 5 전환과 K3 논란 하의 API 전략

  1. Claude 콘솔 기본 모델 확인: Claude Max / Pro에서 기본이 Opus 5로 바뀌었는지 확인합니다. API 호출 모델 ID를 claude-opus-5로 갱신하고 Bedrock / Vertex / Foundry 별칭도 동기화합니다.
  2. CursorBench 동등 회귀 테스트: 프로덕션 대표 Agent 작업 10–20건(코드 리뷰, 다중 파일 리팩터, CI 스크립트 생성)으로 Opus 4.8 / Opus 5 / Fable 5 합격률과 token 비용을 비교합니다. effort 단계 영향을 기록합니다.
  3. 데이터 보존 조항 재평가: Fable 5의 30일 보존 때문에 미루었다면 Opus 5의 기본 비강제 보존이 기업 이용의 열쇠가 될 수 있습니다. 법무와 Anthropic DPA·약관을 확인합니다.
  4. K3를 유일 프로덕션 백엔드로 두지 않기: 7월 27일 가중치 공개와 제3자 벤치 재현 전까지 K3는 실험 브랜치로 제한합니다. 컴플라이언스 민감 고객에는 「증류 비난 미해결」 리스크를 문서화합니다.
  5. Greenblatt식 정체성 테스트(선택): K3와 각 Claude 모델에 표준화 「당신은 누구」 프롬프트를 보내 claude-opus-4-5-*형 내부 ID 출력을 기록합니다——내부 리스크 관리·벤더 실사 자료로 활용합니다.
  6. Gateway·Agent를 24/7 호스트에: Opus 5, Fable 5, OpenRouter 다중 모델 라우팅이든 Cursor / OpenClaw / 자체 Agent Gateway는 슬립 없는 macOS 베어메탈에서 돌려 노트북 덮개로 인한 webhook 중단을 피합니다.

06 인용 가능 기술 데이터, FAQ, 프로덕션 환경 정리

  • Opus 5 스펙트럼 역분자 구조: Opus 4.8 대비 내부 평가 10.2%p 향상(Anthropic 생명과학 평가).
  • 단백질 서열 변이 기능 예측: Opus 5는 Opus 4.8보다 7.7%p 높습니다.
  • Kimi K3 GPQA-Diamond: 93.5%, 출시 시 OSS 최고(Moonshot 공식).
  • Anthropic 2월 증류 비난: Moonshot에서 340만 회 초과 비정상 API 상호작용 식별, 일부는 경영진까지 추적 가능 주장(Anthropic 공개 성명, Moonshot 미응답).

Opus 5는 입력 $5/100만 tokens, 출력 $25/100만 tokens로 Fable 5($10/$50)의 약 절반입니다. CursorBench 3.2 피크는 Fable 5와 0.5% 미만 차이입니다.

예. 2026-07-24 출시 당일부터 Opus 5가 Claude Max 기본 모델이며 Claude Pro 최상위 모델입니다.

집필 시점 기준 미증명 논란입니다. 백악관 비난에 공개 증거 없음. 독립 연구자는 2주 타임라인에 회의적. Greenblatt의 Claude 자칭·내부 ID 통계가 현재 가장 기술적 간접 증거이나 직접 증명은 아닙니다.

Moonshot은 2026-07-27 공개를 약속했습니다. 집필 시점에는 외부 연구자가 아키텍처·벤치를 완전 독립 검증할 수 없습니다.

일반 개발자와 기업 사용자에게: 용도를 먼저, 입장을 나중에. 컴플라이언스·데이터 보존·공급망 리스크 민감 → Opus 5 「가격 동결·능력 도약」 가성비 우수. 극한 비용·OSS 제어·논란 허용 → 7월 27일 K3 가중치 후 실측.

Opus 5든 멀티모델 Gateway든 노트북 24/7 Agent는 슬립 단절, DerivedData·로그 디스크 압박, 협업 권한 혼선 등 숨은 비용이 있습니다. iOS CI/CD와 AI Agent 자동화에 더 안정적인 프로덕션 환경에는 CALMVPS Mac Mini 베어메탈 대여가 보통 더 나은 선택입니다: Apple Silicon 전용, 120초 배포, 월 단위 유연 계약으로 Gateway와 CI Runner를 상시 온라인 유지할 수 있습니다.

관련 글: Claude Fable 5 수출 규제와 대안 · Kimi K3 아키텍처·벤치마크