DeepSeek V4 GA 정식 출시:
가격·아키텍처·GPT-5.6 대비 성능

3개월간의 프리뷰 기간을 거쳐 DeepSeek V4 GA(정식판)가 2026년 7월 20일 공식 출시되었습니다. 4월 프리뷰 대비 Agent 역량, 수학 추론, 코드 생성이 집중 개선되었고, DeepSeek이 처음으로 피크·오프피크 차등 요금을 도입했습니다. 이는 「거의 무료」에서 체계적인 상용화로의 전환을 의미합니다.

본문은 API 선정, 오픈 가중치, 프로덕션 비용 통제를 검토 중인 AI 개발자와 프로덕트 팀을 대상으로 기술 아키텍처, 벤치마크, 요금 정책, GPT-5.6·Claude Fable 5 횡비교, 7월 24일 마감 API 마이그레이션 다섯 축으로 정리합니다.

01 DeepSeek V4 GA 출시: 프리뷰에서 정식판까지의 타임라인

선정 전 실제 리스크:

  • 구 모델명 곧 만료: deepseek-chatdeepseek-reasoner는 7월 24일 영구 중단됩니다. 마이그레이션하지 않은 프로덕션 코드는 즉시 중단됩니다.
  • 피크·오프피크 요금 복잡도: 평일 09:00–12:00, 14:00–18:00(베이징 시간) 요금이 2배입니다. 24/7 Agent 파이프라인은 스케줄 재설계가 필요합니다.
  • 프리뷰와 GA 성능 차: GA는 Agent·수학·코드에 특화 개선이 있습니다. 4월 기준으로 의사결정하면 안 됩니다.
  • Pro vs Flash 라우팅 혼선: 1.6T와 284B 스펙 차이가 큽니다. 잘못된 라우팅은 예산 낭비 또는 품질 저하로 이어집니다.
DeepSeek V4 주요 타임라인
일자 이벤트
2026-04-24 V4 프리뷰 출시 + MIT 오픈소스(V4-Pro 1.6T, V4-Flash 284B)
2026-05 V4-Flash·V4-Pro 프로덕션 튜닝판 출시, API 정식 가동
2026-06 V4-Pro 출력 단가 75% 영구 인하 → $0.87/M tokens
2026-06-29 DeepSeek 전체 API 사용자에 GA 7월 중순·피크·오프피크 요금 최초 공지
2026-07-19 다수 개발자 GA 그레이스케일 자격, 「정식판 내일 출시」 보도
2026-07-20 GA 정식판 출시(본문 발행일)
2026-07-24 구 모델명 deepseek-chat / deepseek-reasoner 영구 중단

한 줄 요약: V4 프리뷰만으로도 강력했으나, GA는 Agent·수학·코드에 특화 개선을 더하고 정식 상용 요금 체계를 갖추었습니다.

02 DeepSeek V4 아키텍처: CSA·HCA와 100만 token 컨텍스트

V4-Pro vs V4-Flash 스펙 대조
항목 V4-Pro V4-Flash
총 파라미터 1.6조(1.6T) 2840억(284B)
토큰당 활성 파라미터 490억(49B) 130억(13B)
Transformer 레이어 61층 43층
컨텍스트 창 1,000,000 tokens 1,000,000 tokens
최대 출력 384K tokens 384K tokens
정밀도 FP4(전문가 가중치) + FP8(기타) FP4 + FP8 혼합
사전학습 데이터 33T+ tokens 32T+ tokens
오픈소스 라이선스 MIT MIT

DeepSeek V4는 V2/V3 시대의 MLA(다중 잠재 어텐션)를 버리고 두 가지 신규 어텐션 메커니즘의 하이브리드를 채택했습니다.

  • 압축 희소 어텐션(CSA): Softmax 게이트 풀링으로 KV 시퀀스를 4배 압축한 뒤 FP4 정밀도 「라이트닝 인덱서」로 top-k 희소 선택(Pro는 top-1024, Flash는 top-512)을 수행합니다. 최근 128 token 슬라이딩 윈도우를 유지합니다. 1M 컨텍스트에서 V3.2 대비 추론 FLOPs는 27%만 필요합니다.
  • 고압축 어텐션(HCA): 토큰을 128배 압축한 뒤 전역 밀집 어텐션으로 장거리 의존성을 포착하며 CSA와 상호 보완합니다. V4-Flash는 초기 2층 HCA, 이후 CSA/HCA 교차 배치이며 V4-Pro도 유사합니다.
  • 매니폴드 제약 초연결(mHC): 4채널 잔차 스트림과 이중 확률 행렬 제약 혼합 행렬로 61층 깊은 네트워크에서 신호 전파를 안정화합니다.
  • Muon 옵티마이저: AdamW 대신 Muon을 사용하며 뉴턴-슐츠 직교화로 그래디언트를 처리해 수렴 속도와 학습 안정성을 높입니다.

종합 효과: 1M token 시나리오에서 KV Cache 메모리는 V3.2의 10%에 불과하며(V4-Flash는 7%), 장문 Agent·로그 분석 워크로드에 실질적 이점이 있습니다.

세 가지 추론 모드
모드 특징 적합 시나리오
Non-think 추론 체인 없음, 초고속 응답 단순 Q&A, 라우팅 분기
Think High 명시적 추론(thinking 태그) 중간 복잡도 작업, 코드 디버깅
Think Max 최대 추론 강도, 384K+ 컨텍스트 필요 복잡한 수학, 장기 Agent

공식 권장 샘플링 파라미터: temperature=1.0, top_p=1.0(모든 모드 공통).

03 DeepSeek V4 벤치마크: GPT-5.6·Claude Fable 5와 어떻게 비교할까

V4-Pro 핵심 벤치마크
벤치마크 DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80.6%(오픈소스 최고) 96.0% 별도 미공개 ~69%
SWE-bench Pro 55.4% 80.3% 78.1% 69.2%
LiveCodeBench (Pass@1) 93.5% 88.1% 87.4% 83.2%
Codeforces Elo 3,206
Terminal-Bench 2.1 83.9% 88.0% 85.1% 82.7%

Artificial Analysis 평가에 따르면 Claude Fable 5는 Strategy & Ops 지수 과제당 $3.48(50점), DeepSeek V4-Pro는 동급 과제당 $0.03(38점)입니다. Fable 5 비용은 V4-Pro의 116배이며 점수 차이는 약 12점입니다.

세 플래그십 포지셔닝 비교
차원 DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
오픈소스 / 자체 호스팅 MIT, 지원 폐쇄 폐쇄
컨텍스트 창 1M tokens 미공개 1M tokens
API 출력가(오프피크) $0.87/M ~$15/M $50/M
API 출력가(피크) $1.74/M
코드 역량 매우 강함(Fable 5에 근접) 매우 강함 최강(SWE-bench Pro 선행)
데이터 프라이버시 프라이빗 배포 가능 불가 불가

시나리오별 권장: 예산 제약·고빈도 호출·프라이빗 배포 → V4-Pro 또는 V4-Flash; 극한 코드 품질·비용 무관 → Claude Fable 5; 복잡 알고리즘·수학 추론 → GPT-5.6 Sol/Ultra; 대규모 로그 일괄 처리 → V4-Flash(캐시 히트 입력 $0.0028/M).

04 DeepSeek V4 피크·오프피크 요금: 계산법과 절감 전략

GA에서 가장 주목받는 변화는 DeepSeek의 피크·오프피크 차등 요금 도입입니다. 전력 요금제와 유사합니다. 피크 시간(베이징 시간)은 평일 09:00–12:00, 14:00–18:00이며 요금이 2배입니다.

V4-Pro / V4-Flash 전체 가격표
모델 항목 오프피크 피크
V4-Pro 입력(캐시 히트) ¥0.025 / $0.0035 / 1M 2배
V4-Pro 입력(캐시 미스) ¥3.00 / $0.435 / 1M ¥6.00 / $0.87 / 1M
V4-Pro 출력 ¥6.00 / $0.87 / 1M ¥12.00 / $1.74 / 1M
V4-Flash 입력(캐시 히트) ¥0.02 / $0.0028 / 1M 2배
V4-Flash 입력(캐시 미스) ¥1.00 / $0.14 / 1M ¥2.00 / $0.28 / 1M
V4-Flash 출력 ¥2.00 / $0.28 / 1M ¥4.00 / $0.56 / 1M

절감 네 가지 전략:

  • 비실시간 작업을 오프피크로: 문서 일괄 처리, 데이터 라벨링, 코드 리뷰를 18:00 이후 또는 09:00 이전에 배치합니다.
  • 캐시 히트 활용: 반복 System Prompt로 Prompt Cache를 구성합니다. V4-Flash 캐시 히트 비용은 $0.0028/M입니다.
  • Flash로 1차 분기: 단순 의도 분류·라우팅은 V4-Flash, 복잡 추론은 V4-Pro로 넘깁니다.
  • 청구 알림 확인: DeepSeek은 요금 변경 24시간 전 이메일 통지를 약속합니다.

피크 시간에도 V4-Pro 출력가($1.74/M)는 Claude Opus 4.8($15/M)과 GPT-5.6 Sol(약 $15/M) 대비 8.6배 저렴합니다.

05 deepseek-chat 중단 마이그레이션 가이드(7월 24일 마감)

중요: 구 모델명 deepseek-chatdeepseek-reasoner2026년 7월 24일 15:59 UTC(베이징 7월 24일 23:59)에 영구 중단됩니다.

API 마이그레이션 매핑
구 모델명 신 모델명 비고
deepseek-chat deepseek-v4-flash(Non-think) 고속, 경량 작업 적합
deepseek-reasoner deepseek-v4-flash(Think 모드) 또는 deepseek-v4-pro로 업그레이드
deepseek_v4_migration.py
구버전 (7월 24일 이후 중단)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

신버전
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4는 OpenAI ChatCompletions와 Anthropic Messages 형식을 모두 지원합니다. base_url은 그대로 두고 model 파라미터만 갱신하면 됩니다.

주요 공식 출처입니다. 업스트림 갱신 후 링크를 다시 확인하세요.

https://api-docs.deepseek.com

https://arxiv.org/abs/2606.19348

https://huggingface.co/deepseek-ai

6단계 마이그레이션 체크리스트:

  1. 구 모델명 전역 검색: 코드 저장소, CI 설정, 환경 변수에서 deepseek-chatdeepseek-reasoner를 찾습니다.
  2. 대체 매핑 확정: 경량 대화는 deepseek-v4-flash(Non-think), 추론 작업은 Flash Think 모드 또는 deepseek-v4-pro로 분기합니다.
  3. SDK 호출 갱신: OpenAI 호환 API는 model만 변경합니다. Anthropic SDK도 base_url=https://api.deepseek.com 유지합니다.
  4. Think 모드 설정: 기존 reasoner 사용자는 extra_body로 thinking을 활성화합니다. Think Max는 384K+ 컨텍스트가 필요합니다.
  5. 스테이징 검증: 7월 24일 전 E2E 테스트를 완료하고 피크·오프피크 요금이 예산에 미치는 영향을 확인합니다.
  6. 오프피크 배치 스케줄: 문서 일괄 처리·코드 리뷰를 18:00 이후 또는 주말 cron으로 배치하고 Prompt Cache와 결합해 비용을 최소화합니다.

인용 가능 데이터(EEAT):

  • SWE-bench Verified 80.6%: 오픈소스 모델 최고점, Gemini 3.1 Pro와 동률(출처: DeepSeek 공식 문서, 2026-07).
  • KV Cache 메모리 10%: 1M token 시나리오에서 V3.2의 10%, V4-Flash는 7%(출처: arXiv:2606.19348).
  • 116배 비용 효율: Artificial Analysis Strategy & Ops 과제, V4-Pro $0.03/회 vs Fable 5 $3.48/회(출처: Artificial Analysis, 2026-07).

결론: DeepSeek V4 GA의 가치는 Claude Fable 5나 GPT-5.6을 모든 벤치마크에서 이기는 데 있지 않습니다. 폐쇄 플래그십 대비 1/10~1/100 비용으로 오픈소스 최강 성능을 제공하는 데 있습니다. 피크·오프피크 요금은 복잡도를 높이지만 여전히 경쟁력이 큽니다.

DeepSeek V4 API를 로컬 OpenClaw Gateway나 Cursor Agent에 연결하면 개인 Mac 슬립으로 SWE-bench급 장기 작업이 끊기고, 피크 시간 24/7 파이프라인을 노트북에서 안정적으로 돌리기 어렵습니다. 순수 API 호출은 로컬 GPU가 필요 없지만, 하이브리드 아키텍처(로컬 Gateway + 클라우드 추론 + 7×24 오케스트레이션 노드)를 쓰는 프로덕션 팀은 Agent 상시 가동 호스트 부재로 자주 막힙니다. AI 프로그래밍 Agent, OpenClaw 다중 모델 라우팅, 장시간 Agent 루프 7×24 안정 운영이 필요한 환경에서는 CALMVPS 베어메탈 Mac Mini 대여가 일반적으로 더 적합합니다. 전용 Apple Silicon, Metal 네이티브 가속, 월 단위 유연 과금, 약 120초 프로비저닝. 가격 페이지를 확인하세요.