DeepSeek V4 Flash 정식판 출시:
Opus 4.8에 근접한 점수, 가격은 수십 분의 일, Pro는 아직 대기

2026년 7월 31일 DeepSeek는 V4-Flash를 공식 정식판(build 0731)으로 승격했습니다. 총 2840억 / 활성 130억 파라미터 규모는 4월 프리뷰와 동일하나, 후학습만 재실행해 여러 Agent 벤치에서 더 큰 V4-Pro 프리뷰를 상회했으며, API 요금은 Claude Opus 4.8의 수십 분의 일 수준입니다. 플래그십 V4-Pro 정식판과 자체 Agent 프레임워크 Harness는 아직 미출시입니다.

본 글은 DeepSeek API 연동, Agent 파이프라인 구축, 국산 오픈소스 LLM 가성비 평가를 담당하는 개발자를 대상으로 합니다. 4~8월 타임라인, 공식·제3자 Intelligence Index 대조, CSA+HCA 아키텍처와 Harness 민감도, Kimi K3·GLM-5.2·Qwen3.8-Max 횡단 비교, 벤치 논란과 「kill line」 가격전 배경을 압축 정리하고 6단계 API 마이그레이션 체크리스트와 FAQ를 제공합니다. 읽은 뒤 Flash vs Pro 선택, 벤치 신뢰도, 구 API 전환 방법을 판단할 수 있어야 합니다.

01 DeepSeek V4 Flash 정식판 타임라인: 4월 프리뷰에서 7월 API 공개까지

이번 릴리스는 「새 아키텍처 출시」가 아니라 동일 284B MoE를 3개월간 연속 개선한 결과입니다. 각 단계가 커뮤니티 논의를 증폭시켰습니다.

  • 2026년 4월 24일: DeepSeek-V4 프리뷰 최초 공개·오픈소스. V4-Pro(총 1.6T / 활성 490억)와 V4-Flash(284B / 130억) 모두 100만 token 컨텍스트, MIT 라이선스.
  • 2026년 7월 24일: 구 모델명 deepseek-chat, deepseek-reasoner 공식 폐기. 전 트래픽 V4 시리즈 명명으로 전환.
  • 2026년 7월 27일: Moonshot AI Kimi K3(총 2.8T) 가중치 Hugging Face 공개. DeepSeek에 직접 경쟁 압력.
  • 2026년 7월 31일: deepseek-v4-flash 정식판(0731) API 공개 테스트, Hugging Face 가중치 동기화. changelog에서 자체 Agent 프레임워크 Harness 최초 명시, V4 정식판과 함께 출시 예정. API 전용——앱·웹은 아직 미동기화.
  • 2026년 8월 5일 기준: V4-Pro 정식판은 「가능한 한 빨리」만 공지, 공식 일정 없음. 일부 중국 매체가 7월 28일 주 내부 테스트·8월 10–20일 GA 창을 보도했으나 DeepSeek 미확인, 참고용입니다.

성능 향상은 파라미터 확대가 아니라 후학습에서 나왔습니다. 284B Flash가 Agent 벤치에서 1.6T V4-Pro 프리뷰를 넘어섰다는 점은 2026년 하반기 경쟁 축이 「파라미터 경쟁」에서 「후학습 품질」로 이동하고 있음을 시사합니다.

02 DeepSeek V4 Flash 요금·경쟁 모델 파라미터 대조(2026년 8월)

아래 요금은 벤더 공개 데이터(자체 보고)입니다. DeepSeek는 향후 API에 베이징 시간 9–12시·14–18시 피크 2배 요금을 예고했으나 발효일은 미공개입니다.

DeepSeek V4 Flash vs 국산 오픈소스 플래그십 요금
모델 상태 총/활성 파라미터 입력(캐시 미스/히트, $/100만 token) 출력($/100만 token)
DeepSeek-V4-Flash-0731공식 정식판(07-31)284B / 13B$0.14 / $0.0028$0.28
DeepSeek-V4-Pro프리뷰(정식판 미출시)1.6T / 49B$0.435 / $0.003625$0.87
Kimi K3가중치 공개(07-27)2.8T / 약 104B(커뮤니티 추정)$3.00 / $0.30$15.00
GLM-5.2오픈소스(2026년 6월)~744B / ~40B본문에서 독립 검증 안 함
Qwen3.8-MaxAPI GA(08-02), 가중치 대기2.4T / 95B$2.00 / ~$0.17–0.25$6.00

제3자 평가 기관 Artificial Analysis의 Intelligence Index와 과업당 비용(경제 매체 인용)은 다른 관점을 제공합니다.

Artificial Analysis 독립 지수 vs 과업당 평균 비용(벤더 자체 벤치와 방법론 상이)
모델 Intelligence Index 과업당 평균 비용
DeepSeek-V4-Flash-073150$0.03
Kimi K357$0.86
GPT-5.6 SolFlash 대비 약 +9점$1.86
Claude Fable 5Flash 대비 약 +9점$3.15

V4-Flash의 지능 점수는 최상위가 아니나, 과업당 비용은 Kimi K3의 약 1/29, Claude Fable 5의 약 1/105입니다. DeepSeek는 「최고 점수」가 아니라 「충분한 지능 + 극한 가격」 전략을 취합니다.

03 후학습이 벤치를 끌어올린 방식: CSA+HCA, Harness, 백만 컨텍스트 효율

아키텍처는 동일, 후학습만 갱신. DeepSeek 공식: V4-Flash-0731은 4월 프리뷰와 파라미터 규모·구조가 완전히 같으며 성능 향상은 후학습 재실행에서만 발생합니다. 기술 보고서《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》의 핵심 설계(4월 프리뷰부터 유지)는 다음과 같습니다.

  • 하이브리드 어텐션(CSA + HCA): 대외 명칭 DSA 희소 어텐션. 장문 컨텍스트 연산·VRAM 부담을 줄입니다.
  • 매니폴드 제약 초연결(mHC): 기존 잔차 연결 구조를 개선합니다.
  • Muon 옵티마이저: 기존 옵티마이저를 대체해 수렴 속도·안정성을 높입니다.

공식 지표(독립 제3자 재현은 아직 없음): 백만 token 컨텍스트에서 V4-Pro의 token당 추론 FLOPs는 V3.2의 27%, KV Cache 점유는 10%입니다.

Harness 최초 공개. 7월 31일 changelog에서 DeepSeek Harness——자체 Agent 실행 프레임워크, Claude Code 대응, 파일 I/O·도구 호출·엔드투엔드 엔지니어링 과업용——가 명명되었습니다. 이전 DeepSeek 모델은 주로 Claude Code, OpenCode 등 제3자 도구에 의존했습니다. 공식 Agent 벤치(Terminal Bench 2.0, Toolathlon 등)는 전부 Harness 「미니멀 모드」(minimal mode)로 측정했으며, max 티어, top_p=0.95, temperature=1.0입니다. changelog는 「벤치가 harness 선택에 매우 민감하다」고 명시했습니다.

21st Century Business Herald가 인용한 해외 개발자 피드백에 따르면 정식판에는 입력 캐시 히트율 저하, 안전 분류기 간헐적 타임아웃 등 가용성 이슈가 있어 「점수 급등」 내러티브와 대비됩니다.

04 Kimi K3·GLM-5.2·Qwen3.8-Max 경쟁과 6단계 API 마이그레이션

V4-Flash-0731은 중국 대형모델 오픈소스 진영이 가장 밀집한 시기에 등장했습니다. Agent·대량 호출 시나리오에서 선정 기준은 「최고 점수」에서 「허용 가능한 지능 하한 내 최저 청구서」로 이동했습니다.

6단계 실무 가이드(V4-Flash-0731 정식판으로 마이그레이션):

  1. 구 모델명 폐기 확인: 7월 24일부터 deepseek-chat / deepseek-reasoner는 사용 중단. deepseek-v4-flash 또는 deepseek-v4-pro(프리뷰)로 교체해야 합니다.
  2. 호출 진입점 확인: 0731 정식판은 API 전용입니다. 앱·웹은 구버전일 수 있으므로 프로덕션은 API changelog를 기준으로 합니다.
  3. SDK 호환 유지: OpenAI ChatCompletions·Anthropic 형식 연동은 코드 변경 없이 deepseek-v4-flash가 신규 정식판을 가리킵니다.
  4. 벤치 2종 구분: SWE-bench Verified 등 제3자가 널리 쓰는 벤치는 신뢰도가 상대적으로 높습니다. Terminal Bench 2.0 등 Agent 벤치는 미공개 Harness에 의존하므로 Claude Code / Cursor와 직접 횡단 비교하지 마세요.
  5. 실제 워크플로 A/B 테스트: 자체 코드베이스·Agent 파이프라인에서 Flash, Kimi K3, Qwen3.8-Max의 성공률·Token 청구서를 비교합니다. 벤더 자체 수치만으로 마이그레이션하지 마세요.
  6. V4-Pro·Harness GA 추적: 공식 changelog는 「가능한 한 빨리」만 명시합니다. 「8월 10–20일」 등 구체 창은 미확인 루머이므로 DeepSeek 공식 계정·api-docs 갱신을 따릅니다.

공식 문서·업데이트 로그(릴리스 후 링크·요금·모델명을 재확인하세요):

https://api-docs.deepseek.com/

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash

05 벤치 논란, kill line, Agent 인프라 선정 정리

  • Terminal Bench 2.0: V4-Flash-0731 벤더 자체 보고 82.7점, V4-Pro 프리뷰 67.9점——모두 미공개 Harness minimal mode 기준이며 「벤더 + 특정 프레임워크」 결과로 봐야 합니다.
  • 가격 배수(21st Century Business Herald 인용): Claude Opus 4.8 대비 캐시 미스 입력 약 36배 저렴, 캐시 히트 입력 약 179배, 출력 약 89배(벤더 표가, 독립 감사 아님).
  • 「kill line」: 중국 개발자 커뮤니티 용어. DeepSeek의 「충분한 성능 + 극단적 저가」 조합이 경쟁사에 설정한 생존 문턱——성능이 뚜렷이 우위가 아니면서 가격도 못 내리면 시장 존재감을 잃을 수 있다는 비유입니다.

자주 묻는 질문 FAQ:

  • Q: V4와 V3.2의 가장 큰 차이는 무엇입니까? A: 네이티브 100만 token 컨텍스트, 장문 FLOPs·KV Cache 대폭 압축, Agent 능력 전용 최적화, Claude Code·OpenCode 등 도구 적합.
  • Q: 일상적으로 Flash와 Pro 중 어느 쪽을 써야 합니까? A: 대량 호출·Agent 파이프라인은 Flash-0731 우선. 더 깊은 세계 지식·복잡 추론은 Pro 프리뷰를 임시 사용하고 정식판 출시 후 재평가합니다.
  • Q: V4-Pro 정식판은 지금 쓸 수 있습니까? A: 8월 5일 기준 불가. 정식판은 Flash-0731뿐이며 API 한정입니다.
  • Q: 벤치 점수를 그대로 믿어도 됩니까? A: 제3자가 널리 쓰는 벤치는 참고 가능. Harness 의존 Agent 벤치는 Claude Code / Cursor로 커뮤니티 독립 재현을 기다리는 것이 안전합니다.

Agent 워크플로를 클라우드 API에만 의존하면 네트워크 지연·Token 비용 변동·모델 라우트 변경이 병목이 됩니다. 순수 로컬 Hugging Face 배포는 통합 메모리 한도·7×24 안정성·다노드 확장에 제약이 있습니다. Claude Code, OpenCode, OpenClaw, Xcode CI/CD를 완전한 macOS 환경에서 7×24 가동해야 하는 팀에게 CALMVPS Mac Mini M4 베어메탈 임대가 일반적으로 더 나은 선택입니다. Apple Silicon 독점, 6개 리전 탄력 전환, 약 120초 배포. 기종·실시간 요금은 CALMVPS 가격 페이지를 확인하세요.

배포 전 최신 요금·벤치·V4-Pro / Harness 출시 상태를 공식 출처와 대조하세요. 본문 데이터는 2026년 8월 5일 기준입니다.