Grok 4.5 종합 리뷰:
SpaceXAI 최강 프로그래밍 모델 — 「Opus급 + 1/4 가격」은 실력인가

2026년 7월 8일, 머스크의 SpaceXAI가 Grok 4.5를 정식 공개했습니다. X에서는 「Opus급 지능에 더 빠르고 Token 효율이 높으며 비용이 낮다」고 선언했습니다.

본문은 AI 프로그래밍 어시스턴트를 평가 중인 개발자, Cursor 사용자, 예산에 민감한 엔지니어링 팀을 대상으로 공개 Benchmark, TryAI 독립 검증, API 가격, 플랫폼 연동을 구조화합니다. Grok 4.5의 강점·약점, 「4배 저렴」이 산술인지 마케팅인지 세 가지 질문에 답합니다.

01 Grok 4.5란 무엇인가 — Cursor 공동 학습과 핵심 스펙

선정 전 흔한 오판:

  • Benchmark 순위만 본다: 공식 harness와 중립 harness 점수 차이가 최대 17%p입니다. 표 하나로는 판단할 수 없습니다.
  • API 단가만 본다: 출력 Token 소비가 4.2배 차이나면 표면 가격이 싸도 태스크 비용은 역전됩니다.
  • 학습 데이터 논란을 무시한다: CursorBench는 데이터 오염으로 철회되었습니다. Cursor 관련 주장은 독립 재검증이 필요합니다.
  • 환각률을 간과한다: AA-Omniscience Index에서 Grok 4.5 환각률은 54%입니다. 프로덕션에서는 검증 계층이 필수입니다.

Grok 4.5는 SpaceXAI 역대 최강 모델로 다음 시나리오에 최적화되어 있습니다.

  • 프로그래밍·코드 Agent: 버그 수정, 대규모 리팩터, 엔드투엔드 앱 개발
  • 자율 워크플로(Agentic Tasks): 도구·앱을 가로지르는 다단계 자동화
  • 지식 집약 업무: 법률, 의료, 교육, 데이터 분석

이번 모델은 단독 개발이 아닙니다. AI 프로그래밍 도구 Cursor와 공동 학습되었으며, 수조 Token 규모의 실제 개발자 상호작용(코드 리뷰, 디버깅, Agent-리포지토리 대화)이 주입되었습니다. SpaceX는 2026년 6월 Cursor 모회사 Anysphere를 인수했으며, 이번 공동 학습은 그 첫 성과 중 하나입니다. 배경은 SpaceX의 Cursor 인수 심층 해설을 참고하세요.

Grok 4.5 핵심 스펙
항목
아키텍처 Mixture of Experts(MoE)
컨텍스트 500,000 Tokens(50만)
추론 모드 낮음 / 중간 / 높음(기본: 높음)
추론 속도 공식 80 TPS, 실측 약 90 TPS
학습 하드웨어 수만 대 NVIDIA GB300 GPU(멤피스 DC)
파라미터 비공개(MoE)

02 Grok 4.5 가격은 얼마인가 — API 단가와 실제 태스크 비용

가격이 Grok 4.5의 핵심 셀링 포인트입니다. API 단가를 먼저 비교하고 Token 효율을 반영한 실제 태스크 비용을 봅니다.

API 단가 비교(100만 Token 기준)
모델 입력 출력
Grok 4.5 $2.00 $6.00
Grok 4.5(캐시 히트) $0.50
Grok 4.5 Fast $4.00 $18.00
Claude Opus 4.7 $5.00 $25.00
Claude Fable 5 더 높음 더 높음
GPT-5.6 Sol(플래그십) $5.00 $30.00
GPT-5.6 Luna(경제) $1.00 $6.00
프로그래밍 Agent 실제 태스크 비용
모델 / 플랫폼 평균 Token 소비 태스크당 실비용
Grok 4.5 / Grok Build 약 1.9M tokens $2.49
GPT-5.5 / Codex 약 6.2M tokens $5.07
Claude Fable 5 / Claude Code 약 7.2M tokens $11.80

SWE-Bench Pro에서 Grok 4.5 평균 출력은 15,954 Token, Claude Opus 4.8은 67,020 Token — 차이 4.2배. 하루 500태스크 기준 Grok 약 $1,245/일, Claude Code 약 $5,900/일. 고빈도 호출에서 격차가 기하급수적으로 커집니다.

03 Grok 4.5 Benchmark — 프로그래밍, Agent, 종합 지수

SpaceXAI는 4개 프로그래밍 평가를 공개했습니다. 공식 데이터와 제3자 테스트를 병기하고 CursorBench 철회 사유를 기록합니다.

프로그래밍 Benchmark
평가 Grok 4.5 Fable 5 Opus 4.8 GPT-5.5
DeepSWE 1.0(공식 harness) 62.0% 66.1% 55.75% 64.31%
DeepSWE 1.1(중립 harness) 53% 70% 59% 67%
Terminal Bench 2.1 83.3% 84.3% 78.9% 83.4%
SWE-Bench Pro 64.7% 80.4% 69.2% 58.6%

해석 포인트:

  • DeepSWE 1.0: Grok 4.5는 3위. 격차는 작습니다.
  • DeepSWE 1.1: 중립 harness에서 4위. Fable 5가 17%p 앞섭니다 — 가장 정직한 횡비교입니다.
  • Terminal Bench 2.1: 상위 4모델이 5.4%p 이내로 사실상 동률입니다.
  • SWE-Bench Pro: 최고난도에서 3위. Fable 5에 약 16%p 뒤집니다.

CursorBench 철회: 출시 시 Cursor 자체 벤치마크 CursorBench가 일시 철회되었습니다. Cursor 코드베이스 스냅샷이 Grok 4.5 학습 데이터에 유입된 것으로 보이며 데이터 오염 위험이 있습니다. 관련 수치는 독립 재검증을 기다려야 합니다.

Agent Benchmark(Grok 4.5 강점)
평가 Grok 4.5 Fable 5 Opus 4.8
AutomationBench-AA(657 워크플로) 51.4% 48.6% 48.5%
Snorkel GDPVal+(전문 업무) 29% 21%

AutomationBench-AA는 Gmail, Slack, Salesforce, HubSpot 등 40개 모의 기업 앱을 포함하며, Grok 4.5는 업무 제약을 위반하지 않고 절반 이상의 워크플로 목표를 달성한 최초 모델입니다. Snorkel 전문 평가에서는 법률(40% vs 27–28%), 교육(58% vs 35–42%), 의료(35% vs 23–25%)에서 크게 앞섭니다.

Artificial Analysis 종합 지수: Grok 4.5는 54점(4위). Fable 5(60), Opus 4.8(56), GPT-5.5(55) 뒤이지만 전세대 Grok 대비 16점 상승했습니다.

04 TryAI 실측과 Cursor / API 6단계 연동

독립 기관 TryAI는 Grok 4.5, GPT-5.5, Claude Opus 4.8, Claude Fable 5에 동일 프롬프트로 동일 인터랙티브 앱 구축을 요청했습니다.

TryAI 3D 큐브 렌더링(최난이도)
모델 결과
Opus 4.8 / Fable 5 1회 성공
Grok 4.5 1차는 제목·버튼만, 큐브 없음. 재시도 후 성공
GPT-5.5 실패

속도와 비용: 첫 Token 0.5초 미만, 처리량 약 110 tokens/초(경쟁 대비 약 2배). GPT-5.5는 짧은 답변이 가장 빠르고, Fable 5는 가장 느리고 비쌉니다. 고빈도 반복 작업에서는 Grok 4.5의 속도·비용 우위가 큽니다. 복잡한 상태 관리를 한 번에 끝내는 고정밀 작업에서는 Claude 계열이 여전히 신뢰할 수 있습니다.

이용 가능 플랫폼(EU는 7월 중순 예정):

  • Grok Build: SpaceXAI 자체 Coding Agent, Grok 4.5 기본 모델
  • Cursor: 모든 구독 플랜(데스크톱, Web, iOS, CLI, SDK), 출시 첫 주 사용량 2배
  • SpaceXAI Console API: Chat Completions 및 Responses API
  • Office 플러그인: Word, PowerPoint, Excel 기본 모델
  • 서드파티: OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic

API 리전: us-east-1, us-west-2. 속도 제한 150 req/s, 50M tokens/분.

api-quickstart.sh
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "이 코드의 버그를 찾아 수정해 주세요: function median(a){a.sort();return a[a.length/2]}"
  }'

6단계 도입 가이드:

  1. SpaceXAI Console 가입: console.x.ai에서 계정 생성 및 API Key 발급. 청구 리전이 us-east-1 또는 us-west-2인지 확인합니다.
  2. Cursor 모델 전환: Cursor → 모델 선택 → Grok 4.5. 첫 주 사용량 2배로 실제 워크플로를 부하 테스트할 수 있습니다.
  3. 캐시 키 설정: Responses API에 prompt_cache_key, Chat Completions에는 x-grok-conv-id Header. 히트 시 입력 단가 $0.50/M tokens까지 하락합니다.
  4. 장기 Agent 루프에 Context Compaction: Token 누적을 줄여 고빈도 태스크 총비용을 관리합니다.
  5. 하이브리드 라우팅: 일반 서브태스크는 Grok 4.5, 어려운 아키텍처 결정은 Claude Fable 5. Cursor 또는 LiteLLM에서 fallback을 구성합니다.
  6. 프로덕션 출력 검증: SWE-Bench Pro급 고정밀 태스크와 환각 민감 시나리오에는 CI 게이트와 수동 리뷰를 추가하고 첫 출력을 맹신하지 마세요.

05 Grok 4.5로 전환할까 — 선정 매트릭스, FAQ, 결론

적합 시나리오와 주의점
시나리오 권장 이유
고빈도 Agent(수백~수천 회/일) 우선 검토 태스크 약 $2.49 vs $11.80, 비용 절감 즉시 체감
터미널·도구 호출 우선 검토 Terminal Bench 2.1, AutomationBench 최상위권
Cursor 깊은 통합 팀 우선 검토 공동 학습, 네이티브 지원, 매끄러운 전환
하이브리드 모델 전략 권장 일상은 Grok, 최난 아키텍처는 Fable 5
SWE-Bench Pro급 고정밀 코드 신중 Fable 5가 약 16%p 앞섬, 격차는 실재
환각률 민감 프로덕션 신중 AA-Omniscience 환각률 54%, 검증 필수
EU 사용자 대기 API는 us-east-1 / us-west-2만, EU 미개방
CursorBench 관련 주장 보류 학습 데이터 오염, 결과 철회

인용 가능 데이터(EEAT):

  • Token 효율: SWE-Bench Pro 출력 Token Grok 4.5 15,954 vs Opus 4.8 67,020, 4.2배 차이(SpaceXAI 공식, 2026-07-08).
  • 추론 속도: 첫 Token 500ms 미만, 처리량 약 110 tokens/s, 경쟁 대비 약 2배(TryAI 독립 검증).
  • 종합 지수: Artificial Analysis 54점, 전세대 대비 +16, 4위(Artificial Analysis, 2026-07).

FAQ:

  • Q: Grok 4.5가 Claude Opus 4.8보다 나은가요? A: 지표에 따라 다릅니다. Opus 4.8은 SWE-Bench Pro 정확도가 더 높습니다(69.2% vs 64.7%). Grok 4.5는 속도·Token 효율·태스크 비용에서 최대 4배 유리한 경우가 많습니다. Agent 워크플로 완료율에서는 독립 Benchmark에서 Opus 4.8을 소폭 앞섭니다.
  • Q: Grok 4.5는 무료인가요? A: Grok Build와 Cursor에 기간 한정 무료 할당이 있었습니다. API 정식 가격은 입력 $2/M, 출력 $6/M입니다. Cursor 구독에 모델 풀로 포함됩니다.
  • Q: Cursor에서 Grok 4.5를 쓰려면? A: 모든 Cursor 플랜에서 자동 이용 가능합니다. 모델 선택기에서 Grok 4.5를 고르면 됩니다. 출시 첫 주 사용량 2배입니다.
  • Q: 컨텍스트 창은 얼마나 큰가요? A: 500,000 tokens(500K). 대부분의 대규모 코드베이스 작업을 커버합니다.
  • Q: CursorBench는 왜 철회되었나요? A: Cursor 코드베이스 스냅샷이 학습 데이터에 유입되어 벤치마크를 오염시켰습니다. SpaceXAI가 결과를 철회하고 독립 재검증을 기다리고 있습니다.
  • Q: OpenRouter로 쓸 수 있나요? A: 가능합니다. Vercel AI Gateway, Cloudflare, Snowflake, Databricks Mosaic도 지원합니다.

결론: Grok 4.5는 「최강 프로그래밍 모델」은 아니지만 가성비 최고의 Opus급 프로그래밍 Agent입니다. Token 효율과 API 가격을 실제 태스크 비용으로 환산하면 주류 Agent 워크플로에서 Opus 4.8에 근접한 품질을 70–80% 이하 가격으로 수행할 수 있는 경우가 많습니다. 금융 코드·안전 핵심 시스템은 여전히 Claude Fable 5를 권장합니다.

주요 출처 — 상류 업데이트 후 링크를 다시 확인하세요:

https://x.ai/news/grok-4-5

https://cursor.com/blog/grok-4-5

https://docs.x.ai/developers/models/grok-4.5

https://techcrunch.com/2026/07/08/spacexai-releases-grok-4-5-which-elon-describes-as-an-opus-class-model/

https://snorkel.ai/blog/grok-4-5-testing-results-how-spacexais-new-model-performs-on-real-professional-work/

개인 노트북에서 Grok 4.5를 돌리면 슬립으로 긴 Agent 루프가 끊기고, 다중 리포지토리 병렬 처리가 로컬 자원을 경쟁하며, 기업에서는 감사 경계를 통일하기 어렵습니다. Cursor Agent, Codex CI, OpenClaw Gateway를 24/7 안정 운영하는 프로덕션 환경에서는 CALMVPS 베어메탈 Mac Mini 대여가 일반적으로 더 적합합니다. 전용 Apple Silicon, Metal 네이티브 가속, 월 단위 유연 과금, 약 120초 프로비저닝으로 무거운 Agent 실행을 클라우드에 오프로드하고 로컬은 Plan 승인에 집중할 수 있습니다. 가격 페이지를 확인하세요.