/ 블로그 / Grok 4.5 리뷰
ENGINEERING_BLOG · 2026.07.11

Grok 4.5 심층 리뷰:
SpaceXAI 최강 코딩 모델, 정말 Claude Opus의 4분의 1 가격인가?

Cursor 또는 자체 Agent 파이프라인에서 대규모 언어 모델을 고빈도로 호출하는 개발자라면, 2026년 7월 8일 머스크의 SpaceXAI가 출시한 Grok 4.5가 이미 모델 목록에 나타났을 수 있습니다. 머스크는 이를 「Opus급 지능을 몇 분의 일 가격으로」라고 평가했습니다. 본문은 공개 benchmark, 독립 평가, API 요금을 바탕으로 모델 사양, 요금 비교, 프로그래밍·Agent 평가, TryAI 실측 코딩 테스트, 플랫폼 연동, 6단계 실습 가이드, FAQ를 다루어 Grok 4.5 전환 여부를 판단할 수 있게 합니다.

  • 요약: Grok 4.5는 benchmark 1위 코딩 모델은 아니지만, 고빈도 Agent 시나리오에서 Token 효율과 API 요금으로 작업당 비용이 Claude Code의 약 4분의 1(약 $2.49 vs $11.80)입니다.
  • 강점: Cursor 공동 훈련, 50만 Token 컨텍스트, AutomationBench-AA 최초 50% 초과 완료율, 첫 Token <0.5s, 약 110 tokens/s.
  • 약점: SWE-Bench Pro에서 Claude Fable 5 대비 약 16%p 낮음; 환각률 AA-Omniscience 54%; CursorBench는 훈련 데이터 오염으로 철회.
  • 적합: 고빈도 Agent, 터미널류 작업, Cursor 사용 팀, 예산에 민감한 엔지니어링 조직.
  • 주의: 고정밀 다중 파일 리팩터, 금융·보안 크리티컬 코드, EU API 미개방(7월 중순 예정).

SECTION 01 Grok 4.5란? SpaceXAI 플래그십과 Cursor 공동 훈련 배경

Grok 4.5는 SpaceXAI 상장 후 첫 플래그십 모델로, 코딩·코드 Agent, 크로스 도구 자율 워크플로, 법률·의료·교육 등 지식 집약 시나리오에 최적화되었습니다. AI 코딩 도구 Cursor와 공동 훈련되어 수조 Token의 실제 개발자 상호작용 데이터(코드 리뷰, 디버깅 흐름, Agent와 코드베이스 상호작용)가 주입되었습니다. SpaceX는 2026년 6월 Cursor 모회사 Anysphere 인수를 완료했으며, 이번 공동 훈련은 인수 후 첫 성과 중 하나입니다.

Grok 4.5 핵심 사양 요약
항목
아키텍처 Mixture of Experts(MoE, 혼합 전문가)
컨텍스트 윈도 500,000 Tokens(50만)
추론 모드 낮음 / 중간 / 높음(기본: 높음)
추론 속도 공식 80 TPS, 실측 약 90 TPS
훈련 하드웨어 수만 대 NVIDIA GB300 GPU(멤피스 데이터센터)
파라미터 수 비공개(MoE 아키텍처)

SECTION 02 Grok 4.5 요금은? API 단가와 실제 작업 비용 비교

요금은 Grok 4.5의 핵심 selling point입니다. 표시 가격만으로도 Claude Opus보다 낮지만, 진짜 차이는 Token 효율에서 나옵니다. SWE-Bench Pro 프로그래밍 작업에서 Grok 4.5는 평균 15,954 출력 Token을 소비하는 반면 Claude Opus 4.8은 동일 작업에 67,020 Token을 소비해 4.2배 차이가 납니다.

API 단가 비교(per 1M tokens)
모델 입력 출력
Grok 4.5 $2.00 $6.00
Grok 4.5(캐시 히트) $0.50
Grok 4.5 Fast $4.00 $18.00
Claude Opus 4.7 $5.00 $25.00
Claude Fable 5 더 높음 더 높음
GPT-5.6 Sol(플래그십) $5.00 $30.00
GPT-5.6 Luna(경제형) $1.00 $6.00
실제 프로그래밍 Agent 작업당 비용 추정
모델 / 플랫폼 작업당 평균 Token 작업당 실제 비용
Grok 4.5 / Grok Build ~1.9M tokens $2.49
GPT-5.5 / Codex ~6.2M tokens $5.07
Claude Fable 5 / Claude Code ~7.2M tokens $11.80

하루 500회 Agent 작업을 가정하면 Grok 4.5는 약 $1,245/일, Claude Code는 약 $5,900/일입니다. 효율 격차는 호출량에 따라 기하급수적으로 커집니다.

SECTION 03 Grok 4.5 Benchmark 완전 해설: 프로그래밍, Agent, 종합 지능 지수

SpaceXAI는 4개 프로그래밍 관련 벤치마크를 공개했습니다. 공식 데이터와 제3자 독립 테스트를 아래에 정리합니다.

프로그래밍 Benchmark 비교
평가 항목 Grok 4.5 Claude Fable 5 Claude Opus 4.8 GPT-5.5
DeepSWE 1.0(공식 harness) 62.0% 66.1% 55.75% 64.31%
DeepSWE 1.1(중립 harness) 53% 70% 59% 67%
Terminal Bench 2.1 83.3% 84.3% 78.9% 83.4%
SWE-Bench Pro(해결률) 64.7% 80.4% 69.2% 58.6%

해석: DeepSWE 1.1 중립 harness에서 Grok 4.5는 4위로 하락하며 Fable 5가 17%p 앞섭니다. Terminal Bench 2.1에서는 4개 최상위 모델이 5.4%p 이내로 사실상 동률입니다. SWE-Bench Pro는 가장 엄격한 테스트로 Grok 4.5는 3위, Fable 5 대비 약 16%p 낮습니다.

Agent 작업 Benchmark(Grok 4.5 하이라이트):

Agent 및 엔터프라이즈 워크플로 Benchmark
평가 항목 Grok 4.5 Claude Fable 5 Claude Opus 4.8
AutomationBench-AA(657개 엔터프라이즈 워크플로) 51.4% 48.6% 48.5%
Snorkel GDPVal+(전문 업무 시나리오) 29% 21%

AutomationBench-AA는 Gmail, Slack, Salesforce, HubSpot 등 40개 모의 엔터프라이즈 앱을 포함하며, Grok 4.5는 비즈니스 제약을 위반하지 않고 워크플로 목표의 절반 이상을 달성한 최초 모델입니다. Snorkel 평가에서 Grok 4.5는 법률(40% vs 27–28%), 교육(58% vs 35–42%), 의료(35% vs 23–25%)에서 크게 앞섭니다.

종합 지능 지수: Artificial Analysis 종합 지능 지수 54점(4위)로 Fable 5(60), Opus 4.8(56), GPT-5.5(55)에 이어지지만 전 세대 Grok 대비 16점 크게 상승했습니다.

CursorBench 철회 설명: CursorBench(Cursor 자체 평가 세트)는 출시 시 일시 철회되었습니다. Cursor 자체 코드베이스 스냅샷 일부가 Grok 4.5 훈련 데이터에 혼입된 오염 위험이 확인되었으며, 이번 출시의 명확한 흠집입니다.

SECTION 04 실제 코딩 비교와 이용 가능 플랫폼: TryAI 테스트 + Grok Build / Cursor / API

독립 평가 기관 TryAI는 Grok 4.5, GPT-5.5, Claude Opus 4.8, Claude Fable 5에 동일 프롬프트로 동일 인터랙티브 앱을 처음부터 구축하게 했습니다.

  • 3D 큐브 렌더링(최난): Opus 4.8과 Fable 5는 1회 성공; Grok 4.5는 1차에 제목·버튼만 있고 큐브 없음, 재시도 후 성공; GPT-5.5 실패.
  • 속도: Grok 4.5 첫 Token <0.5초, 유량 약 110 tokens/초(경쟁 대비 약 2배).
  • 비용: Grok 4.5가 각 테스트 실행 비용 최저.

결론: 고빈도 반복 코딩 작업에서는 Grok 4.5의 속도·비용 우위가 두드러집니다. 복잡한 상태 관리를 한 번에 처리하는 고정밀 작업에서는 Claude 시리즈가 여전히 더 신뢰할 수 있습니다.

이용 가능 플랫폼(EU 지역 7월 중순 개방 예정):

  • Grok Build: SpaceXAI 자체 Coding Agent 플랫폼, Grok 4.5 기본 모델
  • Cursor: 모든 구독 플랜에서 사용(데스크톱, Web, iOS, CLI, SDK), 출시 후 1주 사용량 2배
  • SpaceXAI Console API: Chat Completions·Responses API 지원, 리전 us-east-1 / us-west-2, 레이트 제한 150 req/s, 50M tokens/min
  • Office 플러그인: Word, PowerPoint, Excel 기본 모델
  • 서드파티 게이트웨이: OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic
api-call.sh
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "이 코드의 버그를 찾아 수정해 주세요: function median(a){a.sort();return a[a.length/2]}"
  }'

SECTION 05 Grok 4.5 연동 방법: Cursor와 API 6단계 실습 가이드

  1. Cursor에서 모델 선택: Cursor 실행 → 모델 선택기 → Grok 4.5 선택(모든 구독 플랜 내장, 첫 주 사용량 2배).
  2. SpaceXAI API Key 발급: SpaceXAI Console 로그인 후 API Keys 페이지에서 키 생성, 계정이 us-east-1 또는 us-west-2 접근 가능한지 확인합니다.
  3. 환경 변수 설정: 로컬 또는 CI에서 export XAI_API_KEY="your-key" 설정, 키를 버전 관리에 커밋하지 마십시오.
  4. Prompt 캐시 활성화: Responses API에서 prompt_cache_key 설정 또는 Chat Completions에서 x-grok-conv-id Header 사용, 입력 가격을 $2.00/M에서 $0.50/M으로 낮춥니다.
  5. 장시간 Agent 루프에 Context Compaction 활성화: 다회 대화 Token 누적을 줄여 고빈도 파이프라인 총비용을 낮춥니다.
  6. 하이브리드 모델 라우팅 구축: 일반 서브태스크는 Grok 4.5, 가장 복잡한 아키텍처 결정은 Claude Fable 5로 라우팅하고 출력 측에 자동 검증을 추가합니다(환각 민감 시나리오 특히).

SECTION 06 전환할 가치가 있는가? 적합 시나리오, 리스크, 인용 가능 데이터

Grok 4.5에 적합한 시나리오:

  • 하루 수백~수천 회 프로그래밍 작업을 실행하는 팀, 비용 절감이 즉각적
  • 터미널류 작업과 도구 호출(Terminal Bench 2.1, AutomationBench 최상위)
  • Cursor에 깊이 통합된 팀, 네이티브 지원으로 원활 전환
  • 스타트업·예산 민감 팀, 유사 지능 수준에서 작업당 비용이 경쟁의 4분의 1 미만
  • 하이브리드 모델 전략: 일반 서브태스크 Grok 4.5, 복잡한 아키텍처 결정 Claude Fable 5

신중히 검토할 시나리오:

  • SWE-Bench Pro급 고정밀 코드 작업(Fable 5가 약 16%p 앞섬)
  • 환각률 민감 시나리오: AA-Omniscience Index 환각률 54%, 프로덕션에서 출력 검증 강화 필요
  • EU 사용자: API는 현재 us-east-1·us-west-2만 이용 가능
  • CursorBench 관련 성능 데이터는 훈련 데이터 오염으로 철회, 독립 재테스트 대기

인용 가능 핵심 데이터:

  • 컨텍스트 윈도: 500,000 tokens
  • SWE-Bench Pro 출력 Token 효율: 15,954(Grok 4.5) vs 67,020(Opus 4.8), 격차 4.2×
  • 1회 Agent 작업 비용: $2.49(Grok 4.5) vs $11.80(Claude Code)
  • AutomationBench-AA: 51.4%, 최초 50% 초과 엔터프라이즈 워크플로 완료율
  • Artificial Analysis 지능 지수: 54점, 전 세대 대비 +16점

로컬 Mac에서 고빈도 Agent 파이프라인을 돌리면 노트북 절전, 네트워크 변동, 멀티태스킹 경합이 7×24 자동화를 끊습니다. 순수 VM에는 Hypervisor 오버헤드와 macOS EULA 제한도 있습니다. 무손실 네이티브 연산력, 안정적 iOS/macOS CI/CD, AI Agent 장기 온라인이 필요한 프로덕션 환경에서는 MACNOX 클라우드 물리 노드가 보통 더 나은 선택입니다. 100% Apple 정품 Mac Mini M4, 완전 Root 권한, 일/주/월 유연 주문, Hypervisor 오버헤드 제로로 Grok Agent와 빌드 파이프라인을 독립 물리 머신에 배포할 수 있습니다. Mac Mini M4 렌탈 vs 구매 비용 비교Claude Code 보안 리스크 대응을 참고하고 요금 페이지에서 플랜을 확인하십시오.

Grok 4.5는 「최강 코딩 모델」은 아니지만 가성비 최고의 Opus급 프로그래밍 Agent입니다. Token 효율과 API 요금을 실제 작업 비용으로 환산하면 주류 Agent 워크플로에서 Opus 4.8에 준하는 품질을 더 낮은 가격으로 달성할 수 있습니다. 정확도 요구가 매우 높은 시나리오(금융 코드, 보안 크리티컬 시스템)에서는 Claude Fable 5가 여전히 더 안전한 선택입니다.

공식·제3자 참고 출처(출시 후 링크를 다시 열어 확인하십시오):

SpaceXAI 공식 발표 — Grok 4.5

Cursor 공동 발표 — Grok 4.5

SpaceXAI 공식 문서 — Grok 4.5 API

TechCrunch — SpaceXAI releases Grok 4.5

Awesome Agents 독립 리뷰 — Grok 4.5

Snorkel AI 전문 시나리오 테스트 — Grok 4.5

SECTION 07 자주 묻는 질문 FAQ

Grok 4.5가 Claude Opus 4.8보다 더 나은가요?

「더 낫다」의 정의에 따라 다릅니다. Opus 4.8은 SWE-Bench Pro 코딩 정확도가 더 높습니다(69.2% vs 64.7%). Grok 4.5는 속도, Token 효율, 작업당 비용에서 앞서며 Agent 워크플로 완료율도 소폭 우위입니다. 고빈도 Agent에는 Grok, 고정밀 1회 코딩에는 Claude가 적합합니다.

Grok 4.5는 무료인가요?

SpaceXAI는 Grok Build와 Cursor에서 기간 한정 무료 할당량을 제공합니다. 이후 API 요금은 입력 $2/M, 출력 $6/M입니다. Cursor 구독 플랜에 모델 풀로 포함됩니다.

Cursor에서 Grok 4.5를 어떻게 사용하나요?

모든 Cursor 플랜에서 자동 이용 가능합니다. Cursor 실행 → 모델 선택 → Grok 4.5 선택. 출시 후 1주간 사용량이 2배입니다.

컨텍스트 윈도는 얼마나 되나요?

500,000 tokens(50만)로 대부분의 대형 코드베이스 작업을 커버합니다.

CursorBench가 철회된 이유는?

Cursor 자체 코드베이스 스냅샷이 Grok 4.5 훈련 데이터에 실수로 포함되어 평가가 오염되었습니다. SpaceXAI는 관련 데이터를 철회하고 독립 재테스트를 기다리고 있습니다.

OpenRouter에서 Grok 4.5를 쓸 수 있나요?

가능합니다. Grok 4.5는 OpenRouter, Vercel AI Gateway, Cloudflare, Snowflake, Databricks Mosaic 등 서드파티 게이트웨이로 접근할 수 있습니다.