/ 블로그 / DeepSeek V4
ENGINEERING_BLOG · 2026.07.20

DeepSeek V4 정식판(GA) 출시:
요금·아키텍처와 GPT-5.6 성능 격차

3개월의 기다림 끝에 DeepSeek V4 정식판(GA)2026년 7월 20일 공식 출시되었습니다. 4월 프리뷰 대비 Agent·수학 추론·코드 생성이 강화되었고, 처음으로 피크·오프피크 차등 요금이 도입되었습니다. 독립 개발자, AI 엔지니어, deepseek-chat을 계속 쓰는 팀을 위해 본문은 프리뷰→GA 타임라인, V4-Pro/Flash의 CSA+HCA·mHC·Muon 아키텍처, 벤치마크, GPT-5.6 / Claude Fable 5 횡단 비교, 피크 요금 절감 전략, 7월 24일 API 마이그레이션 6단계, 인용 가능 기술 데이터, FAQ를 모두 정리합니다.

SECTION 01 DeepSeek V4 GA 전에 개발자가 마주하는 5가지 과제

  • 구 API 종료: deepseek-chatdeepseek-reasoner7월 24일 23:59(베이징 시간)에 영구 중단됩니다. 미이전 프로덕션 코드는 서비스 중단 위험이 있습니다.
  • 피크·오프피크 요금 복잡성: GA는 베이징 시간 평일 피크(09:00–12:00, 14:00–18:00)에 요금이 2배입니다. 배치 추론을 스케줄하지 않으면 예상치 못한 과금이 발생합니다.
  • 프리뷰와 GA 성능 차: 프리뷰도 강력하지만 GA는 Agent 오케스트레이션과 긴 체인 코드 생성에서 추가 개선이 있습니다. 4월 기준 선정 문서는 GA 역량을 과소평가하기 쉽습니다.
  • 폐쇄형 플래그십 비용: Claude Fable 5 출력 약 $50/M, GPT-5.6 Sol 약 $15/M. 고빈도 API 호출 팀은 MIT 오픈소스 자체 호스팅 대안이 절실합니다.
  • 장컨텍스트 구현 장벽: 100만 token 윈도우는 스펙상 쉽지만 병목은 KV Cache 메모리입니다. V4가 V3.2의 10%로 줄이는 이유를 이해해야 합니다.

한 줄 요약: DeepSeek V4 GA는 2026년 오픈소스 LLM의 핵심 이정표입니다. 폐쇄형 플래그십 1/10~1/100 비용으로 오픈소스 모델 중 종합 성능 최상위(SWE-bench Verified 80.6% 기록)를 제공하며, 처음으로 체계적인 피크·오프피크 과금이 도입되었습니다.

SECTION 02 프리뷰에서 정식판까지: DeepSeek V4 출시 연표

DeepSeek V4 주요 마일스톤(2026)
시기 사건
4월 24일 V4 프리뷰 MIT 공개. V4-Pro(1.6T)와 V4-Flash(284B) 포함
5월 V4-Flash / V4-Pro 프로덕션 튜닝 버전 출시, API 정식 제공
6월 V4-Pro 출력 단가 영구 75% 인하($0.87/M tokens)——역대 최고 가성비 구간 확정
6월 29일 전체 API 사용자에 GA 7월 중순 예고 메일. 피크·오프피크 요금 최초 공개
7월 19일 다수 개발자 GA 그레이 테스트 자격 획득. 언론 「정식판 최단 익일 출시」 보도
7월 20일 GA 정식 출시(본문 게시일)
7월 24일 구 API deepseek-chat / deepseek-reasoner 영구 중단

SECTION 03 V4-Pro와 V4-Flash: 100만 token 컨텍스트를 가능하게 한 기술

DeepSeek V4 모델 패밀리 사양 대조
항목 V4-Pro V4-Flash
총 파라미터 1.6조(1.6T) 2840억(284B)
토큰당 활성화 490억(49B) 130억(13B)
Transformer 층 61층 43층
컨텍스트 1,000,000 tokens 1,000,000 tokens
최대 출력 384K tokens 384K tokens
정밀도 FP4(전문가 가중치) + FP8(기타) FP4 + FP8 혼합
사전학습 데이터 33T+ tokens 32T+ tokens
라이선스 MIT MIT

기존 Transformer는 KV Cache 메모리가 컨텍스트 길이에 비례해 100만 token은 사실상 불가능했습니다. DeepSeek V4는 다음 3가지 혁신으로 해결합니다.

  • 하이브리드 어텐션(CSA + HCA): 압축 희소 어텐션(CSA)이 Softmax 게이트 풀링으로 KV 시퀀스를 4배 압축하고, FP4 「라이트닝 인덱서」로 top-k 희소 선택(Pro top-1024, Flash top-512). 최근 128 token 슬라이딩 윈도우 유지. 고압축 어텐션(HCA)은 token을 128배 압축해 글로벌 밀집 어텐션을 수행하며 CSA와 교대 보완. 100만 token 추론 FLOPs는 V3.2의 27%, KV Cache 메모리는 10%(Flash 7%).
  • 다양체 제약 하이퍼커넥션(mHC): 4채널 잔차 스트림 + 이중확률 행렬 제약(Birkhoff 다면체)으로 61층 깊은 네트워크에서도 신호가 안정 전파됩니다.
  • Muon 옵티마이저: AdamW 대신 Muon 채택. 뉴턴–슐츠 직교화로 그래디언트 처리, 수렴이 빠르고 안정적입니다.
3가지 추론 모드
모드 특징 적합 시나리오
Non-think 사고 체인 없음, 최고속 응답 단순 Q&A, 라우팅
Think High 명시적 추론(사고 태그) 중간 복잡도, 코드 디버깅
Think Max 최대 추론 강도, 384K+ 컨텍스트 필요 고난도 수학, 긴 체인 Agent

공식 권장 샘플링: temperature=1.0, top_p=1.0(모든 모드 공통).

SECTION 04 벤치마크: 오픈소스 진영의 성적표

V4-Pro 핵심 벤치마크
벤치마크 DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80.6%(오픈소스 최고) 96.0% 개별 미공개 ~69%
SWE-bench Pro 55.4% 80.3% 78.1% 69.2%
LiveCodeBench (Pass@1) 93.5% 88.1% 87.4% 83.2%
Codeforces Elo 3,206
Terminal-Bench 2.1 83.9% 88.0% 85.1% 82.7%

Artificial Analysis 평가에 따르면 Claude Fable 5는 Strategy & Ops 지수 작업당 $3.48(점수 50), DeepSeek V4-Pro 동종 작업 $0.03(점수 38)——비용 116배 차이, 점수 차 약 12점(31%). V4-Flash는 6류 지수 작업 모두 1회 $0.04 미만입니다.

SECTION 05 DeepSeek V4 vs GPT-5.6 vs Claude Fable 5: 무엇을 선택할까

3대 플래그십 포지셔닝
관점 DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
오픈소스 / 자체 호스팅 MIT, 지원 폐쇄형 폐쇄형
컨텍스트 1M tokens 미공개 1M tokens
API 출력 단가(평시) $0.87/M ~$15/M $50/M
피크 출력 단가 $1.74/M
코드 역량 매우 높음(Fable 5에 근접) 매우 높음 최상(SWE-bench Pro 1위)
데이터 프라이버시 프라이빗 배포 가능 클라우드만 클라우드만
  • 예산·고빈도 호출·자체 호스팅: V4-Pro 또는 V4-Flash 우선.
  • 코드 성능 최우선·비용 무관: Claude Fable 5(SWE-bench Pro 80.3%).
  • 복잡 알고리즘·수학 추론: GPT-5.6 Sol / Ultra.
  • 대규모 로그·문서 저비용 처리: V4-Flash 캐시 히트 입력 $0.0028/M.

SECTION 06 피크·오프피크 요금 계산과 4가지 절감 전략

GA에서 가장 주목받은 변화는 전력 시간대 요금과 유사한 평일 피크 2배 과금입니다(베이징 시간 09:00–12:00, 14:00–18:00).

V4-Pro / V4-Flash 전체 요금표(100만 Token 기준)
모델 과금 항목 평시(Off-Peak) 피크(Peak)
V4-Pro 입력(캐시 히트) ¥0.025 / $0.0035 2배
V4-Pro 입력(캐시 미스) ¥3.00 / $0.435 ¥6.00 / $0.87
V4-Pro 출력 ¥6.00 / $0.87 ¥12.00 / $1.74
V4-Flash 입력(캐시 히트) ¥0.02 / $0.0028 2배
V4-Flash 입력(캐시 미스) ¥1.00 / $0.14 ¥2.00 / $0.28
V4-Flash 출력 ¥2.00 / $0.28 ¥4.00 / $0.56
  • 비실시간 작업은 오프피크로: 배치 문서 처리, 데이터 라벨링, 코드 리뷰는 18:00 이후 또는 09:00 이전 실행.
  • Prompt Cache 활용: V4-Flash 캐시 히트 $0.0028/M. 반복 System Prompt는 구조화해 앞단 고정.
  • Flash로 라우팅: 단순 의도 판별은 V4-Flash, 복잡 추론만 V4-Pro로 에스컬레이션.
  • 이메일 알림 확인: DeepSeek은 요금 변경 24시간 전 메일 통지를 약속합니다.

피크에도 V4-Pro 출력 $1.74/M는 Claude Opus 4.8($15/M)과 GPT-5.6 Sol(약 $15/M)보다 8.6배 저렴합니다.

SECTION 07 deepseek-chat 중단 전 API 마이그레이션: 6단계 실전 가이드

중요: 구 모델명 deepseek-chatdeepseek-reasoner2026년 7월 24일 15:59 UTC(베이징 23:59)에 영구 중단됩니다.

마이그레이션 매핑
구 모델명 신 모델명 비고
deepseek-chat deepseek-v4-flash(비사고 모드) 고속, 경량 작업
deepseek-reasoner deepseek-v4-flash(사고 모드) 또는 deepseek-v4-pro로 더 강한 추론
  1. 구 모델명 전역 검색: 코드, CI 설정, 환경 변수에서 deepseek-chat / deepseek-reasoner 호출 지점을 나열합니다.
  2. 대상 모델 결정: 경량 대화 → deepseek-v4-flash. 복잡 추론 → deepseek-v4-pro + 사고 모드.
  3. OpenAI SDK model 파라미터 갱신: base_urlhttps://api.deepseek.com 유지, model만 변경합니다.
  4. 사고 모드 설정(선택): extra_body로 thinking 활성화. budget_tokens 8000부터 권장.
  5. Staging 검증: 7월 24일 전 E2E 회귀 완료. Agent 긴 체인과 캐시 히트 중점 테스트.
  6. 프로덕션 전환·모니터링: 신 모델명으로 카나리 배포, 피크 시간대 청구와 지연 모니터링.
migrate_api.py
deprecated — 2026-07-24 이후 사용 불가
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

recommended — V4 GA
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4는 OpenAI ChatCompletions와 Anthropic Messages 형식을 모두 지원합니다. Anthropic SDK도 model 갱신과 base_urlhttps://api.deepseek.com으로 지정하면 마이그레이션됩니다.

SECTION 08 인용 가능한 기술 데이터와 공식 출처

  • 오픈소스 기록: SWE-bench Verified 80.6%. Gemini 3.1 Pro와 공동 최고 수준.
  • 컨텍스트 효율: 100만 token 시 KV Cache 메모리 V3.2의 10%(Flash 7%).
  • 가성비: V4-Pro 출력 평시 $0.87/M, 피크 $1.74/M. 폐쇄형 플래그십 대비 대폭 저렴.
  • 마이그레이션 마감: 2026-07-24 23:59 베이징 시간. 구 API 영구 중단.
  • 라이선스: V4-Pro / V4-Flash 모두 MIT. 자체 호스팅·상업 이용 가능.
  • 샘플링: 공식 권장 temperature=1.0, top_p=1.0.

출시 후 링크를 다시 열어 기술 세부와 벤치마크 자료를 확인하세요.

DeepSeek API 공식 문서

arXiv:2606.19348 — DeepSeek V4 기술 논문

Hugging Face: DeepSeek 모델 저장소

Artificial Analysis: 모델 가성비와 Intelligence Index

DeepSeek V4 GA의 가치는 Claude Fable 5나 GPT-5.6을 즉시 능가하는 것이 아니라, 극저비용으로 오픈소스 최강 종합 성능을 제공하는 데 있습니다. 반면 Mac에서 iOS CI/CD, Metal 가속 추론, 7×24 Agent 파이프라인이 필요한 팀에게 API만으로는 ① 데이터 국경 컴플라이언스, ② 로컬 Mac 종료 시 파이프라인 단절, ③ 가상화 macOS의 Hypervisor 오버헤드·Metal 호환 문제가 남습니다. 제로로스 네이티브 Apple 연산, 안정 iOS CI/CD, AI Agent 자동화가 필요한 프로덕션 환경에서는 MACNOX 클라우드 물리 Mac 노드가 더 적합한 선택입니다. 100% 정품 Apple 물리기, 전체 Root, Hypervisor 오버헤드 없음, 일/주/월 유연 계약. 관련 글: Kimi K3 오픈소스 LLM 리뷰, DeepSeek 자체 칩과 연산 인프라, GPT-5.6 Sol Ultra 수학 추론 평가.

SECTION 09 자주 묻는 질문 FAQ

DeepSeek V4 정식판과 프리뷰의 차이는?

아키텍처(MoE + CSA/HCA)는 동일합니다. GA는 Agent·수학 추론·코드 생성을 프로덕션 수준으로 최적화하고 피크·오프피크 요금을 처음 도입했습니다. 프리뷰도 강력하지만 GA는 안정성과 상용 운영 완성도가 한 단계 높습니다.

피크·오프피크 요금의 피크 시간대는?

베이징 시간 평일 09:00–12:00과 14:00–18:00이 피크로 요금 2배입니다. 주말·공휴일은 평시 요금입니다.

V4-Pro와 V4-Flash는 어떻게 구분하나?

Flash는 저렴·고속으로 라우팅·경량 작업에 적합합니다. Pro는 복잡 코드·긴 체인 Agent용입니다. Flash 1차 필터 후 어려운 작업만 Pro로 보내는 구성이 효율적입니다.

deepseek-chat은 언제까지 쓸 수 있나?

2026년 7월 24일 23:59(베이징)에 영구 중단됩니다. 그 전에 deepseek-v4-flash 또는 deepseek-v4-pro로 이전하세요.

DeepSeek V4가 GPT-5.6을 이길 수 있나?

종합 벤치마크에서는 폐쇄형 플래그십이 여전히 앞서지만, V4-Pro는 LiveCodeBench·Codeforces 등 알고리즘 영역에서 우위이며 비용은 GPT-5.6의 약 1/17입니다. 단일 점수보다 시나리오와 예산으로 선택해야 합니다.

DeepSeek V4를 자체 호스팅할 수 있나?

가능합니다. V4-Pro / V4-Flash는 MIT이며 가중치는 Hugging Face에서 받을 수 있습니다. 1.6T MoE 프로덕션 추론에는 대규모 GPU 클러스터가 필요합니다. 자세한 내용은 DeepSeek 연산 인프라를 참고하세요.