3개월의 기다림 끝에 DeepSeek V4 정식판(GA)이 2026년 7월 20일 공식 출시되었습니다. 4월 프리뷰 대비 Agent·수학 추론·코드 생성이 강화되었고, 처음으로 피크·오프피크 차등 요금이 도입되었습니다. 독립 개발자, AI 엔지니어, deepseek-chat을 계속 쓰는 팀을 위해 본문은 프리뷰→GA 타임라인, V4-Pro/Flash의 CSA+HCA·mHC·Muon 아키텍처, 벤치마크, GPT-5.6 / Claude Fable 5 횡단 비교, 피크 요금 절감 전략, 7월 24일 API 마이그레이션 6단계, 인용 가능 기술 데이터, FAQ를 모두 정리합니다.
SECTION 01 DeepSeek V4 GA 전에 개발자가 마주하는 5가지 과제
- 구 API 종료:
deepseek-chat과deepseek-reasoner는 7월 24일 23:59(베이징 시간)에 영구 중단됩니다. 미이전 프로덕션 코드는 서비스 중단 위험이 있습니다. - 피크·오프피크 요금 복잡성: GA는 베이징 시간 평일 피크(09:00–12:00, 14:00–18:00)에 요금이 2배입니다. 배치 추론을 스케줄하지 않으면 예상치 못한 과금이 발생합니다.
- 프리뷰와 GA 성능 차: 프리뷰도 강력하지만 GA는 Agent 오케스트레이션과 긴 체인 코드 생성에서 추가 개선이 있습니다. 4월 기준 선정 문서는 GA 역량을 과소평가하기 쉽습니다.
- 폐쇄형 플래그십 비용: Claude Fable 5 출력 약 $50/M, GPT-5.6 Sol 약 $15/M. 고빈도 API 호출 팀은 MIT 오픈소스 자체 호스팅 대안이 절실합니다.
- 장컨텍스트 구현 장벽: 100만 token 윈도우는 스펙상 쉽지만 병목은 KV Cache 메모리입니다. V4가 V3.2의 10%로 줄이는 이유를 이해해야 합니다.
한 줄 요약: DeepSeek V4 GA는 2026년 오픈소스 LLM의 핵심 이정표입니다. 폐쇄형 플래그십 1/10~1/100 비용으로 오픈소스 모델 중 종합 성능 최상위(SWE-bench Verified 80.6% 기록)를 제공하며, 처음으로 체계적인 피크·오프피크 과금이 도입되었습니다.
SECTION 02 프리뷰에서 정식판까지: DeepSeek V4 출시 연표
| 시기 | 사건 |
|---|---|
| 4월 24일 | V4 프리뷰 MIT 공개. V4-Pro(1.6T)와 V4-Flash(284B) 포함 |
| 5월 | V4-Flash / V4-Pro 프로덕션 튜닝 버전 출시, API 정식 제공 |
| 6월 | V4-Pro 출력 단가 영구 75% 인하($0.87/M tokens)——역대 최고 가성비 구간 확정 |
| 6월 29일 | 전체 API 사용자에 GA 7월 중순 예고 메일. 피크·오프피크 요금 최초 공개 |
| 7월 19일 | 다수 개발자 GA 그레이 테스트 자격 획득. 언론 「정식판 최단 익일 출시」 보도 |
| 7월 20일 | GA 정식 출시(본문 게시일) |
| 7월 24일 | 구 API deepseek-chat / deepseek-reasoner 영구 중단 |
SECTION 03 V4-Pro와 V4-Flash: 100만 token 컨텍스트를 가능하게 한 기술
| 항목 | V4-Pro | V4-Flash |
|---|---|---|
| 총 파라미터 | 1.6조(1.6T) | 2840억(284B) |
| 토큰당 활성화 | 490억(49B) | 130억(13B) |
| Transformer 층 | 61층 | 43층 |
| 컨텍스트 | 1,000,000 tokens | 1,000,000 tokens |
| 최대 출력 | 384K tokens | 384K tokens |
| 정밀도 | FP4(전문가 가중치) + FP8(기타) | FP4 + FP8 혼합 |
| 사전학습 데이터 | 33T+ tokens | 32T+ tokens |
| 라이선스 | MIT | MIT |
기존 Transformer는 KV Cache 메모리가 컨텍스트 길이에 비례해 100만 token은 사실상 불가능했습니다. DeepSeek V4는 다음 3가지 혁신으로 해결합니다.
- 하이브리드 어텐션(CSA + HCA): 압축 희소 어텐션(CSA)이 Softmax 게이트 풀링으로 KV 시퀀스를 4배 압축하고, FP4 「라이트닝 인덱서」로 top-k 희소 선택(Pro top-1024, Flash top-512). 최근 128 token 슬라이딩 윈도우 유지. 고압축 어텐션(HCA)은 token을 128배 압축해 글로벌 밀집 어텐션을 수행하며 CSA와 교대 보완. 100만 token 추론 FLOPs는 V3.2의 27%, KV Cache 메모리는 10%(Flash 7%).
- 다양체 제약 하이퍼커넥션(mHC): 4채널 잔차 스트림 + 이중확률 행렬 제약(Birkhoff 다면체)으로 61층 깊은 네트워크에서도 신호가 안정 전파됩니다.
- Muon 옵티마이저: AdamW 대신 Muon 채택. 뉴턴–슐츠 직교화로 그래디언트 처리, 수렴이 빠르고 안정적입니다.
| 모드 | 특징 | 적합 시나리오 |
|---|---|---|
| Non-think | 사고 체인 없음, 최고속 응답 | 단순 Q&A, 라우팅 |
| Think High | 명시적 추론(사고 태그) | 중간 복잡도, 코드 디버깅 |
| Think Max | 최대 추론 강도, 384K+ 컨텍스트 필요 | 고난도 수학, 긴 체인 Agent |
공식 권장 샘플링: temperature=1.0, top_p=1.0(모든 모드 공통).
SECTION 04 벤치마크: 오픈소스 진영의 성적표
| 벤치마크 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6%(오픈소스 최고) | 96.0% | 개별 미공개 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
Artificial Analysis 평가에 따르면 Claude Fable 5는 Strategy & Ops 지수 작업당 $3.48(점수 50), DeepSeek V4-Pro 동종 작업 $0.03(점수 38)——비용 116배 차이, 점수 차 약 12점(31%). V4-Flash는 6류 지수 작업 모두 1회 $0.04 미만입니다.
SECTION 05 DeepSeek V4 vs GPT-5.6 vs Claude Fable 5: 무엇을 선택할까
| 관점 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 오픈소스 / 자체 호스팅 | MIT, 지원 | 폐쇄형 | 폐쇄형 |
| 컨텍스트 | 1M tokens | 미공개 | 1M tokens |
| API 출력 단가(평시) | $0.87/M | ~$15/M | $50/M |
| 피크 출력 단가 | $1.74/M | — | — |
| 코드 역량 | 매우 높음(Fable 5에 근접) | 매우 높음 | 최상(SWE-bench Pro 1위) |
| 데이터 프라이버시 | 프라이빗 배포 가능 | 클라우드만 | 클라우드만 |
- 예산·고빈도 호출·자체 호스팅: V4-Pro 또는 V4-Flash 우선.
- 코드 성능 최우선·비용 무관: Claude Fable 5(SWE-bench Pro 80.3%).
- 복잡 알고리즘·수학 추론: GPT-5.6 Sol / Ultra.
- 대규모 로그·문서 저비용 처리: V4-Flash 캐시 히트 입력 $0.0028/M.
SECTION 06 피크·오프피크 요금 계산과 4가지 절감 전략
GA에서 가장 주목받은 변화는 전력 시간대 요금과 유사한 평일 피크 2배 과금입니다(베이징 시간 09:00–12:00, 14:00–18:00).
| 모델 | 과금 항목 | 평시(Off-Peak) | 피크(Peak) |
|---|---|---|---|
| V4-Pro | 입력(캐시 히트) | ¥0.025 / $0.0035 | 2배 |
| V4-Pro | 입력(캐시 미스) | ¥3.00 / $0.435 | ¥6.00 / $0.87 |
| V4-Pro | 출력 | ¥6.00 / $0.87 | ¥12.00 / $1.74 |
| V4-Flash | 입력(캐시 히트) | ¥0.02 / $0.0028 | 2배 |
| V4-Flash | 입력(캐시 미스) | ¥1.00 / $0.14 | ¥2.00 / $0.28 |
| V4-Flash | 출력 | ¥2.00 / $0.28 | ¥4.00 / $0.56 |
- 비실시간 작업은 오프피크로: 배치 문서 처리, 데이터 라벨링, 코드 리뷰는 18:00 이후 또는 09:00 이전 실행.
- Prompt Cache 활용: V4-Flash 캐시 히트 $0.0028/M. 반복 System Prompt는 구조화해 앞단 고정.
- Flash로 라우팅: 단순 의도 판별은 V4-Flash, 복잡 추론만 V4-Pro로 에스컬레이션.
- 이메일 알림 확인: DeepSeek은 요금 변경 24시간 전 메일 통지를 약속합니다.
피크에도 V4-Pro 출력 $1.74/M는 Claude Opus 4.8($15/M)과 GPT-5.6 Sol(약 $15/M)보다 8.6배 저렴합니다.
SECTION 07 deepseek-chat 중단 전 API 마이그레이션: 6단계 실전 가이드
중요: 구 모델명 deepseek-chat과 deepseek-reasoner는 2026년 7월 24일 15:59 UTC(베이징 23:59)에 영구 중단됩니다.
| 구 모델명 | 신 모델명 | 비고 |
|---|---|---|
deepseek-chat |
deepseek-v4-flash(비사고 모드) |
고속, 경량 작업 |
deepseek-reasoner |
deepseek-v4-flash(사고 모드) |
또는 deepseek-v4-pro로 더 강한 추론 |
- 구 모델명 전역 검색: 코드, CI 설정, 환경 변수에서
deepseek-chat/deepseek-reasoner호출 지점을 나열합니다. - 대상 모델 결정: 경량 대화 →
deepseek-v4-flash. 복잡 추론 →deepseek-v4-pro+ 사고 모드. - OpenAI SDK model 파라미터 갱신:
base_url은https://api.deepseek.com유지,model만 변경합니다. - 사고 모드 설정(선택):
extra_body로 thinking 활성화. budget_tokens 8000부터 권장. - Staging 검증: 7월 24일 전 E2E 회귀 완료. Agent 긴 체인과 캐시 히트 중점 테스트.
- 프로덕션 전환·모니터링: 신 모델명으로 카나리 배포, 피크 시간대 청구와 지연 모니터링.
deprecated — 2026-07-24 이후 사용 불가
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
recommended — V4 GA
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
V4는 OpenAI ChatCompletions와 Anthropic Messages 형식을 모두 지원합니다. Anthropic SDK도 model 갱신과 base_url을 https://api.deepseek.com으로 지정하면 마이그레이션됩니다.
SECTION 08 인용 가능한 기술 데이터와 공식 출처
- 오픈소스 기록: SWE-bench Verified 80.6%. Gemini 3.1 Pro와 공동 최고 수준.
- 컨텍스트 효율: 100만 token 시 KV Cache 메모리 V3.2의 10%(Flash 7%).
- 가성비: V4-Pro 출력 평시 $0.87/M, 피크 $1.74/M. 폐쇄형 플래그십 대비 대폭 저렴.
- 마이그레이션 마감: 2026-07-24 23:59 베이징 시간. 구 API 영구 중단.
- 라이선스: V4-Pro / V4-Flash 모두 MIT. 자체 호스팅·상업 이용 가능.
- 샘플링: 공식 권장
temperature=1.0, top_p=1.0.
출시 후 링크를 다시 열어 기술 세부와 벤치마크 자료를 확인하세요.
arXiv:2606.19348 — DeepSeek V4 기술 논문
Artificial Analysis: 모델 가성비와 Intelligence Index
DeepSeek V4 GA의 가치는 Claude Fable 5나 GPT-5.6을 즉시 능가하는 것이 아니라, 극저비용으로 오픈소스 최강 종합 성능을 제공하는 데 있습니다. 반면 Mac에서 iOS CI/CD, Metal 가속 추론, 7×24 Agent 파이프라인이 필요한 팀에게 API만으로는 ① 데이터 국경 컴플라이언스, ② 로컬 Mac 종료 시 파이프라인 단절, ③ 가상화 macOS의 Hypervisor 오버헤드·Metal 호환 문제가 남습니다. 제로로스 네이티브 Apple 연산, 안정 iOS CI/CD, AI Agent 자동화가 필요한 프로덕션 환경에서는 MACNOX 클라우드 물리 Mac 노드가 더 적합한 선택입니다. 100% 정품 Apple 물리기, 전체 Root, Hypervisor 오버헤드 없음, 일/주/월 유연 계약. 관련 글: Kimi K3 오픈소스 LLM 리뷰, DeepSeek 자체 칩과 연산 인프라, GPT-5.6 Sol Ultra 수학 추론 평가.
SECTION 09 자주 묻는 질문 FAQ
DeepSeek V4 정식판과 프리뷰의 차이는?
아키텍처(MoE + CSA/HCA)는 동일합니다. GA는 Agent·수학 추론·코드 생성을 프로덕션 수준으로 최적화하고 피크·오프피크 요금을 처음 도입했습니다. 프리뷰도 강력하지만 GA는 안정성과 상용 운영 완성도가 한 단계 높습니다.
피크·오프피크 요금의 피크 시간대는?
베이징 시간 평일 09:00–12:00과 14:00–18:00이 피크로 요금 2배입니다. 주말·공휴일은 평시 요금입니다.
V4-Pro와 V4-Flash는 어떻게 구분하나?
Flash는 저렴·고속으로 라우팅·경량 작업에 적합합니다. Pro는 복잡 코드·긴 체인 Agent용입니다. Flash 1차 필터 후 어려운 작업만 Pro로 보내는 구성이 효율적입니다.
deepseek-chat은 언제까지 쓸 수 있나?
2026년 7월 24일 23:59(베이징)에 영구 중단됩니다. 그 전에 deepseek-v4-flash 또는 deepseek-v4-pro로 이전하세요.
DeepSeek V4가 GPT-5.6을 이길 수 있나?
종합 벤치마크에서는 폐쇄형 플래그십이 여전히 앞서지만, V4-Pro는 LiveCodeBench·Codeforces 등 알고리즘 영역에서 우위이며 비용은 GPT-5.6의 약 1/17입니다. 단일 점수보다 시나리오와 예산으로 선택해야 합니다.
DeepSeek V4를 자체 호스팅할 수 있나?
가능합니다. V4-Pro / V4-Flash는 MIT이며 가중치는 Hugging Face에서 받을 수 있습니다. 1.6T MoE 프로덕션 추론에는 대규모 GPU 클러스터가 필요합니다. 자세한 내용은 DeepSeek 연산 인프라를 참고하세요.