7월 31일 DeepSeek은 V4-Flash를 공식판 DeepSeek-V4-Flash-0731로 업그레이드했습니다. 파라미터 규모는 동일하고 후훈련만 재실시했으며, Agent 벤치마크에서는 더 큰 V4-Pro 프리뷰판을 상회하고 API 가격은 Claude Opus 4.8의 수십분의 일입니다. 본문은 DeepSeek API 마이그레이션과 국산 오픈소스 LLM 선정을 검토하는 개발자·기술 책임자를 대상으로 4월 프리뷰부터 8월 5일 집필 시점까지의 타임라인, 핵심 가격·아키텍처 데이터, Kimi K3·Qwen3.8-Max와의 횡단 비교, Harness 점수 논쟁과 「斩杀線」업계 배경을 정리합니다. 플래그십 V4-Pro 정식판과 자체 Agent 프레임워크 Harness는 집필 시점 미출시입니다.
SECTION 01 V4-Flash 정식판 선정의 고충: 점수는 좋지만 Pro와 Harness는 아직
- 「정식판」= 신규 모델로 오독: 0731 빌드는 4월 프리뷰판과 파라미터·구조가 완전히 동일합니다. 성능 향상은 후훈련 재실시에서 비롯되며 파라미터 확대가 아닙니다;
- V4-Pro 정식판은 미 GA: 현재 4월 프리뷰판 API만 존재합니다. changelog 원문은 「가능한 한 빨리 출시」. 8월 10–20일 창구의 네트워크 소문은 공식 미확인;
- Agent 점수는 Harness 의존도가 높음: Terminal Bench 2.0 등 모든 수치는 아직 공개되지 않은 Harness 「극간 모드」로 측정. 공식도 프레임워크 선택 민감도를 경고합니다;
- 구 인터페이스는 이미 중단:
deepseek-chat/deepseek-reasoner는 7월 24일 퇴역. 미이전 프로덕션 호출은 중단 위험이 있습니다; - API 전용 업데이트: 7월 31일 정식판은 API에만 한정. App·웹은 집필 시점 미동기화. 소비자 경험과 API 역량 사이에 격차가 있습니다;
- 제3자 종합 지수는 1위가 아님: Artificial Analysis Intelligence Index에서 V4-Flash는 약 50점. Kimi K3(57)·GLM-5.2보다 낮습니다. DeepSeek은 「충분한 지능 + 극한 저가」 전략으로 점수 1위 경쟁이 아닙니다.
이번은 신규 모델 출시가 아니라 동일한 284B 파라미터 모델로 후훈련을 다시 한 것입니다. Flash는 여러 Agent 벤치마크에서 1.6T V4-Pro 프리뷰판을 상회하며, 2026년 하반기 후훈련 품질이 단순 파라미터 적층에 근접하거나 초과하는 단계임을 보여줍니다.
SECTION 02 DeepSeek V4 타임라인과 핵심 가격 데이터 일람
- 2026년 4월 24일: V4 프리뷰판 최초 공개·오픈소스. V4-Pro(1.6T/49B 활성)와 V4-Flash(284B/13B 활성). 모두 100만 token 컨텍스트, MIT 라이선스;
- 2026년 7월 24일: 구 인터페이스
deepseek-chat·deepseek-reasoner정식 중단. 트래픽은 V4 시리즈 명명으로 전환; - 2026년 7월 27일: Moonshot AI Kimi K3(2.8T)가 Hugging Face에 오픈 웨이트 공개. 직접 경쟁 압력 형성;
- 2026년 7월 31일: DeepSeek-V4-Flash-0731이 API 공개 베타 진입. 오픈 웨이트도 MIT로 동기 공개. changelog에서 자체 Agent 프레임워크 Harness 「곧 출시」를 최초 명시;
- 2026년 8월 5일 현재: V4-Pro 정식판은 여전히 「가능한 한 빨리 출시」. 일부 중국 매체는 익명 소식통을 인용해 7월 28일 주 내부 테스트 시작, GA 창구 8월 10–20일을 보도했으나 DeepSeek 공식 미확인.
| 모델 | 상태 | 총/활성 파라미터 | 입력가($/M, 미히트/히트) | 출력가($/M) |
|---|---|---|---|---|
| V4-Flash-0731 | 공식 정식판 | 284B / 13B | $0.14 / $0.0028 | $0.28 |
| V4-Pro | 프리뷰판(정식판 미출시) | 1.6T / 49B | $0.435 / $0.003625 | $0.87 |
| Kimi K3 | 웨이트 오픈(07-27) | 2.8T / 약 104B(커뮤니티 추정) | $3.00 / $0.30 | $15.00 |
| GLM-5.2 | 오픈소스(2026년 6월) | ~744B / ~40B | 본문에서 독립 확인 없음 | 본문에서 독립 확인 없음 |
| Qwen3.8-Max | API GA(08-02), 웨이트 대기 | 2.4T / 95B | $2.00 / ~$0.17–0.25 | $6.00 |
| 가격 안내 | 모두 벤더 자보. DeepSeek은 피크 시간대 2배 가산(베이징 시간 9–12시, 14–18시)을 예고했으며 발효일은 미발표 | |||
SECTION 03 성능은 어떻게 「나왔는가」: 후훈련, CSA+HCA, Harness 프레임워크
V4-Flash-0731은 파라미터 규모·모델 구조가 4월 프리뷰판과 완전히 동일합니다. 공식은 성능 향상이 「완전히 후훈련 재실시에서 비롯」한다고 명시했습니다. 기술 보고서 《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》는 세 가지 아키텍처 변경을 기술합니다(프리뷰판에서 계승):
- 하이브리드 어텐션(CSA + HCA): 대외 명칭은 DSA 스파스 어텐션. 장문맥 계산·VRAM 오버헤드 절감;
- 다양체 제약 하이퍼커넥션(mHC): 기존 잔차 연결 개선;
- Muon 옵티마이저: 기존 옵티마이저를 대체해 수렴 속도와 안정성 향상.
공식 데이터(벤더 자보, 독립 제3자 재현 없음): 100만 token 컨텍스트에서 V4-Pro 단일 token 추론 FLOPs는 V3.2의 27%, KV Cache 점유는 10%에 불과합니다.
7월 31일 changelog에서 DeepSeek Harness가 최초로 공식 등장 — Claude Code에 대응하는 자체 Agent 실행 프레임워크. 파일 읽기·쓰기, 도구 호출, 엔드투엔드 엔지니어링 작업용입니다. 지금까지 DeepSeek 모델은 주로 Claude Code, OpenCode 등 제3자 Agent 도구에 의존했습니다. 공식 Agent 점수(Terminal Bench 2.0, Toolathlon 등)는 모두 Harness 「극간 모드」로 측정(max 설정, top_p=0.95, temperature=1.0). 프레임워크는 미공개입니다. changelog 원문: 「점수는 harness 선택에 매우 민감하며, 단순히 모델 자체 역량 향상과 동일시할 수 없다.」
| 모델 | Intelligence Index | 단일 작업 평균 비용 | V4-Flash 대비 비용 배수 |
|---|---|---|---|
| V4-Flash-0731 | 50 | $0.03 | 1× |
| Kimi K3 | 57 | $0.86 | 약 29× |
| GPT-5.6 Sol | 9점 이상 높음 | $1.86 | 약 62× |
| Claude Fable 5 | 9점 이상 높음 | $3.15 | 약 105× |
| 해석 | 지능 점수는 최고가 아니지만 단일 작업 비용은 극히 낮음 — 대규모 Agent·배치 호출 시나리오 대상 | ||
SECTION 04 점수 논쟁 정리와 6단계 API 마이그레이션 실무
과대 해석을 피하기 위해 명확히 표기해야 할 논점은 다음과 같습니다.
- Harness 의존: V4-Flash-0731 Terminal Bench 2.0은 82.7(V4-Pro 프리뷰 67.9). 모두 미공개 Harness 극간 모드 기반. Claude Code, Cursor 등 프레임워크에 직접 횡전개하면 안 됩니다;
- 가용성 문제: 21세기경제보가 해외 개발자 피드백을 인용. 정식판에서 입력 캐시 히트율 저하, 안전 분류기 간헐 타임아웃 등이 보고됩니다;
- 자금 조달·IPO 소문: 여러 재경 매체가 약 74억 달러 조달, 487억 달러 밸류에이션 등을 보도. 현재는 주로 「보도에 따르면」「소식통에 따르면」 출처이며 DeepSeek 공식 또는 규제 신고 직접 확인 없음.
- model 이름 확인: 프로덕션 환경에서
deepseek-v4-flash(0731 공식 빌드 자동 참조)를 사용하는지 확인합니다.deepseek-chat/deepseek-reasoner는 더 이상 호출하지 않습니다; - 접속 프로토콜 확인: OpenAI ChatCompletions와 Anthropic 형식 API 모두 호환. 기존 SDK는 보통 코드 구조 변경이 불필요합니다;
- 캐시 전략 평가: 캐시 히트 입력은 $0.0028/M뿐. 장문맥 Agent 작업에서는 활성화와 히트율 모니터링을 권장합니다(커뮤니티에서 히트율이 낮다는 보고 있음);
- 피크·오프피크 과금 계획: DeepSeek은 평일 피크 2배 가산을 예고했습니다. 배치 작업은 베이징 시간 9–12시, 14–18시를 피합니다;
- 업무 시나리오 A/B: 자체 워크로드에서 Kimi K3, Qwen3.8-Max와 블라인드 테스트합니다. 벤더 Harness 점수만 의존하지 않습니다;
- API와 소비자 단말 구분: 7월 31일 업데이트는 API에만 한정. App/웹은 집필 시점 미동기화 — 엔드 사용자 제품은 경험을 별도 검증해야 합니다.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Summarize V4-Flash-0731 vs preview."}]
)
print(response.choices[0].message.content)
SECTION 05 「斩杀線」업계 배경, 인용 가능 데이터, 선정 결론
- 284B / 13B 활성 + MIT 오픈소스: 0731 공식판 웨이트는 Hugging Face에 공개. 상용 파인튜닝·재배포 가능;
- Claude Opus 4.8 대비 가격 차: 21세기경제보에 따르면 캐시 미히트 입력은 약 36배 저렴, 캐시 히트 약 179배, 출력 약 89배 저렴(벤더 표시가, 독립 감사 아님);
- 프리뷰판 OpenRouter 7주 연속 1위: V4-Flash 프리뷰판이 7주 연속 OpenRouter 호출량 1위. 「충분한 성능 + 극저가」 전략의 시장 검증;
- 「斩杀線」(참살선): 중국 개발자 커뮤니티에서 퍼지는 표현 — DeepSeek의 「충분한 성능 + 극단적 저가」가 동업에 생존 문턱을 설정하고, 경쟁사는 명확한 성능 우위나 더 낮은 가격이 없으면 존재감을 갖기 어렵다는 맥락. 동기 GPT-5.6 Luna 80% 인하 등 밀집 가격 조정도 설명합니다;
- 반도체주 반응은 담담: 7월 31일 NVIDIA·Broadcom·AMD 등은 뚜렷한 변동 없음. 시장은 「DeepSeek식 효율 돌파」 서사에 익숙하며, 2025년 초 R1 발표 때 칩주 급락과 대조적입니다.
V4-Pro GA 전 중국 커뮤니티에서는 양문봉(梁文锋)을 「梁白開」(헛기다림)으로 놀리기도 했습니다. 0731 호조로 「梁圣」으로 되돌아갔다 — 정식판 출시에 대한 커뮤니티 감정의 민감함을 보여주는 에피소드입니다.
아래는 공식·제3자 출처입니다. 출시 후 최신 페이지를 확인하십시오.
Hugging Face: deepseek-ai/DeepSeek-V4-Flash 모델 카드
Artificial Analysis: 독립 모델 평가와 Intelligence Index
DeepSeek V4 위에서 Agent 파이프라인을 구축하는 팀은 가상화 Mac 환경에서 Xcode 빌드, Metal 가속, iOS CI에 오버헤드와 호환성 리스크가 있습니다. 제로 손실 네이티브 연산, 안정적 iOS CI/CD, AI Agent 7×24 자동화가 필요한 프로덕션 환경에서는 MACNOX 클라우드 물리 Mac 노드가 일반적으로 더 나은 선택입니다. 100% Apple 정품 하드웨어, 완전 Root, Hypervisor 오버헤드 없음, 일·주·월 유연 과금. API 선정 배경은 DeepSeek V4 풀버전 가격·아키텍처 특집과 OpenRouter 7월 랭킹 분석도 참고하십시오.
SECTION 07 자주 묻는 질문 FAQ
DeepSeek V4와 V3.2의 가장 큰 차이는 무엇인가요?
네이티브 100만 token 컨텍스트를 지원합니다. 장문맥 시나리오의 계산·VRAM 오버헤드가 대폭 절감됩니다(공식 데이터: V4-Pro는 백만 token에서 FLOPs가 V3.2의 27%, KV Cache는 10%). V4 시리즈는 Agent 역량에 특화 최적화가 있으며 Claude Code, OpenCode 등 주류 Agent 도구에 대응합니다.
일상적으로 V4 Flash와 V4 Pro 중 무엇을 선택해야 하나요?
일반 대화, 배치 처리, 대규모 저비용 Agent 호출에는 V4-Flash-0731 정식판의 가성비가 높고 Agent 점수는 V4-Pro 프리뷰판을 상회합니다. 더 깊은 세계 지식이나 복잡한 추론이 필요하고 예산이 여유 있으면 V4-Pro 프리뷰판을 임시 사용하고 정식판 GA 후 재평가하십시오.
V4 Pro 정식판은 지금 사용할 수 있나요?
2026년 8월 5일 현재는 아직 사용할 수 없습니다. 정식판은 V4-Flash-0731뿐이며 API에 한정됩니다. V4-Pro 정식판과 Harness는 공식 입장으로 「가능한 한 빨리 출시」. 8월 10–20일 네트워크 소문은 미확인 추측입니다.
DeepSeek이 공표한 점수를 그대로 믿어도 되나요?
구분해서 취급하는 것을 권장합니다. SWE-bench Verified 등 널리 채택된 제3자 벤치마크는 신뢰도가 비교적 높습니다. Terminal Bench 2.0 등 Agent 점수는 미공개 Harness로 측정되었고 공식도 프레임워크 민감도가 높다고 경고합니다. 커뮤니티가 Claude Code, Cursor 등으로 독립 재현할 때까지 기다리거나 자체 워크로드로 검증하십시오.
일반 개발자에게 실제 영향은 무엇인가요?
OpenAI 또는 Anthropic 형식 API로 DeepSeek에 접속하면 코드 변경이 불필요합니다. deepseek-v4-flash는 신규 정식판을 자동 참조합니다. 중단된 deepseek-chat / deepseek-reasoner를 계속 쓰고 있다면 V4 명명으로 신속히 전환하십시오(7월 24일 정식 중단).