/ 블로그 / 가격전
ENGINEERING_BLOG · 2026.08.17

DeepSeek는 왜 API 요금을 최대 1,100% 올렸는가
— 중국 오픈웨이트 공세 직후의 가격전

닷새 사이에 중국 프론티어 API를 사거나 오픈웨이트를 받는 팀은 겉보기에는 서로 어긋난 세 가지 움직임을 동시에 맞았습니다. DeepSeek는 일부 구간 API 요금을 최대 1,100% 올렸습니다. 같은 주 Alibaba는 지금까지 공개한 적 없는 2.4조 파라미터 플래그십을 오픈웨이트로 풀었습니다. Zhipu AI는 GLM-5.3을 내놓았고, 동일 베이스를 재학습하지 않은 채 코딩 벤치가 약 6배로 올랐습니다. 본문은 청구서를 다시 짜고, 라이선스를 읽고, 스택을 고르는 엔지니어를 대상으로 합니다. 공통 신호는 하나입니다. 중국 랩은 이제 가격만으로 싸우지 않고, 가격 결정력으로 싸웁니다.

SECTION 01 DeepSeek 인상을 잘못 읽는 다섯 가지 방식

헤드라인은 부족하지 않습니다. 부족한 것은 청구 차원을 나누는 방식입니다.

  • 「1,100%」를 청구서 전체로 취급: 그 수치는 V4-Pro 피크 시간 캐시 히트 입력에만 해당합니다. 출력은 350%, 캐시 미스 입력은 200% 올랐습니다.
  • 공식 API가 항상 가장 싸다고 가정: 피크 시간에는 DeepSeek 공식 정가가 여러 리셀러보다 높습니다. GMI Cloud, Novita 등은 여전히 새 공식 피크보다 낮은 V4 Pro 견적을 냅니다.
  • Alibaba 공개를 Apache 2.0 자선으로 읽기: 웨이트는 내려받을 수 있습니다. 다만 연속 12개월 매출이 5,000만 달러를 넘는 Model-as-a-Service 또는 AI Work Assistant 사업은 별도 상업 라이선스를 협상해야 합니다.
  • 지역 차단 소문을 반복: 미국·EU·영국·한국이 체크포인트를 받을 수 없다는 주장은 사실이 아닙니다. 공개된 라이선스에는 영토 조항이 없습니다.
  • GLM-5.3을 새 파운데이션 모델로 부르기: GLM-5.2의 743B 베이스를 재사용합니다. 이득은 스케일된 후학습 RL에서 옵니다. 점수는 벤더 보고이며, 독립 재실행은 아직 공개되지 않았습니다.

랩 셋, 수 셋, 신호는 하나. 중국 AI 랩은 가격이 아니라 가격 결정력으로 경쟁합니다.

SECTION 02 출시 타임라인, 그리고 미국 랩의 인하

시야를 넓히면 대칭이 보입니다. 7월 30일 OpenAI는 가장 싼 티어인 GPT-5.6 Luna를 80% 내렸습니다. 8월 6–7일에는 Luna를 무료 기본값으로 두고 텍스트 채팅을 무제한으로 열었습니다. 중국 랩이 요금을 올리고 플래그십 웨이트를 여는 동안, 미국 랩은 소비자 층에서 내리고 무료로 갔습니다. 같은 싸움의 양면입니다. 앞선 제품 기록은 Qwen3.8-Max 출시DeepSeek V4 GA 요금에 있습니다.

핵심 일정, 2026년 7–8월
날짜 사건
2026년 7월 16일 Moonshot AI가 Kimi K3(2.8T 파라미터)를 오픈웨이트로 공개, 미국 안보 검토를 유발
2026년 8월 2–3일 Alibaba가 Qwen3.8-Max를 프리뷰한 뒤 호스티드 API로 출시
2026년 8월 10일 Meta가 Muse Glimmer(30B, Apache 2.0)를 공개하고 플래그십 Muse Spark 1.2 오픈웨이트를 예고
2026년 8월 12일 Alibaba가 Qwen3.8-2.4T-A95B를 Hugging Face / ModelScope에 게시. xAI는 Grok 4.6을 출시
2026년 8월 13일 DeepSeek-V4-Pro GA, 8월 17일 시행 인상 발표. Google은 할인된 Gemini 3.7 Flash를 출시
2026년 8월 14일 Zhipu가 GLM-5.3을 출시. GLM-5.2의 743B 베이스를 재사용
2026년 8월 17일 00:00 베이징 시간 DeepSeek 신규 요금 시행

SECTION 03 수치: DeepSeek 요금, Qwen 사양, GLM-5.3 벤치

신규 DeepSeek 요금은 8월 17일 00:00 베이징 시간에 시행됩니다. 피크는 베이징 시간 09:00–12:00, 14:00–18:00입니다. 헤드라인 1,100%는 피크 캐시 히트 입력에 붙습니다. 그 구간이 원래 공짜에 가장 가까웠습니다. 실제 청구의 대부분을 차지하는 출력은 350% 올랐습니다. 독립 비용 모델링에 따르면, 현실적인 헤비 워크로드(월 약 8,400만 토큰, 대부분 오프피크, 캐시 히트 절반)의 청구 증가는 약 1.8배에 가깝습니다.

DeepSeek 인상, 100만 토큰당 (CNY)
과금 항목 기존 신규 오프피크 신규 피크 피크 증가
V4-Flash 캐시 히트 (입력) ¥0.02 ¥0.05 ¥0.10 ~400%
V4-Flash 캐시 미스 (입력) ¥1.0 ¥1.5 ¥3.0 200%
V4-Flash 출력 ¥2.0 ¥4.5 ¥9.0 350%
V4-Pro 캐시 히트 (입력) ¥0.025 ¥0.15 ¥0.30 ~1,100%
V4-Pro 캐시 미스 (입력) ¥3.0 ¥4.5 ¥9.0 200%
V4-Pro 출력 ¥6.0 ¥13.5 ¥27.0 350%
Qwen3.8-2.4T-A95B (Qwen3.8-Max 오픈웨이트)
항목 내용
파라미터 총 2.4T, 토큰당 활성 95B (MoE, 전문가 512, 라우팅 10 + 공유 1)
컨텍스트 윈도 오픈 체크포인트 네이티브 262,144 토큰, 약 1.01M까지 확장 가능. 호스티드 Max 기본값은 1M
출시 순서 8월 2일 프리뷰 → 8월 3일 API 가동 → 8월 12일 오픈웨이트
API 요금 (국제) 입력 $2/M, 출력 $6/M
라이선스 Apache 2.0이 아님. 맞춤 Qwen3.8-Max License
의미 Alibaba가 Max급 플래그십을 오픈웨이트로 푼 첫 사례. Qwen3.5/3.6/3.7 Max는 API 전용이었습니다
GLM-5.3 대 GLM-5.2: 동일 베이스, 후학습만 (Zhipu 보고)
벤치마크 GLM-5.2 GLM-5.3 변화
Terminal-Bench 3.0 4.6% 28.3% +23.7 pts
DeepSWE v1.1 46.2% 66.9% +20.7 pts
Agents' Last Exam (CLI) 23.8% 28.5% +4.7 pts
CyberGym 77.2% 84.5% +7.3 pts
AutomationBench 26.2% 48.2% +22.0 pts

수치는 모두 Zhipu 자체 보고입니다. GLM-5.3은 Terminal-Bench 3.0에서 여전히 GPT-5.6 Sol(34.6%)과 Claude Fable 5(33.7%)에 뒤집니다. 오픈웨이트 상위 결과이지, 프론티어 단독 승리는 아닙니다.

SECTION 04 세 가지 전략: 시간대 요금, 라이선스 웨이트, 후학습

DeepSeek: 정액 저가에서 시간대 요금으로. 브랜드 선회가 아니라 용량 문제입니다. 「중국에서 가장 싼 모델이 결국 꺾였다」는 읽기는 쉽습니다. 구조는 계산 제약이 표면에 드러난 쪽에 가깝습니다. GPU 공급이 따라가는 동안 항상 싼 정액은 획득에 유효했습니다. 사용량은 지수로 늘고 용량은 그렇지 않으면, 무언가는 명시되어야 합니다. 「더 유연한 워크로드 스케줄링을 권장한다」는 말은 피크 시간 연산이 부족하다는 기업어입니다. 피크에서는 공식 API가 더 이상 DeepSeek를 돌리는 가장 싼 길이 아닙니다. 그 가정이 깨졌습니다.

Alibaba: 오픈웨이트로 마인드셰어를 사고, 맞춤 라이선스로 매출 상한을 지킵니다. 2.4T 체크포인트 공개와 맞춤 라이선스 부착은 한 수입니다. 연속 12개월 매출이 5,000만 달러를 넘는 Model-as-a-Service 또는 AI Work Assistant 사업은 별도 상업 라이선스를 협상해야 합니다. 월간 활성 이용자 1억 명 이상, 또는 월 매출 2,000만 달러 이상 제품은 모델명을 표시해야 합니다. 국제 개발자를 얻고, 그 위에 추론을 팔 수 있는 쪽에는 레버리지를 남기는 베팅입니다. Meta가 Muse Glimmer를 제한 없는 Apache 2.0으로 푼 것과는 다른 베팅입니다. 지역 차단 소문은 사실이 아닙니다. 발표 스레드가 아니라 LICENSE 파일을 확인하십시오.

GLM-5.3: 새 베이스 없음, 더 큰 후학습 베팅. GLM-5.2와 같은 743B 베이스, 재학습 없음, Terminal-Bench 3.0에서 약 6배(4.6% → 28.3%)는 RL 환경 스케일에서 옵니다. 사전학습 스케일링이 평탄해질수록 후학습 RL은 새 파운데이션 모델보다 비용 하한이 낮은 독립 레버가 됩니다. 중위 랩도 OpenAI급 사전학습 예산 없이 에이전트·코딩 벤치 격차를 줄일 수 있습니다.

SECTION 05 DeepSeek는 여전히 가장 싼 프론티어 모델인가 — 6단계 점검

위안-달러는 약 ¥7.15/$1, 근사치입니다. 오프피크 V4-Pro는 여전히 Claude Opus 5보다 훨씬 낮습니다. 다만 단독 최저가는 아닙니다. Qwen3.8-Max 국제 요금과 OpenAI Luna는 모두 DeepSeek 오프피크를 밑돕니다. 「중국 모델 = 가장 싼 모델」은 2025년 대부분과 2026년 초까지 성립했습니다. 지금은 안전한 가정이 아닙니다. 미국 측 인하 맥락은 GPT-5.6 Luna 80% 인하에 있습니다.

입력 / 출력, 100만 토큰당
모델 입력 출력 오픈웨이트
DeepSeek V4-Pro (피크) ¥9.0 (~$1.26) ¥27.0 (~$3.78) 아니오
DeepSeek V4-Pro (오프피크) ¥4.5 (~$0.63) ¥13.5 (~$1.89) 아니오
Qwen3.8-Max (국제 API) $2.00 $6.00 예 (맞춤 라이선스)
OpenAI GPT-5.6 Luna $0.20 $1.20 아니오
Claude Opus 5 (Alibaba 비교 비율에 따른 함의치) ~$5.00 ~$25.00 아니오

이번 주에 바로 내보내야 한다면, 헤드라인에 곱하지 말고 스택을 여섯 단계로 점검하십시오.

  1. 청구서를 나눕니다: 최근 30일을 캐시 히트 입력, 캐시 미스 입력, 출력으로 쪼갭니다. 새 요금표를 각 줄에 적용합니다. 청구 전체에 1,100%를 곱하지 마십시오.
  2. 베이징 피크를 표시합니다: 09:00–12:00, 14:00–18:00 베이징 시간입니다. 발표가 유연한 스케줄링을 요청한 이유가 있습니다.
  3. 공식과 리셀러를 비교합니다: 피크에는 GMI Cloud, Novita 또는 다른 리셀러가 공식 피크를 여전히 밑도는지 확인합니다.
  4. LICENSE 파일을 읽습니다: Qwen3.8-2.4T-A95B를 받기 전에 $50M / 1억 MAU / 월 매출 $20M 임계값을 확인합니다. 지역 차단 스레드는 무시합니다.
  5. GLM-5.3을 후학습 델타로 취급합니다: 5.2와 동일 베이스, 벤더 벤치만 있습니다. 교체 전에 자체 터미널·SWE 과제를 다시 돌리십시오.
  6. 층별로 라우팅합니다: 싼 소비자 텍스트는 Luna, 오픈웨이트와 생태계는 Qwen, 피크를 옮길 수 있는 프론티어 추론은 DeepSeek 오프피크, 장기 에이전트와 iOS CI는 하이퍼바이저가 아닌 실제 Mac으로 보냅니다.
deepseek-bill-estimate.py
peak = {"in_miss": 9.0, "in_hit": 0.30, "out": 27.0}
off  = {"in_miss": 4.5, "in_hit": 0.15, "out": 13.5}

tokens_m = {"in_miss": 40, "in_hit": 40, "out": 4}
def bill(rate, t):
    return t["in_miss"]*rate["in_miss"] + t["in_hit"]*rate["in_hit"] + t["out"]*rate["out"]

print("off-peak CNY", round(bill(off, tokens_m), 2))
print("peak CNY", round(bill(peak, tokens_m), 2))

SECTION 06 미확인 항목, 두 갈래 가격전, 다시 열어야 할 출처

  • 1,100% 헤드라인은 정확하고 불완전합니다: 피크 캐시 히트 입력에만 해당합니다. 대부분 청구를 지배하는 출력은 350% 올랐습니다.
  • Zhenwu M890 / Pangu AL128 주장: 여러 중국 금융 매체는 Qwen3.8-Max 추론 일부가 Alibaba 자체 칩에서 돈다고 합니다. Alibaba는 독립 기술 문서나 제3자 벤치를 내지 않았습니다. 미확인으로 다루십시오.
  • GLM-5.3과 「심각한 Cursor 취약점」: VentureBeat와 Zhipu 자체 공개입니다. 기술 세부사항은 공개되지 않았습니다. 벤더 출처이며 독립 감사는 아닙니다.
  • 보복 수출 통제: 중국 상무부가 AI·반도체 대응 조치를 준비할 수 있다는 보도는 추측성 매체이지 공식 발표가 아닙니다.

지난 한 달 중국 상위 랩의 출하 속도는 국내 금융 매체가 「一周三更」(일주일에 모델 갱신 세 번)이라고 부르는 수준입니다. DeepSeek, Alibaba, Zhipu에 더해 Moonshot의 Kimi K3(7월 16일 오픈웨이트, 2.8T)와 MiniMax H3가 있습니다. 중국 보도는 오픈웨이트 공개가 전 세계 재가격을 강제한다고 봅니다. 미국 랩은 소비자 층에서 반대 수를 뒀습니다. OpenAI의 Luna 80% 인하 후 무료 무제한 텍스트, Google의 8월 13일 Gemini 3.7 Flash 반값입니다. 계산이 부족한 상단에서는 플래그십 오픈웨이트와 더 높은 차등 요금, 소비자 끝에서는 무료와 저가. 둘 다 실재합니다. 퍼널의 다른 층을 최적화합니다.

지정학적 층도 있습니다. Kimi K3는 이미 미국 안보 검토를 받았습니다. 일부 분석은 이 창에서 Alibaba의 2.4T 공개를, 규제 강화 전에 국제 마인드셰어와 「기술 대등」 서사를 고정하는 수로 읽습니다. 확인된 사실이 아니라 정보에 근거한 해석입니다. 영어 제품 글만 읽으면 놓치기 쉽습니다.

공식·교차 확인 출처입니다. 요금이나 라이선스 조항을 다시 쓰기 전에 아래 페이지를 다시 여십시오.

DeepSeek 공식 API 요금 (피크 / 오프피크 표)

Alibaba Cloud Community: Qwen3.8-Max 출시 노트

Hugging Face: Qwen3.8-2.4T-A95B 체크포인트

Reuters / MarketScreener: DeepSeek V4 API 요금 인상

MarkTechPost: GLM-5.3 동일 베이스 후학습

2.4T MoE를 자체 호스팅하거나 에이전트를 Xcode·iOS CI에 붙이면, 방금 오른 토큰 청구 위에 하이퍼바이저 세금이 겹칩니다. 손실 없는 네이티브 연산, 안정적인 iOS CI/CD, 24시간 에이전트 자동화가 필요하면 MACNOX 클라우드 물리 노드가 보통 더 나은 프로덕션 경로입니다. 정품 Apple 하드웨어, 전체 Root, Hypervisor 없음, 일·주·월 과금. 맥락은 OpenRouter 7월 랭킹에 있습니다.

SECTION 07 자주 묻는 질문 FAQ

인상 이후 DeepSeek는 여전히 GPT-5.6이나 Claude보다 쌉니까?

오프피크 요금은 여전히 Claude Opus 5보다 쌉니다. 다만 전체에서 단독 최저가는 아닙니다. OpenAI GPT-5.6 Luna(100만 토큰당 $0.20/$1.20)와 Alibaba 국제 Qwen3.8-Max($2/$6)는 적어도 한 차원에서 DeepSeek의 새 오프피크를 밑돕니다. DeepSeek는 프론티어급으로는 여전히 상대적으로 싸지만, 더 이상 무조건 가장 싼 선택은 아닙니다.

Alibaba Qwen3.8-Max 오픈웨이트를 상업 제품에 무료로 쓸 수 있습니까?

대부분의 용도에서는 가능합니다. 개인 프로젝트와 기업 내부 사용은 영향이 없습니다. 조건은 Model-as-a-Service 또는 AI Work Assistant 사업이 연속 12개월 매출 5,000만 달러를 넘는 경우에만 붙습니다. 그 구간은 Alibaba와 별도 상업 라이선스가 필요합니다. 월간 활성 이용자 1억 명 이상 또는 월 매출 2,000만 달러 이상 제품은 모델명을 표시해야 합니다.

Qwen3.8-Max는 미국·EU·영국 이용자에게 금지되거나 제한됩니까?

아닙니다. 온라인에 퍼진 주장은 사실이 아니며, 공개된 라이선스에는 어떤 형태의 지역 제한도 없습니다. 제한은 매출 기준이며, 이용자나 사용자의 소재와 묶여 있지 않습니다.

GLM-5.3과 GLM-5.2의 실제 차이는 무엇입니까?

베이스 모델 수준에서는 차이가 없습니다. 둘 다 동일한 7,430억 파라미터 파운데이션을 씁니다. 성능 이득(Terminal-Bench 3.0에서 약 6배)은 전부 후학습 강화 학습 스케일에서 오며, 베이스 재학습은 없습니다.

Meta는 Muse Glimmer가 아니라 플래그십도 실제로 오픈소스화합니까?

아직 아닙니다. Muse Glimmer는 30B 증류 모델이며 Meta의 실제 플래그십이 아닙니다. Mark Zuckerberg는 더 크고 폐쇄된 Muse Spark 1.2의 오픈웨이트가 「곧」 나온다고 말했습니다. 실현되면 미국 플래그십급 모델의 첫 공개 출하가 됩니다. 집필 시점에는 확인된 사실이 아니라 표명된 의도로 다루십시오.