/ 블로그 / Qwen3.8-Max
ENGINEERING_BLOG · 2026.08.04

Qwen3.8-Max는 지금 오픈소스인가?
GA 직후 드러난 「미출하」 실태

결론부터 말하면, 아직입니다. 2026년 8월 3일 Alibaba는 Qwen3.8-Max를 클라우드 API로 일반 공개(GA)하고 qwen.ai에 Open-Source 배지를 붙였습니다. 하지만 집필 시점 Hugging Face·ModelScope에는 모델 저장소가 없고, 라이선스 조항과 확정 공개일도 발표되지 않았습니다. Qwen3.8-Max와 경량 Qwen3.8-27B 웨이트는 「다음 주」 공개가 약속된 상태입니다. 본문은 플래그십 API 선정과 Agent 마이그레이션을 검토하는 개발자를 대상으로 실제 출하 항목·미출하 항목, Kimi K3·DeepSeek V4와의 위치, 오픈소스 표기가 웨이트보다 먼저 붙은 이유를 정리합니다.

SECTION 01 Qwen3.8-Max 출시가 투명성 논쟁을 부르는 이유

8월 3일 GA 발표 이후 개발자 커뮤니티에서 가장 흔한 오판은 다음과 같습니다.

  • qwen.ai Open-Source 배지를 출하 완료 웨이트로 착각: 집필 시점 Hugging Face·ModelScope에 저장소 없음, 「다음 주」라는 모호한 약속만 존재;
  • 벤더 자체 하네스 점수를 독립 검증과 동급으로 취급: PaperBench, OSWorld-Verified, SWE-bench Pro는 모두 Alibaba 자체 프레임워크 출처, Artificial Analysis는 GA 수치 미재현;
  • 프리뷰 단계 정보 공백 간과: 7월 19일 프리뷰는 활성 파라미터 미공개, model card 없음, 이용약관으로 프로덕션 자동화 금지;
  • Arena 예비 순위 과대 해석: 5위 1,496점은 Preliminary 표기. 상위 8위 중 1–4위·6–8위는 전부 Anthropic 모델;
  • 장기 Agent 인프라 요구 과소평가: 16일 무인 코딩·500단계 이상 칩 설계 작업은 안정적 CI와 macOS 파이프라인을 요구하고, 가상화 Mac 환경에는 숨은 오버헤드가 발생합니다.

출시일 Alibaba 홍콩 주가는 약 7%, 미국 상장 주는 약 4.5% 상승했습니다 — 시장은 이를 일반적 이터레이션이 아니라 프론티어 모델 경쟁 재진입으로 해석했습니다.

SECTION 02 Qwen3.8-Max 타임라인과 핵심 사양

  • 7월 16일: Moonshot AI가 Kimi K3 공개(2.8T 파라미터, 896 전문가 중 16개 활성). 독립 벤치마크·기술 보고서를 전면에;
  • 7월 19일: Qwen3.8-Max 프리뷰를 Token Plan·Qoder·QoderWork로 제공. 정식가 10%, 활성 파라미터·벤치마크 표 없음, 프로덕션 자동화 약관 금지;
  • 7월 27일: Kimi K3가 예정대로 Hugging Face에 오픈 웨이트 공개. MoonEP·FlashKDA 동시 오픈;
  • 7월 31일: DeepSeek V4-Flash 출시. 파라미터 증가 없이 9개 Agent/코드 벤치마크에서 자사 V4-Pro 프리뷰 상회;
  • 8월 3일: Qwen3.8-Max GA. 전체 벤치마크 표와 Agent 제품 「Qwen Office」 동시 론칭;
  • 8월 10일 전후(예상): Qwen3.8-Max·Qwen3.8-27B 오픈 웨이트를 Hugging Face·ModelScope에 공개한다고 공약 — 저장소·라이선스·확정일 미발표.
Qwen3.8-Max 핵심 사양(GA)
항목
GA 일자 2026년 8월 3일
총 / 활성 파라미터 2.4T / 95B
아키텍처 Qwen3.5 기반 sparse MoE + 하이브리드 어텐션
컨텍스트 윈도우 100만 토큰(사고 모드 약 98.3만, 최대 출력 131K)
입력 모달리티 텍스트, 이미지, 동영상
API 요금(백만 토큰당) 입력 $2, 출력 $6. 암시 캐시 히트 $0.25, 명시 캐시 쓰기 $2.50, 읽기 $0.17
Arena Text Arena(8월 1일 스냅샷) 5위, 1,496점(Preliminary) — 상위 8위 중 유일 비 Anthropic
Arena Vision Arena 2위, Claude Fable 5에 뒤따름
오픈 웨이트 「다음 주」 공약, 집필 시점 미공개

SECTION 03 MoE 아키텍처와 플래그십 모델 비교

Qwen3.8-Max는 총 파라미터를 2.4조로 끌어올리면서 토큰당 활성은 950억으로 제한합니다. 추론 비용은 총량이 아니라 활성 수에 따라 결정되므로 API $2/$6은 Claude Opus 5($5/$25)·Claude Fable 5($10/$50)를 크게 아래로 누립니다. 이는 원시 스케일이 아니라 아키텍처 효율을 가격 경쟁력으로 전환하는 설계입니다.

reasoning_effort는 low / medium / xhigh 3단(기본 xhigh)이며, enable_thinking 또는 Anthropic 호환 reasoning.effort로 지연과 깊이를 교환합니다. API는 OpenAI·Anthropic 호환을 동시 지원해 Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw에 base URL 교체만으로 연결할 수 있습니다.

Qwen3.8-Max vs 경쟁 모델
모델 총 / 활성 가격(입/출) 오픈 웨이트 독립 벤치마크
Qwen3.8-Max 2.4T / 95B $2 / $6 공약만, 미출하 미재현
Kimi K3 2.8T / 약 50B $3 / $15 7월 27일 출하 Artificial Analysis ≈ 57.11
DeepSeek V4-Flash V4-Pro와 동일 규모 미완전 공개 출하 완료 9개 Agent/코드 벤치에서 V4-Pro 상회
Claude Fable 5 비공개 $10 / $50 폐쇄 Arena Text 1위
독립 블라인드 테스트(269파일 아키 태스크) Kimi K3 83 vs Qwen3.8-Max 프리뷰 80 동급, 맞먹음

Alibaba 자체 점수(출처: 벤더 자료): PaperBench 93.0(+28.2), OSWorld-Verified 86.1, SWE-bench Pro 67.7(Fable 5 80.0에 열세), HLE 43.6(비교 플래그십 중 최저, Fable 5 53.3). 비교표 각주는 「Fable 5 결과에 fallback 포함 가능」을 시사하지만 Alibaba 측 방법론 공개도 제3자 재현에는 불충분합니다.

SECTION 04 오픈소스 표기 문제와 6단계 API 연동 체크리스트

이번 출시에서 가장 경계해야 할 점은 피크 점수가 아니라 정보 시점의 불일치입니다. GA 당일 Open-Source 태그가 붙었지만 웨이트·라이선스·출하일은 미공개. 모든 벤치마크는 Alibaba 자체 하네스(QwenSWEBench, RecreationBench 포함) 출처이고, 7월 프리뷰는 model card 없음·프로덕션 자동화 금지였습니다.

  1. 오픈 웨이트 상태 확인: Hugging Face·ModelScope에서 Qwen3.8-Max를 검색하고 저장소·라이선스·웨이트 실재를 확인한 뒤 사이트 배지만으로 마이그레이션하지 않습니다;
  2. 프로토콜 선택: 기존 도구체인에 맞춰 OpenAI 호환 또는 Anthropic 호환 엔드포인트를 선택합니다. Qwen Office와 순수 API 호출 역할을 평가합니다;
  3. 추론 티어 설정: 지연 민감 작업은 low 또는 medium. 복잡 Agent는 기본 xhigh로 토큰 소비를 모니터링합니다;
  4. 캐시 활성화: 암시/명시 캐시 요금(히트 $0.25, 읽기 $0.17)으로 장문맥 Agent 청구를 절감합니다;
  5. 실제 워크로드 A/B: Kimi K3·DeepSeek V4와 블라인드 비교합니다. 벤더 자체 점수만 의존하지 않습니다;
  6. Agent 인프라 계획: 장기 작업에는 안정 CI와 macOS 빌드 환경이 필요합니다. 물리 Mac 노드와 가상화 TCO를 비교합니다.
qwen3-8-max-api.py
from anthropic import Anthropic

client = Anthropic(
    api_key="YOUR_DASHSCOPE_API_KEY",
    base_url="https://dashscope.aliyuncs.com/api/v2/apps/anthropic/v1"
)

response = client.messages.create(
    model="qwen3.8-max",
    max_tokens=4096,
    thinking={"type": "enabled", "budget_tokens": 8000},
    messages=[{"role": "user", "content": "Summarize MoE active params for Qwen3.8-Max."}]
)
print(response.content[0].text)

SECTION 05 인용 가능 데이터, 업계 맥락, 선정 결론

  • 2.4T 총량 / 95B 활성: 활성 수는 GA에서 최초 공개. 프리뷰 단계는 전면 미공개로 7월 투명성 비판의 초점이었습니다;
  • API $2/$6(백만 토큰당): Claude Opus 5·Fable 5 가격대를 하회합니다;
  • Arena Text 5위(1,496, Preliminary): 상위 8위 중 유일 비 Anthropic. Vision Arena 2위;
  • 장기 호라이즌 사례: Alibaba는 16일 무인 코딩·500단계 이상 칩 최적화를 공개. GitHub qwen-code-dev-bot/oh-my-cli에 부분 트레이스, 완전한 독립 감사는 아닙니다;
  • 소비자 도달: Qwen은 중국향 Apple Intelligence 생성 AI를 이미 지원합니다. Apple Intelligence 중국판과 Qwen 파트너십을 참고하십시오.

2026년은 조 파라미터 모델이 확산하는 해이지만, DeepSeek V4-Flash는 파라미터를 늘리지 않고 Agent 능력을 높였습니다. Alibaba의 Max급 오픈 웨이트 공약은 Kimi K3·DeepSeek과 함께 중국 랩의 오픈 웨이트 지향을 보여줍니다. 같은 주 OpenAI·Anthropic은 Agent 탈옥 사건을 공개했고, 8월 4일 백악관 회의에서 자발적 사이버보안 테스트가 논의됐습니다 — 글로벌 AI 서사의 대비가 뚜렷합니다.

아래는 공식·제3자 출처입니다. 마이그레이션 전 최신 페이지를 확인하십시오.

Arena.ai: Text·Vision Arena 공개 리더보드

GitHub: qwen-code-dev-bot/oh-my-cli(장기 코딩 부분 트레이스)

TechCrunch: Apple Intelligence 중국판에 Alibaba Qwen 채택

Qwen3.8-Max 위에서 Agent 파이프라인을 구축하는 팀은 가상화 Mac 환경에서 Xcode 빌드, Metal 가속, iOS CI에 오버헤드와 호환성 리스크가 있습니다. 제로 손실 네이티브 연산, 안정적 iOS CI/CD, AI Agent 7×24 자동화가 필요한 프로덕션 환경에서는 MACNOX 클라우드 물리 Mac 노드가 일반적으로 더 나은 선택입니다. 100% Apple 정품 하드웨어, 완전 Root, Hypervisor 오버헤드 없음, 일·주·월 유연 과금. 중국 모델 선정 배경은 OpenRouter 7월 랭킹 분석도 참고하십시오.

SECTION 07 자주 묻는 질문 FAQ

Qwen3.8-Max는 지금 오픈소스인가요?

아닙니다. API는 Alibaba Cloud Model Studio로 이용 가능하지만, 집필 시점 웨이트는 Hugging Face·ModelScope에 없습니다. qwen.ai Open-Source 태그는 의도를 나타내는 것이지 출하된 산출물이 아닙니다. Qwen3.8-Max·Qwen3.8-27B는 「다음 주」 공약이며 확정일은 미발표입니다.

Qwen3.8-Max와 Kimi K3 중 누가 더 강한가요?

권위 있는 일대일 비교는 없습니다. 유일한 독립 비교 — 269파일 아키 태스크 블라인드 테스트 — 에서 Kimi K3 83/100, Qwen3.8-Max 80/100로 실질 동급입니다. Kimi K3 강점은 공개 웨이트와 Artificial Analysis 점수. Qwen3.8-Max 강점은 낮은 API 가격과 폭넓은 네이티브 멀티모달입니다.

2.4조 파라미터면 데이터센터가 필요한가요?

전체 체크포인트에는 yes입니다. 2.4T MoE(활성 95B라도)는 멀티노드 데이터센터 규모입니다. API는 이를 우회합니다. 로컬 배포의 현실적 대상은 플래그십과 동시 출시 예정인 경량 Qwen3.8-27B입니다.

Alibaba 벤치마크 수치를 신뢰할 수 있나요?

벤더 주장으로 취급하고 검증 결과와 구분하십시오. 공개 점수는 전부 자체 하네스 출처이며 자체 벤치마크도 포함합니다. 집필 시점 제3자는 GA 수치를 미재현했고 Arena 항목도 Preliminary입니다. 제3자 재현을 기다리거나 자체 워크로드로 테스트하십시오.

Qwen API를 쓰지 않는 개발자에게도 관련이 있나요?

있습니다. Qwen은 중국 사용자용 Apple Intelligence 생성 AI를 이미 지원하고 최신 iPhone에서 온디바이스로 실행됩니다. Qwen API를 직접 호출하지 않아도, 중국 오픈 웨이트 모델군이 글로벌 소비 플랫폼 기반에 임베드된 사례입니다.