오픈 웨이트 셀프호스팅을 검토하는 AI 엔지니어에게 2026년 7월의 핵심 이슈는 Kimi K3의 2단계 론칭입니다. 7월 16일 API와 Kimi App / Work / Code가 가동되었고, 7월 27일 2.8조(2.8T) 파라미터 완전 웨이트가 Hugging Face에 Modified MIT 라이선스로 공개됩니다. 본문은 두 날짜의 차이, 벤치마크 승패, API 요금과 캐시 실효 비용, 1.4TB / 64장 이상 GPU 셀프호스팅 요건, 7월 27일 당일 체크리스트 6단계, 업계 맥락을 정리해 API 유지 vs 자체 이전 판단 재료를 제공합니다. 아키텍처 심층 분석은 Kimi K3 심층 리뷰를 참고하세요.
- TL;DR: 7/16은 클라우드 API, 7/27은 다운로드 가능 오픈 웨이트——혼동 금지;
- 라이선스: Modified MIT + tech report 동시 공개. 상업 조건은 LICENSE 전문 확인 필수;
- 셀프호스팅 현실: 4-bit에서도 약 1.4TB, 프로덕션 추론은 64장 이상 가속기——소비자용 하드웨어 대상 아님.
SECTION 01 7월 16일 vs 7월 27일: API 선행과 오픈 웨이트 공개의 2단계 론칭
많은 팀이 「K3는 이미 오픈소스인가?」라고 혼동하지만, Moonshot AI 공식 타임라인은 명확히 나뉩니다.
| 날짜 | 이벤트 | 개발자 의미 |
|---|---|---|
| 2026-07-16 | API·Kimi App / Work / Code에서 kimi-k3 제공 시작 |
클라우드 추론만. 웨이트 다운로드 불가 |
| 2026-07-17 | WAIC 상하이(세계인공지능대회) | 추가 발표·벤치마크 업데이트 가능성 |
| 2026-07-27 | Hugging Face 완전 웨이트 + Modified MIT + tech report | 최초 2조 초과 오픈 웨이트. vLLM / SGLang 지원 예정 |
오픈 웨이트를 기다리는 동안 마주하는 전형적 제약은 다음과 같습니다.
- API 선행·웨이트 후속: 7월 27일까지 오프라인 추론·커스텀 파인튜닝·데이터 레지던시 완전 통제 불가;
- 「오픈=로컬」 오해: 2.8T MoE는 896개 전문가 중 16개 활성화여도 스토리지·GPU 요건은 데이터센터급;
- 라이선스 불확실성: Modified MIT는 표준 MIT와 다른 추가 조항을 포함할 수 있어 7월 27일까지 LICENSE 전문 미확정;
- 폐쇄형 모델과의 근소 격차: Intelligence Index 57.1점은 Fable 5(59.9)·Sol(58.9)에 근소하게 미치지 못해 자체화 ROI 산정 필요;
- 지정학 리스크: 7월 1일 Anthropic Fable 5가 일시적으로 중국 시장에서 제외된 사례는 단일 벤더 API 의존 취약성을 보여줍니다.
한 줄 요약: Kimi K3 오픈 웨이트는 2.8T 총 파라미터·100만 token 컨텍스트·896/16 MoE로 역대 최대급 다운로드 모델이지만, 1.4TB 4-bit 스토리지와 64장 이상 GPU 현실이 대다수 개발자를 API 이용에 머물게 하는 구도입니다.
SECTION 02 Kimi K3 모델 사양: 2.8T·KDA·MXFP4와 K2 대비 2.5배 효율
7월 27일 공개될 웨이트는 Moonshot이 API 단계부터 공표한 아키텍처와 일치합니다. 양자화 전제 설계(MXFP4 웨이트 / MXFP8 활성화)로 다운로드 크기는 이론 FP16 대비 크게 압축됩니다.
| 항목 | 값 |
|---|---|
| 총 파라미터 | 2.8조(2.8T)——DeepSeek V4 Pro(1.6T) 대비 +75% |
| MoE 구성 | Stable LatentMoE: 896 전문가, 추론 시 16 활성화(1.8% 희소) |
| 아키텍처 | KDA + AttnRes + Gated MLA + Quantile Balancing |
| 컨텍스트 | 1,048,576 token(100만), 텍스트·이미지·영상 입력 |
| 양자화 설계 | MXFP4 웨이트 / MXFP8 활성화(설계 단계부터 양자화 인식) |
| 스케일링 효율 | Kimi K2 대비 약 2.5배(Stable LatentMoE 보고치) |
| 라이선스 | Modified MIT(7/27 공개) |
KDA는 KV 캐시를 최대 75% 줄이고 100만 token 디코드를 6.3배 가속합니다. AttnRes는 깊은 층 정보 손실을 억제해 훈련 효율을 약 25% 개선합니다. vLLM용 KDA 커널과 prefix caching Day-0 지원의 근거가 됩니다.
SECTION 03 벤치마크 대조: K3 강점과 Fable 5 / Sol에 대한 솔직한 후속
Moonshot은 K3가 Claude Fable 5 및 GPT-5.6 Sol에 종합적으로 미치지 못하는 항목이 있음을 공개했습니다. 아래는 Moonshot 자체 보고치(각사 고유 harness 사용)이며, 독립 재현을 기다려야 하는 방향성 데이터입니다.
| 벤치마크 | Kimi K3 | 비교 대상 | 판정 |
|---|---|---|---|
| Intelligence Index v4.1 | 57.1(4위) | Fable 5: 59.9 / Sol: 58.9 | 근소하게 2위 진영에 후속 |
| SWE Marathon | 42.0 | Fable 5: 35.0 / Sol: 39.0 | K3 선행 |
| Program Bench | 77.8 | Sol: 77.6 | K3 선행 |
| Terminal Bench 2.1 | 88.3 | Sol: 88.8 | 근소하게 Sol 선행 |
| BrowseComp | 91.2 | Fable 5: 88.0 | K3 선행 |
| Automation Bench | 30.8 | Fable 5: 29.1 | K3 선행 |
| DeepSWE | 67.5 | Sol: 73.0 | K3 열세 |
| FrontierSWE | 81.2 | Fable 5: 86.6 | K3 열세 |
| OmniDocBench | 91.1 | Fable 5: 89.8 | K3 선행 |
| 환각률(vs K2.6) | 상승 추세 | K2.6 대비 | 열세(Moonshot 자인) |
Frontend Code Arena 1위, SpreadsheetBench 2위 등 코딩·자동화 계열에서 K3가 우위입니다. GDPval Elo와 DeepSWE에서는 Sol / Fable 5가 앞서며, 「종합 1위」가 아니라 「장문·지속 코딩·문서 이해에 특화된 오픈 웨이트 후보」로 보는 것이 타당합니다.
SECTION 04 API 요금과 셀프호스팅 비용 대비: AA 실효 $0.94의 의미
| 모델 | 입력 | 출력 | 캐시 히트 입력 | 컨텍스트 |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Fable 5 | $3.00 | $15.00 | — | 200K |
| GPT-5.6 Sol | $5.00 | $30.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
Artificial Analysis 단일 태스크 실효 비용 추산에서 K3는 $0.94로 Fable 5 대비 65.8% 저렴하다고 보고됩니다. 코딩 Agent 시나리오에서 Moonshot은 90% 이상 캐시 히트율을 공표해 입력 비용을 1/10로 압축할 수 있습니다.
| 시나리오 | 권장 | 이유 |
|---|---|---|
| 7/27 이전 프로덕션 | K3 API | 웨이트 미공개. 즉시 이용 가능 |
| 데이터 레지던시 요건 | 7/27 이후 자체(조건부) | Modified MIT 조항·GPU 조달 전제 |
| 대규모 파인튜닝 | 7/27 이후 자체 | 완전 웨이트 + tech report 필요 |
| 비용 최우선·128K 충분 | DeepSeek V4 Pro API | 출력 $3.48/M로 K3의 1/4 수준 |
| 지속 코딩 Agent | K3 API 또는 자체 | SWE Marathon 42.0, 100만 token |
| 소비자용 하드웨어 | 자체 불가 | 1.4TB / 64+ GPU — 데이터센터급 |
SECTION 05 7월 27일 오픈 웨이트 공개 내용: HF·Modified MIT·vLLM 지원
Moonshot 공식 발표에 따르면 7월 27일 공개 패키지에는 다음이 포함됩니다.
- 완전 모델 웨이트: Hugging Face 다운로드 가능. 2조 파라미터 초과 최초 오픈 웨이트;
- Modified MIT 라이선스: 표준 MIT에 추가 이용 조건. 경쟁 AI 서비스 제공 제한 등 포함 가능;
- tech report: 아키텍처 상세, 훈련 방법, 벤치마크 harness 설명;
- 추론 프레임워크: vLLM(KDA 커널 + prefix caching), SGLang, transformers Day-0 지원 예정;
- 양자화판: MXFP4 / NVFP4 형식 Hugging Face 동시 공개;
- Ollama / GGUF: 공식 Day-0 대상 아님. 커뮤니티 변환 의존. 2.8T 규모로 실용성 제한적.
중국 내 GLM-5.2·DeepSeek V4 Pro와 함께 2026년 하반기는 「오픈 웨이트 파라미터 상한이 폐쇄형 모델에 근접하는」 전환점입니다. Moonshot도 K2 → K2.5 → K3로 단계적 확장하며 ARR 3억 달러 초과·프리머니 밸류에이션 315억 달러 상용 기반 위에서 오픈 웨이트를 투입합니다.
SECTION 06 셀프호스팅 현실과 7월 27일 당일 체크리스트
자체 추론을 진지히 검토하는 팀을 위한 하드웨어 하한은 다음과 같습니다.
- 스토리지: 4-bit 양자화에서도 약 1.4TB 웨이트 용량;
- GPU: 프로덕션 추론에 64장 이상 가속기(NVIDIA H100급) 초노드 구성;
- 네트워크: 1.4TB 다운로드와 멀티노드 통신 대역;
- 성립 시나리오: 데이터 레지던시, 대규모 파인튜닝, 월간 token량이 API 비용을 넘는 고볼륨 추론.
7월 27일 당일 실행할 확인 절차:
- Hugging Face 저장소 확인: Moonshot AI 공식 K3 저장소 URL을 북마크하고, 공개 직후 LICENSE 파일을 먼저 연다;
- Modified MIT 조항 법무 검토: 경쟁 AI 서비스 금지, 재배포 조건, 상업 이용 범위를 사내 정책과 대조;
- tech report 다운로드: 아키텍처도, 양자화 방식, 벤치마크 harness를 기록해 사내 wiki에 인용 가능 데이터로 저장;
- 양자화판 선정: MXFP4 / NVFP4 중 GPU 세대(Hopper / Blackwell)에 맞게 선택. FP16 풀 정밀도는 스토리지·대역 현실성 재검증;
- vLLM / SGLang 설정: KDA 커널과 prefix caching이 활성인 브랜치·릴리스 노트 확인 후 스모크 테스트 1노드에서 단계적 스케일;
- API와 A/B 비교: 동일 프롬프트 세트로 지연·품질·token 비용을 API 결과와 대조. 환각률 상승(K2.6 대비)이 업무 요건을 충족하는지 검증;
- 폴백 API 키 유지: 자체 클러스터 장애 시
kimi-k3API로 전환하는 런북을 준비.
- 파라미터 규모: 2.8T 총계, 896/16 MoE——현재 최대 다운로드 가능 LLM;
- 4-bit 스토리지: 약 1.4TB——일반 SSD 1장으로 부족;
- GPU 하한: 64장 이상 가속기——DeepSeek V4 GA 자체 요건과 동급;
- API 실효 비용: AA 단일 태스크 $0.94, Fable 5 대비 65.8% 절감;
- Intelligence Index: 57.1점(4위)——Fable 5와 2.8점 차;
- 상용 지표: ARR 3억 달러 초과, API 수익 70% 초과, 해외 유료 사용자 +400%.
아래 공식·제3자 소스는 공개 후 링크를 다시 열어 수치와 버전을 대조하세요.
Moonshot AI 공식 블로그: Kimi K3 기술 발표
Artificial Analysis: Intelligence Index v4.1 모델 랭킹
VentureBeat: Moonshot AI Kimi K3 오픈소스 보도
Kimi K3 오픈 웨이트는 API 이용자 선택지를 넓히지만, Kimi Code Agent·macOS CI/CD·7×24 자동 테스트 파이프라인을 통합하는 팀에는 3가지 실무 격차가 남습니다. ① 7월 27일까지 웨이트가 없어 프라이빗 클라우드 조달 사이클이 길어짐; ② VM macOS CI에서 Metal / Core ML 호환성 오버헤드 발생; ③ 로컬 Mac은 슬립 시 Agent 파이프라인 단절. 가상화 성능 손실, 장기 안정성 부족, Root 권한 제한——이들이 겹치는 환경에서 제로 오버헤드 네이티브 Apple 연산, 안정적 iOS CI/CD, AI Agent 7×24 자동화가 필요한 프로덕션 환경에는 MACNOX 클라우드 물리 Mac 노드가 통상 더 나은 선택입니다. 100% Apple 정품 물리 머신, 전체 Root, Hypervisor 오버헤드 없음, 일/주/월 유연 계약. Kimi K3 심층 리뷰, Mac Mini M4 렌탈 vs 구매, 요금 페이지도 함께 참고하세요.
SECTION 07 자주 묻는 질문 FAQ
7월 27일에 Kimi K3를 로컬 PC에서 실행할 수 있나요?
완전 웨이트는 Hugging Face에 공개되지만, 2.8T 규모 프로덕션 추론에는 64장 이상 가속기와 약 1.4TB 4-bit 양자화 스토리지가 필요합니다. 일반 노트북이나 Mac Mini 단독으로는 실용적 추론이 어렵습니다.
Modified MIT 라이선스란 무엇인가요?
Moonshot AI가 K3용으로 정의한 개정 MIT 라이선스입니다. 표준 MIT에 경쟁 AI 서비스 제공 등 추가 이용 조건이 포함될 수 있습니다. 7월 27일 공개되는 tech report와 LICENSE 전문을 반드시 확인하세요.
Kimi K3와 Claude Fable 5 중 어느 쪽이 더 강한가요?
Artificial Analysis Intelligence Index v4.1에서 K3는 57.1점(4위), Fable 5는 59.9점으로 K3가 근소하게 뒤집니다. 반면 SWE Marathon(42.0)과 OmniDocBench(91.1)에서는 K3가 앞서며, 용도에 따라 선택이 갈립니다. Moonshot도 Fable 5/GPT-5.6 Sol과의 종합 격차를 인정했습니다.
셀프호스팅에 필요한 하드웨어는?
Moonshot 권장 프로덕션 추론 구성은 64장 이상 가속기(NVIDIA H100급)를 갖춘 초노드입니다. 4-bit 양자화에서도 웨이트 용량은 약 1.4TB에 달합니다. 데이터 레지던시, 대규모 파인튜닝, 고볼륨 추론 외에는 API 이용이 현실적입니다.
7월 16일과 7월 27일의 차이는?
7월 16일은 API·Kimi App·Kimi Work·Kimi Code를 통한 클라우드 추론이 시작되었습니다. 7월 27일은 Hugging Face 완전 웨이트, Modified MIT 라이선스, tech report 공개일입니다. 다운로드 가능한 오픈 웨이트와 API 접근은 별도 단계입니다.
Ollama나 GGUF 버전이 나오나요?
Day-0에서는 vLLM·SGLang·transformers용 MXFP4/NVFP4 양자화판이 우선될 전망입니다. Ollama/GGUF 변환은 커뮤니티 또는 후속 릴리스에 의존합니다. 2.8T 규모이므로 GGUF에서도 소비자용 하드웨어 실용 추론은 기대하기 어렵습니다.