7월 27일 23시경 Moonshot AI(월지암면)가 Kimi K3의 완전 모델 웨이트와 기술 보고서를 공개하고, 학습을 뒷받침한 핵심 인프라 MoonEP, FlashKDA, AgentEnv를 동시에 오픈소스로 내놓았습니다. 2.8조 총 파라미터, 약 1,040억 활성 파라미터, 100만 토큰 컨텍스트, 네이티브 비전 이해를 갖춘 전 세계 최초의 3T급 완전 공개 모델이며, Hugging Face 웨이트는 약 1.56TB로 공개 30분 만에 트렌딩 1위를 기록했습니다. 본문은 K3 연동·자체 배포를 검토하는 AI 개발자와 엔터프라이즈 기술팀을 대상으로 아키텍처 혁신, 벤치마크 대조, 라이선스 상업 임계값, API·하드웨어 현실 경로를 체계적으로 정리합니다.
SECTION 01 Kimi K3 선정 시 흔한 오판: 오픈소스 혼동, 라이선스 함정, 자체 배포 장벽
7월 27일 웨이트 공개 이후 개발자 커뮤니티에서 가장 많이 발생하는 오판은 다음과 같습니다.
- 「오픈 웨이트」를 「오픈소스」로 착각: Moonshot 공식 자료는 open source가 아닌 open weight만 사용합니다. 학습 데이터와 전체 학습 코드는 공개되지 않아 OSI 기준을 충족하지 않습니다;
- K2 시대 Modified MIT 인상을 그대로 적용: K3는 완전 커스텀 라이선스로 전환되었으며 Model-as-a-Service 수익 임계값과 규모 표시 조항이 추가되어 7월 22일 예고문과 달라졌습니다;
- 자체 배포 하드웨어 비용 과소평가: 896개 라우팅 전문가와 1.56TB 웨이트는 소비자급 하드웨어로는 사실상 불가능하며, 공식 권장은 64장 이상 가속기 초노드입니다;
- 벤더 자체 벤치마크만 참조: 평가 프레임워크 간 편차가 큽니다. Vals AI, Artificial Analysis 등 독립 제3자 재측정을 우선해야 합니다;
- 지정학·컴플라이언스 배경 간과: 웨이트 공개는 미중 「모델 증류」 분쟁 격화와 맞물립니다. Kimi K3 증류 논란을 함께 검토하십시오.
Kimi K3가 kimi.com·API에서 첫 공개된 뒤 7월 27일 완전 웨이트 공개까지 단 11일 — 국산 대형 모델 경쟁이 「3T 클럽」 단계에 진입했음을 보여주는 신호입니다.
SECTION 02 Kimi K3 공개 타임라인과 핵심 사양
- 7월 16일(WAIC 2026 전야): kimi.com, Kimi Work, Kimi Code, API에서 K3 선행 출시. 웨이트 미공개;
- 7월 17일: 업계 아키텍처 분석 집중. 신화통신 「현재 전 세계 파라미터 최대 오픈 모델」 보도;
- 7월 22–23일: 미중 「모델 증류」 분쟁 격화. 미 측, Anthropic Fable 모델에 대한 산업 규모 증류 주장;
- 7월 27일 23시경: 완전 웨이트·기술 보고서 공개, MoonEP·AgentEnv 오픈(FlashKDA는 선행 오픈);
- 7월 28일: 중국 상무부, 미 「AI 패권주의」 주장에 공식 반박. Alibaba 24조 파라미터 Qwen3.8-Max-Preview 공개, K3에 대한 직접 대응으로 해석.
| 항목 | 값 |
|---|---|
| 총 파라미터 | 2.8조(2.8T) |
| 활성 파라미터 | 약 1,040억 |
| 아키텍처 | MoE — 896 라우팅 전문가, 토큰당 16개 활성 |
| 어텐션 | Kimi Delta Attention(KDA) + Gated MLA |
| 컨텍스트 | 100만 토큰 |
| 멀티모달 | 네이티브 비전(ViT-V2, 27층) |
| 웨이트 형식 | MXFP4 웨이트 + MXFP8 활성(SFT 단계부터 양자화 인식 학습) |
| 다운로드 용량 | 약 1.56TB(Hugging Face) |
| 라이선스 | 커스텀 라이선스(공식 표현: open weight, open source 아님) |
SECTION 03 KDA, AttnRes, Per-Head Muon: Kimi K3 3대 아키텍처 혁신
Kimi K3는 단순 파라미터 확장이 아니라 딥러닝의 전통적 구성요소인 어텐션, 잔차 연결, 옵티마이저를 재설계했습니다.
Kimi Delta Attention(KDA): 기존 Gated DeltaNet은 스칼라 망각 게이트를 사용합니다. KDA는 채널별 게이팅으로 전환해 각 특징 차원이 독립적인 감쇠율을 갖습니다. chunkwise DPLR(Diagonal-Plus-Low-Rank) 공식으로 선형 시간 재귀를 구현하고, 소수의 전역 Gated MLA 층과 교차 배치해 100만 토큰 컨텍스트를 지원하면서 KV Cache 부담을 최소화합니다.
Attention Residuals(AttnRes): 기존 잔차 연결은 층마다 균일하게 누적합니다. AttnRes는 입력에 따라 이전 모든 층 출력을 선택적으로 동적 집계하며, 층당 RMSNorm 하나와 pseudo-query 벡터 하나만 추가해 약 25% 학습 효율 향상을 달성합니다(비용 2% 미만).
Per-Head Muon: Muon 옵티마이저를 어텐션 헤드 단위로 독립 적용합니다. Stable LatentMoE(896 중 16 활성, 희소도 약 1.8%)와 Quantile Balancing과 결합해 계산 노드당 중복 전문가 수의 이론적 상한을 증명합니다.
SECTION 04 MoonEP, FlashKDA, AgentEnv와 벤치마크 대조
| 기술 | 역할 | 핵심 능력 |
|---|---|---|
| MoonEP | 초대규모 세밀 MoE 통신 라이브러리 | 과부하 전문가 임시 복제로 노드당 동일 토큰 수 보장, 중복 전문가 이론 상한 증명 |
| FlashKDA | CUTLASS 기반 KDA 고성능 커널 | H20에서 prefill이 flash-linear-attention 대비 1.72–2.22배 빠름, chunk_kda 직접 대체 가능 |
| AgentEnv | KVCache.ai 공동 개발 Agent 샌드박스 | Firecracker microVM 기반, checkpoint 133ms, 복구 49ms, 메모리 오버커밋 최대 6.5배 |
SWE-bench Verified(독립 재측정, Vals AI, 2026년 7월 기준):
| 모델 | 점수 | 출시일 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
Artificial Analysis Intelligence Index(max 추론 티어)에서 Kimi K3는 약 57점 — 전 세계 3위, 오픈 웨이트 1위(Claude Fable 5 60, GPT-5.6 Sol 59에 뒤따름). 태스크당 약 $0.95로 Claude Fable 5(약 $2.4) 대비 60% 저렴하나 GLM-5.2(약 $0.47)보다 비쌉니다. 오픈 웨이트 진영 능력 상한은 가장 높지만 가성비 1위는 아닙니다. Arena.ai Frontend Code Arena 현재 1위입니다.
SECTION 05 Kimi K3 라이선스, API 요금, 6단계 연동 체크리스트
커스텀 라이선스에는 K2 시리즈에 없던 두 가지 상업 임계값이 포함됩니다.
- Model-as-a-Service 수익 임계값: MaaS 사업을 운영하며 연속 12개월 누적 수익이 2,000만 달러를 초과하면 Moonshot AI와 별도 상업 계약이 필요합니다;
- 규모 표시 임계값: 제품 MAU가 1억을 초과하거나 월 수익이 2,000만 달러를 초과하면 UI에 「Kimi K3」표시가 필요합니다.
| 토큰 유형 | 가격 |
|---|---|
| 입력(캐시 히트) | $0.30 |
| 입력(캐시 미스) | $3.00 |
| 출력(추론 과정 포함) | $15.00 |
Mooncake 분리형 추론 아키텍처는 일반 코딩 워크로드에서 캐시 히트율 90% 이상을 달성해 실효 비용은 $0.30대에 가깝습니다. 자체 배포는 64장 이상 가속기가 필요하며, 개인·중소 팀에게 현실적인 경로는 공식 API 또는 OpenRouter입니다.
- 라이선스 준수 확인: K3 커스텀 라이선스 전문을 검토하고 MaaS 수익·규모 표시 조항 적용 여부를 판단합니다;
- 연동 경로 선택: API(OpenAI SDK 호환, base URL
https://api.moonshot.ai/v1, 모델 IDkimi-k3) 또는 OpenRouter 등 제3자 호스팅; - API 키 구성: Moonshot 콘솔에서 키를 생성하고 프로젝트의 base URL·API key를 교체합니다;
- 캐시 히트율 테스트: 코딩 Agent 워크로드 소규모 부하 테스트로 Mooncake 캐시가 실제 비용에 미치는 영향을 측정합니다;
- 자체 배포 타당성 평가: 로컬 추론이 필요하면 GPU 클러스터 규모(64장+ 권장)와 1.56TB 웨이트 스토리지를 확인합니다;
- Infra 도구체인 통합: MoE 학습·KDA 가속 시 MoonEP, FlashKDA(chunk_kda 대체), AgentEnv 샌드박스 적용성을 각각 평가합니다.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain Kimi Delta Attention in 3 sentences."}]
)
print(response.choices[0].message.content)
SECTION 06 인용 가능 기술 데이터와 선정 결론
- 총 2.8T / 활성 약 104B: 역대 최대 완전 오픈 웨이트, Hugging Face 다운로드 약 1.56TB;
- SWE-bench Verified 93.4%: Vals AI 독립 재측정, 오픈 웨이트 1위, Claude Opus 5(97%) 대비 3.6%p 차;
- Artificial Analysis Intelligence Index 약 57: 전 세계 3위, 오픈 웨이트 1위, 태스크당 $0.95;
- FlashKDA prefill 1.72–2.22배: NVIDIA H20에서 flash-linear-attention 대비;
- AgentEnv checkpoint 133ms / 복구 49ms: Moonshot 공식 수치, 제3자 독립 재현은 아직 없음.
아래 링크는 공식·제3자 출처입니다. 배포 전 최신 페이지를 다시 확인하십시오.
Moonshot AI 공식 블로그: Kimi K3 기술 보고서
Hugging Face: moonshotai 조직(K3 웨이트 다운로드)
K3 기반 Agent 파이프라인을 구축할 계획이라면, 가상화 Mac 환경은 Xcode 빌드, Metal 가속, iOS CI에서 성능 손실과 호환성 리스크가 있습니다. 제로 손실 네이티브 연산, 안정적 iOS CI/CD, AI Agent 7×24 자동화가 필요한 프로덕션 환경에서는 MACNOX 클라우드 물리 노드가 일반적으로 더 나은 선택입니다: 100% Apple 정품 하드웨어, 완전 Root, Hypervisor 오버헤드 없음, 일·주·월 유연 과금. K3 배경은 Kimi K3 심층 리뷰와 OpenRouter 7월 랭킹 분석을 참고하십시오.
SECTION 07 자주 묻는 질문 FAQ
Kimi K3는 진짜 오픈소스 모델인가요?
엄밀히는 아닙니다. open weight 모델로, 학습 완료 웨이트·기술 보고서·일부 Infra 도구는 공개되지만 학습 데이터와 전체 학습 코드는 공개되지 않아 OSI 기준의 「오픈소스」에 해당하지 않습니다.
Kimi K3를 상업적으로 무료 사용할 수 있나요?
대부분의 상업 시나리오에서 가능합니다. MaaS 사업 연간 수익 2,000만 달러 초과, 또는 MAU 1억·월 수익 2,000만 달러 초과 시 라이선스의 추가 조항을 충족해야 합니다.
Kimi K3 자체 배포에 GPU가 몇 장 필요한가요?
공식 권장은 64장 이상 가속기를 갖춘 초노드입니다. 대부분의 개발자와 기업은 공식 API 또는 OpenRouter 호스팅이 현실적입니다.
Kimi K3 성능은 실제로 강한가요?
오픈 웨이트 진영에서 종합 능력 1위이며 Artificial Analysis Intelligence Index 전 세계 3위입니다. GLM-5.2보다 비용이 높아 「오픈 웨이트 상한 최고, 가성비 1위는 아님」에 해당합니다.
Kimi K3와 Kimi K2의 차이는 무엇인가요?
K3는 K2.5 대비 약 3배 파라미터, Attention Residuals·Per-Head Muon 추가, 컨텍스트·멀티모달 대폭 확장입니다. 라이선스에 K2에 없던 MaaS 수익 임계값이 추가되었습니다.