Kimi K3 오픈 웨이트 공개:2.8조 파라미터, 드디어 다운로드 가능
대상 독자: 7월 27일 Kimi K3 전체 가중치 공개를 추적하는 Mac 개발자·AI 엔지니어. open weight와 open source 혼동, 커스텀 라이선스 상업 조건, 1.56TB 자체 배포 가능 여부가 핵심 불확실성.본문 제공: 공개 총정리, KDA/AttnRes 아키텍처, 벤치마크 대조, API 요금, 64 GPU 배포 요건, 미중 AI 분쟁 맥락.구성: 타임라인·스펙·Infra·benchmark 표, 5단계 도입, FAQ×5, 격리 Mac 임대 CTA.
📋 목차
관련 글: Kimi K3 심층 평가(7/17), 7/22 공개 전 anticipation, Opus 5 + K3 증류 이슈 주보.
Featured Snippet 직답
7월 27일 23시경 Moonshot AI(월지암면)가 Kimi K3 전체 모델 가중치·기술 보고서를 공개하고 MoonEP·FlashKDA·AgentEnv 3대 인프라를 동시 오픈했습니다. K3는 2.8조 파라미터 스파스 MoE(활성 약 1,040억), 100만 토큰 컨텍스트, 가중치 약 1.56TB이며 공개 30분 내 Hugging Face 트렌드 1위. 공식은 일관되게 open weight 표현, open source 아님. 라이선스는 커스텀 조항($20M MAAS 수익·1억 MAU 2대 상업 임계값)——Modified MIT 아님.
7월 27일 밤 Moonshot AI는 Kimi K3 전체 가중치·기술 보고서를 공개하고 학습을 지탱한 MoonEP·FlashKDA·AgentEnv 3대 인프라를 동시 오픈했습니다. Kimi K3는 총 2.8조 파라미터 MoE(활성 약 1,040억), 100만 토큰 컨텍스트, 네이티브 시각 이해를 갖춘 모델로, 세계 최초 완전 공개 3조급 모델입니다. Hugging Face 가중치 약 1.56TB, 공개 30분 내 트렌드 1위. API 최초 공개(7/16)로부터 11일 만의 오픈입니다.
01 · 3대 선정 과제
- 「오픈소스」 의미 함정: Moonshot 공식 자료는 open source 미사용, open weight 일관 표기. OSI 기준은 학습 데이터·코드·재현 파이프라인 필요——K3는 가중치·기술 보고서·일부 Infra만 공개. r/LocalLLaMA에서 용어 오용은 즉시 지적됨.
- 라이선스 2대 상업 임계값: K3는 Modified MIT 아님, 커스텀 라이선스. MAAS 사업 12개월 누적 수익 $20M 초과 시 별도 계약; MAU 1억 또는 월 수익 $20M 초과 시 UI에 「Kimi K3」표기 의무. 중소팀 무감, 「K3로 경쟁 API」는 법무 레드라인.
- 성능 천장 vs 가성비 vs 배포 현실: SWE-bench Verified 독립 재측 93.4%, AA Index 세계 3위——오픈 웨이트 능력 1위. 그러나 태스크당 ~$0.95로 GLM-5.2($0.47)보다 비쌈. 자체 배포는 64+ GPU 슈퍼노드·1.56TB 필수——랭킹·가격표만으로 선정 불가.
02 · 공개 타임라인: 7/16–7/28
| 날짜 | 이벤트 |
|---|---|
| 2026-07-16 | kimi.com·Kimi Work·Kimi Code·API K3 최초 공개(온라인만, 가중치 비공개); 공식 블로그「Kimi K3: Open Frontier Intelligence」; Artificial Analysis 독립 평가 동일일 |
| 2026-07-17 | WAIC 2026 개막; 신화사 K3를「현재 세계 최대 파라미터 오픈소스 모델」로 보도 |
| 2026-07-22–23 | 미중「모델 증류」분쟁 격화: 백악관 기술 고문 Michael Kratsios, Moonshot의 Anthropic Fable 산업 규모 증류 비난; 재무장관 Scott Bessent 제재·엔티티 리스트 검토 시사 |
| 2026-07-27 | 전체 가중치 + 기술 보고서; MoonEP·AgentEnv 오픈(FlashKDA 선행 공개); HF 약 1.56TB, 30분 내 트렌드 1위 |
| 2026-07-28 | 중국 상무부 미중 AI 분쟁 공식 대응, 미국「AI 패권주의」비난·보복 경고; 국내 매체 오픈 세부 보도 |
03 · Kimi K3 핵심 스펙
| 항목 | 스펙 |
|---|---|
| 총 파라미터 | 2.8조(2.8T) |
| 활성 파라미터 | 약 1,040억 |
| 아키텍처 | MoE, Stable LatentMoE |
| 전문가 구성 | 896 라우팅 전문가, 토큰당 16 활성(공유 전문가 포함, 희소도 ~1.8%) |
| 어텐션 | Kimi Delta Attention(KDA) + Gated MLA |
| 컨텍스트 | 100만 토큰(1,048,576) |
| 멀티모달 | 네이티브 시각 이해(ViT-V2, 27층) |
| 가중치 형식 | MXFP4 가중치 + MXFP8 활성(SFT 단계부터 양자화 인식 학습) |
| 가중치 용량 | 약 1.56TB(Hugging Face) |
| License | 커스텀 라이선스(open weight, Modified MIT 아님) |
핵심 데이터 #1: 1.56TB 전체 가중치 + 100만 토큰——세계 최초 완전 공개 3T급. 클로즈드 경쟁사가 동일 단가로 복제하기 어려운 구조적 우위.
04 · 4대 아키텍처 혁신: KDA, AttnRes, Per-Head Muon, Stable LatentMoE
Kimi K3는 어텐션·잔차 연결·옵티마이저 3대 딥러닝 컴포넌트를 재설계했습니다. 단순 파라미터 적층과의 결정적 차이.
4.1 Kimi Delta Attention(KDA): 더 정밀한 「망각」
기존 Gated DeltaNet은 스칼라 망각 게이트——전체 메모리에 동일 감쇠. KDA는 채널별 게이트로 각 특징 차원이 독립 감쇠율 보유. chunkwise DPLR(Diagonal-Plus-Low-Rank)로 선형 시간 재귀, 장시퀀스 VRAM 대폭 절감. K3는 KDA와 소수 글로벌 어텐션(Gated MLA) 교차 배치로 100만 토큰·극소 KV Cache 동시 달성.
4.2 Attention Residuals(AttnRes): 선택적 잔차 집계
기존 잔차는 층별 균등 가산, 깊을수록 초기 정보 희석. AttnRes는 입력 기반으로 앞층 전체 출력을 동적 집계——층당 RMSNorm·의사 쿼리 벡터 1개 추가로 25% 학습 효율 향상(비용 2% 미만). 의사 쿼리는 제로 초기화로 학습 초기 균등 평균과 동일.
4.3 Per-Head Muon: 헤드별 독립 최적화
Muon 옵티마이저를 어텐션 헤드 단위로 확장, 각 헤드가 적응적 수렴 경로 보유. 학습기 전용 기술로 API 사용자 무감, K3가 적은 활성 파라미터로 최상위 클로즈드에 근접하는 핵심 요인.
4.4 Stable LatentMoE: 896 중 16 스파스 설계
896 라우팅 전문가 중 토큰당 16만 활성(희소도 ~1.8%). 공유 전문가로 기초 능력 안정화, Quantile Balancing·MoonEP 이론 상한 증명으로 부하 분산 보장.
05 · 3대 오픈 Infra: MoonEP, FlashKDA, AgentEnv
Moonshot은 가중치뿐 아니라 K3 학습 효율·안정성을 지탱하는 3대 인프라도 공개——개발자 커뮤니티 고평가 이유.
| 기술 | 역할 | 핵심 기능 |
|---|---|---|
| MoonEP | 초대규모 세밀 MoE 고성능 통신 라이브러리 | 과부하 전문가 임시 복제로 노드별 토큰 수 균등화; 중복 전문가 수 이론 상한 수학 증명 |
| FlashKDA | NVIDIA CUTLASS 기반 KDA 고성능 커널(선행 공개) | NVIDIA H20 prefill flash-linear-attention 대비 1.72–2.22배; chunk_kda 드롭인 교체 |
| AgentEnv | KVCache.ai 공동 개발 Agent 샌드박스(Firecracker microVM) | 대규모 병렬 Agent RL 학습; 빠른 스냅샷·복구·fork; checkpoint 지연 133ms, 복구 49ms, 메모리 오버커밋 최대 6.5배(제3자 검증 대기) |
핵심 데이터 #2: FlashKDA H20 prefill 1.72–2.22배 가속——공개된 것은 가중치뿐 아니라 재사용 가능한 엔지니어링 스택.
06 · 벤치마크 비교: SWE-bench·Artificial Analysis
기관·프레임워크별 수치 편차 큼. 독립 제3자 재측 데이터 우선.
6.1 SWE-bench Verified(독립 재측, Vals AI, 2026년 7월)
| 모델 | 점수 | 공개일 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
6.2 Artificial Analysis 지능 지수(max 추론)
- Claude Fable 5(max + fallback): 60
- GPT-5.6 Sol(max): 59
- Kimi K3(max): 약 57, 세계 3위, 오픈 웨이트 1위
- GLM-5.2(max): 51(기존 오픈 웨이트 1위)
- DeepSeek V4 Pro(max): 44
Kimi K3는 3T급 오픈 웨이트 종합 1위이나 가성비 최우는 아님——태스크당 ~$0.95, Claude Fable 5(~$2.4) 대비 60% 저렴하나 GLM-5.2(~$0.47)보다 비쌈. 오픈 웨이트 성능 천장=K3, 가성비 최우=타 모델. K3는 Arena.ai Frontend Code Arena 현재 1위.
07 · 오픈 웨이트 vs 오픈소스? 커스텀 라이선스 2대 임계값
이번 공개 최대 논쟁·기업 사용자 필독 구간.
Moonshot 공식 자료는 「open source」미사용, 일관 open weight(오픈 웨이트) 표기. OSI 기준 진정 오픈소스는 학습 데이터·코드·완전 재현 파이프라인 필요——K3는 학습 완료 가중치·기술 보고서·추론 Infra만 공개.
라이선스는 Modified MIT 아님(K2 시대 표현). 완전 커스텀 문서, K2에 없던 2대 상업 임계값:
- Model-as-a-Service 수익 임계값: 피허가자·관계사 MAAS 사업 12개월 누적 수익 $20M(2,000만 달러) 초과 시 Moonshot 별도 상업 계약 필요.
- 규모 표시 임계값: 제품·서비스 MAU 1억 초과 또는 월 수익 $20M 초과 시 UI에「Kimi K3」눈에 띄게 표기 의무.
대다수 중소·스타트업 무영향. 「K3로 Moonshot 경쟁 API」계획은 제1 임계값이 법무 레드라인.
08 · API 요금·자체 배포: 64 GPU 슈퍼노드·1.56TB
8.1 API
Moonshot OpenAI SDK 호환 Chat Completions API(https://api.moonshot.ai/v1, 모델 ID kimi-k3). base URL·키 변경만으로 대부분 프로젝트 이전 가능.
| 토큰 유형 | 가격(100만 토큰당) |
|---|---|
| 입력(캐시 히트) | $0.30 |
| 입력(캐시 미스) | $3.00 |
| 출력(추론 과정 포함) | $15.00 |
Mooncake 분리 추론 아키텍처에서 전형적 코딩 워크로드 캐시 히트율 90% 이상——실비용은 $0.30대에 근접.
8.2 자체 배포
2.8조·896 전문가 규모로 소비자 하드웨어 실행 비현실. 공식 권장 64장 이상 GPU 슈퍼노드, 가중치 ~1.56TB. 개인·중소팀 현실 경로: 공식 API 또는 OpenRouter 등(현재 7개사, 가격 대체로 공식 동일).
핵심 데이터 #3: 1.56TB + 64+ 가속기——「MacBook에서 K3 실행」류 튜토리얼은 프로덕션 무시. 정답은 API 또는 매니지드 라우팅.
09 · 미중 AI 분쟁, 상무부 7/28 대응·Qwen3.8-Max-Preview
Kimi K3 오픈은 고립 사건 아님. WAIC 2026 타이밍과 격화 중인 미중「모델 증류」분쟁 중첩. 가중치 공개 며칠 전 미측 Moonshot의 Anthropic「산업 규모 증류」비난·제재 시사. 7월 28일 중국상무부 공식 대응, 미국「AI 패권주의」비난·보복 경고.
이 맥락에서 Moonshot이 가중치·기술 보고서·3대 Infra 전부 공개한 것은 완전한 엔지니어링 세부로 기술 경로 독립성 입증 의도로도 해석. 3일 후 알리바바(Moonshot 투자사) 24조 파라미터 Qwen3.8-Max-Preview 발표——K3 직접 대응으로 해석, 중국 대규모 모델 경쟁「3T 클럽」진입.
10 · 5단계 도입(Mac 개발자)
- platform.kimi.ai API Key 발급, OpenAI 호환 SDK로
kimi-k3베이스라인(장문/버그 수정/멀티파일 리팩터 각 1건) 실행 - 컨텍스트 캐시 활성화, 코딩 씬 히트율·실 $/task 기록, Fable 5/GPT-5.6 청구 대조
- Hugging Face Moonshot 조직 저장소 확인: 1.56TB 가중치 분할, LICENSE 커스텀 조항, 기술 보고서 PDF
- 격리 환경(메인 Mac 외)에서 Kimi Code 또는 Cursor + K3 라우팅 시험, API Key 글로벌 shell 오염 방지
- 7/17 심층 평가 아키텍처 장 읽고 본문 라이선스·Infra 업데이트 반영해 선정 문서 완성
11 · FAQ
Q: Kimi K3는 오픈소스 모델인가요?
A: 엄밀히 아닙니다. open weight 모델로 학습 가중치·기술 보고서·일부 Infra 공개, 학습 데이터·전체 코드 비공개. OSI 오픈소스 정의 미충족.
Q: Kimi K3 상업적 무료 사용 가능?
A: 대부분 가능. MAAS 연간 수익 2,000만 달러 초과, 또는 MAU 1억/월 수익 2,000만 달러 초과 시 라이선스 추가 조건 충족 필요.
Q: 자체 배포 GPU 몇 장?
A: 공식 권장 64장 이상 슈퍼노드. 개인·중소기업은 API 또는 OpenRouter 등이 현실적.
Q: 성능 수준?
A: 오픈 웨이트 종합 1위, AA 지능 지수 세계 3위. GLM-5.2보다 비용 높아 성능 최고·가성비 최우 아님.
Q: K3 vs K2 차이?
A: K3 K2.5 대비 ~3배 파라미터, AttnRes·Per-Head Muon 신규, 컨텍스트·멀티모달 대폭 향상. 라이선스 커스텀+MAAS 임계값, Modified MIT 아님.
12 · 격리 Mac 임대: 메인 머신 밖에서 Kimi K3 API 검증
가중치 공개됐으나 1.56TB 다운로드·64 GPU 자체 배포는 Mac 개발자에게 비현실. 현실적 경로: 격리 Apple Silicon 노드에서 Kimi K3 API 워크플로 완주. Moonshot Key를 임대 머신에 기록해 메인 Keychain 오염 방지, 100만 토큰 장컨텍스트 실험이 로컬 캐시 오염 없음, Claude/GPT 동일 저장소 대조를「쓰고 버리는」환경에서 재현. Windows/Linux는 kimi.com 체험 가능하나 macOS 네이티브 툴체인 공존 Kimi Code 시나리오 검증 불가.
노트북 직접 K3 API 연결 가능하나 메인 머신은 안정적 납품에 적합. 격리 Mac 시험은 Key 유출·장컨텍스트 실험 비가역 리스크 감소, 임대는「모델 시험」전용 하드웨어 구매 회피. 일 단위 M 시리즈 Mac mini 쓰고 버리는 격리 환경·SSH·요금은 M 시리즈 Mac 임대 요금 안내 참고.
13 · 출처
- 공식: kimi.com/blog/kimi-k3, platform.kimi.ai(API·요금), Hugging Face(moonshotai 조직)
- 오픈 Infra: GitHub moonshotai/FlashKDA, MoonEP, AgentEnv
- 독립 평가: Vals AI SWE-bench Verified, Artificial Analysis Intelligence Index(7월 16일)
- 심층 보도: VentureBeat, Simon Willison's blog, Scientific American, The Register
- 지정학·커뮤니티: 상무부 7/28 대응, 백악관 증류 비난, Hacker News, r/LocalLLaMA
데이터 정리일: 2026년 7월 28일. 최신 LICENSE 원문·Hugging Face 저장소 확인 권장.