Kimi K3 Poids Ouverts le 27 juillet : 2,8 billions de paramètres, 1M de contexte — la prime closed source tient-elle encore ?
Pour qui ? Développeurs Mac et ingénieurs IA qui suivent la sortie du 27/07 mais confondent API (16/07) et poids téléchargeables (27/07), et hésitent entre self-hosting et Claude Fable 5. Contenu : frise chronologique, tableau de specs, matrice benchmarks, coût API réel, seuils de déploiement, checklist J-day, contexte industrie et cinq étapes de préparation.
📋 Sommaire
Avis approfondi : Kimi K3 Avis (17/07) ; comparaisons : GPT-5.6 Sol benchmark, alternatives Claude Fable 5.
Réponse directe
Moonshot AI publie le 27 juillet 2026 sur Hugging Face les poids complets de Kimi K3 sous licence Modified MIT — modèle MoE sparse 2,8T avec fenêtre de 1 048 576 tokens. L'API et la suite Kimi sont disponibles depuis le 16 juillet ; le 27/07 marque le second jalon (open weights).
01 · TL;DR
- 16 juillet : Kimi K3 via Kimi App, Kimi Work, Kimi Code et API ; Artificial Analysis publie un test indépendant le même jour.
- 27 juillet : Poids complets (Modified MIT) + rapport technique (architecture, entraînement, évaluation).
- Positionnement : Premier modèle open weights proche des 3T — pression directe sur la tarification closed source.
- Verdict : Pas un « tueur de Fable 5 » — index AA 57,1 (3e place), mais ~⅓ du coût pour une capacité quasi-frontier plus poids ouverts + 1M tokens.
02 · Trois points de friction décisionnels
- Deux dates confondues : API depuis le 16/07 ≠ poids le 27/07. Les tutos « K3 en local sur Mac » avant le drop sont du clickbait ; le MoE production exige des super-nœuds, pas un Apple Silicon.
- Sémantique « open source » : La communauté distingue open weights et open source. K3 livre poids + Modified MIT ; code/données d'entraînement à valider le 27/07 — mauvais vocabulaire = perte de crédibilité sur r/LocalLLaMA.
- Benchmark vs facture vs stabilité : Frontend Code Arena #1, SWE Marathon 42,0 — mais GDPval, DeepSWE et taux d'hallucination derrière Fable 5/Sol. ~0,94 $/tâche (−65,8 % vs Fable 5) n'implique pas une qualité de dialogue production-ready.
03 · Frise chronologique
| Date | Événement |
|---|---|
| 2026-07-16 | Kimi K3 via API / suite Kimi ; test indépendant Artificial Analysis |
| 2026-07-17 | WAIC Shanghai — médias d'État qualifient K3 de jalon national |
| 2026-07-27 | Poids complets (Hugging Face, Modified MIT) + rapport technique |
À la rédaction (22 juillet) : encore 5 jours avant le drop — dernière fenêtre pour préparer SEO « kimi k3 download » et validation interne.
04 · Spécifications du modèle
| Attribut | Valeur |
|---|---|
| Paramètres | 2,8T — plus grand modèle open weights |
| Architecture | MoE sparse Stable LatentMoE : 896 experts, 16 actifs/token |
| Attention | Kimi Delta Attention (KDA) + AttnRes + Gated MLA |
| Contexte | 1 048 576 tokens (~1M) |
| Modalité | Vision native (texte + image, produit aussi vidéo), sortie texte |
| Format poids | MXFP4 poids + MXFP8 activations |
| Efficacité | ~2,5× vs K2 à compute égale |
| Stabilité entraînement | Quantile Balancing, Per-Head Muon, SiTU |
| Décodage long contexte | KDA jusqu'à 6,3× plus rapide à 1M tokens |
Donnée clé #1 : KDA rend le contexte 1M utilisable à 3 $/M d'entrée — avantage structurel face aux concurrents closed source.
05 · Sortie API vs poids ouverts
- 16 juillet (en ligne) : kimi.com, Kimi Code, API (
kimi-k3), OpenRouter (moonshotai/kimi-k3) — produit/API. - 27 juillet (prévu) : Hugging Face Moonshot — poids 2,8T complets, rapport, support vLLM KDA/prefix caching — open weights.
06 · Matrice benchmarks : victoires et lacunes
6.1 Intelligence Index (Artificial Analysis)
| Modèle | Score |
|---|---|
| Claude Fable 5 | 59,9 |
| GPT-5.6 Sol | 58,9 |
| Kimi K3 | 57,1 (rang 3 / 189) |
6.2 K3 mène ou égale
- Frontend Code Arena : #1 (code UI préféré en tests aveugles)
- Automation Bench, SpreadsheetBench 2 : #1
- BrowseComp : 91,2 (#1 ; avec 1M sans compression ~90,4+)
- SWE Marathon : 42,0 — largement devant GPT-5.5 / GLM-5.2 (dizaines)
- Terminal Bench 2.1 : 88,3 ≈ Sol 88,8
- Program Bench : 77,8 vs Sol 77,6
- FrontierSWE : 81,2 vs Sol 71,3 (Fable 5 : 86,6)
6.3 K3 en retrait
- GDPval v2 Elo : 1668–1687 vs Fable 5 1760, Sol 1748
- DeepSWE : 67,5 vs Sol 73,0
- Taux d'hallucination : en hausse vs K2.6 (admis officiellement) ; retours Reddit sur plus d'erreurs en self-host
- Qualité dialogue / variance : derrière Fable 5 et Sol
Moonshot reconnaît publiquement un score global inférieur à Fable 5 et GPT-5.6 Sol — transparence rare pour un lancement frontier chinois.
Donnée clé #2 : Artificial Analysis — K3 0,94 $ par tâche, 65,8 % moins cher que Fable 5 ; « near-frontier at a third of the cost » est documenté.
07 · Tarifs API & coût réel
| Poste | Prix / 1M tokens |
|---|---|
| Entrée (cache miss) | 3,00 $ |
| Entrée (cache hit) | 0,30 $ |
| Sortie | 15,00 $ |
Tarifs les plus élevés parmi les fournisseurs chinois, mais bien en dessous d'Opus 4.8 par tâche. Workloads code : cache >90 % → coût effectif bien sous le prix affiché.
08 · Open weights vs open source
- Open weights : fichiers de poids complets, inférence, fine-tuning (selon LICENSE) — K3 entre ici.
- Open source : code d'entraînement, données, pipeline reproductible — à vérifier le 27/07 via LICENSE + rapport.
Licence : Modified MIT. Dire « poids ouverts » plutôt que « entièrement open source » en communication externe.
09 · Déploiement local : limites honnêtes
- Poids 4-bit ~1,4 To
- Officiellement 64+ accélérateurs en super-nœud, parallélisme expert + tensoriel
- Référence K2.7 Code (1T) : INT4 ~577 Go — K3 est 2,8× plus grand
Pour la majorité : API (3/15 $). Self-host seulement pour résidence des données, fine-tuning ou volume extrême.
Donnée clé #3 : 1,4 To + 64 cartes — tout guide « K3 sur MacBook » post-27/07 reste hors production.
10 · Que se passe-t-il le 27 juillet
- Poids 2,8T complets sur Hugging Face Moonshot (Modified MIT)
- Rapport technique (architecture, entraînement, évaluation)
- Support vLLM KDA / prefix caching dès le release
- Attendu : quantifications Ollama, GGUF comme pour la série K2
11 · Checklist J-day (2 premières heures)
- Dépôt HF : config, tokenizer, index de shards complets ?
- Texte LICENSE (clauses Modified MIT)
- Quantifications synchrones ? (MXFP4 / NVFP4 / GGUF)
- Commandes vLLM / SGLang + hardware minimum
- Retest indépendant contexte 1M dans un harness tiers
12 · Pourquoi le 27/07 compte
- Open vs closed quasi à égalité : écart réduit à 2–3 points d'index.
- Géopolitique : sortie avant WAIC ; régulation US peut bloquer des modèles closed — pas des poids publiés.
- Vague chinoise : GLM-5.2, DeepSeek V4 Pro (1,6T), MiniMax — K3 en tête.
- Retour de Moonshot : chute au rang 7 après DeepSeek R1 — stratégie K2 → K2.5 → K3 open weights.
13 · Cinq étapes avant le 27/07 (dev Mac)
- Clé API sur platform.kimi.ai ; SDK OpenAI avec
kimi-k3— une tâche long doc / bugfix / refactor multi-fichiers - Activer le cache contexte ; noter hit-rate et $/tâche vs Fable 5 / GPT-5.6
- Bookmark Hugging Face Moonshot ; rappel calendrier 27/07
- Mac isolé (pas la machine principale) : Kimi Code ou Cursor + routage K3
- Relire architecture/benchmarks de l'avis du 17/07 — le jour J, mettre à jour lien HF + LICENSE seulement
14 · FAQ
Q : Quand les poids ?
R : 27 juillet 2026 Hugging Face + rapport. API depuis le 16 juillet.
Q : Vraiment open source ?
R : Open weights + Modified MIT ; fully open source selon code/données publiés.
Q : Prix ?
R : 3/15 $ par 1M ; entrée cache 0,30 $. ~0,94 $/tâche, −65,8 % vs Fable 5.
Q : Local sur Mac ?
R : Non. ~1,4 To, 64+ cartes. API ou petits GGUF distillés plus tard.
Q : Plus fort que Fable 5 / GPT-5.6 ?
R : Global 3e (57,1) ; frontend + longues sessions code en tête ; jugement long terme en retrait.
Q : Licence ?
R : Modified MIT — LICENSE HF le 27/07 fait foi.
Q : K3 vs DeepSeek ?
R : K3 plus intelligent (57,1), DeepSeek V4 Pro API bien moins cher (3,48 $/M sortie vs 15 $). Budget → DeepSeek ; 1M + plus gros poids → K3.
15 · Mac isolé : validation API avant le drop des poids
Jusqu'au 27/07, valider l'API prime sur le téléchargement : clé Moonshot sur nœud Apple Silicon loué, tests million-tokens sans Keychain sur le Mac principal, K3 vs Claude/GPT sur le même dépôt en environnement éphémère. Windows/Linux accèdent à kimi.com mais pas à la toolchain Kimi Code/macOS complète.
Location journalière série M : tarifs compute.
16 · Sources
- Officiel : kimi.com/en/blog/kimi-k3, platform.kimi.ai
- Artificial Analysis (index 57,1, 16/07)
- VentureBeat, Northflank (analyse self-host), atoms.dev / llmrumors
- Communauté : r/LocalLLaMA, Hacker News
Données au 22 juillet 2026 (5 jours avant les poids). Après le 27/07, mettre à jour lien HF direct et LICENSE.