Open Weight 27 juillet 2026 2026-07-28

Kimi K3 open weight : le plus grand LLM publié intégralement change la donne pour les développeurs Mac

Pour qui ? Développeurs sur Mac qui suivent la publication des poids du 27 juillet et hésitent entre API, self-hosting et conformité licence. Ce guide apporte : architecture KDA, infra MoonEP/FlashKDA/AgentEnv, benchmarks indépendants, seuils de licence et tarification API. Structure : chronologie, tableaux de specs, 5 étapes de validation, FAQ×5, location Mac isolée.

Publication open weight de Kimi K3 le 27 juillet 2026 : MoE 2,8T, MoonEP, FlashKDA et AgentEnv

Articles connexes : avis approfondi (17/07), anticipation avant le 27/07, controverse distillation Opus 5.

En bref

Le 27 juillet 2026, vers 23 h (heure de Pékin), Moonshot AI a publié l'intégralité des poids de Kimi K3 (~1,56 To sur Hugging Face), le rapport technique, et ouvert MoonEP et AgentEnv (FlashKDA l'était déjà). Kimi K3 est un MoE sparse de 2,8 billions de paramètres avec ~104 milliards activés par token, un contexte de 1 million de tokens et un score SWE-bench Verified de 93,4 %. La formulation officielle reste open weight, jamais open source ; la licence est personnalisée, avec des seuils à 20 M$ (MAAS) et 100 M MAU — plus le Modified MIT de la série K2.

Onze jours seulement après le lancement API du 16 juillet, Moonshot a franchi un cap historique : le premier modèle de classe 3T entièrement publié. En trente minutes, Kimi K3 a dominé les tendances Hugging Face. Pour un développeur sur Mac, le constat est plus nuancé : l'accès aux poids ouvre la recherche et l'audit, mais l'inférence de production reste du domaine des supernœuds — l'API conserve toute sa pertinence.

01 · Trois points de friction décisionnels

  1. Le piège sémantique : Moonshot parle toujours d'« open weight », jamais d'« open source ». L'OSI exige données, code d'entraînement et pipeline reproductible — K3 ne livre que poids, rapport et infra d'inférence. Confondre les termes affaiblit votre crédibilité technique et juridique.
  2. Deux seuils commerciaux : un service MAAS dépassant 20 M$ de revenus cumulés sur 12 mois doit signer un accord séparé ; au-delà de 100 M MAU ou 20 M$ de revenus mensuels, l'interface doit afficher « Kimi K3 ». Sans impact pour la plupart des startups ; critique si vous prévoyez une API concurrente.
  3. Plafond de performance vs coût vs déploiement : 3e rang mondial à l'AA Index, 93,4 % SWE-bench, mais ~0,95 $/tâche contre 0,47 $ pour GLM-5.2. Self-hosting : 1,56 To et 64+ GPU. Aucun indicateur isolé ne suffit pour trancher.

02 · Chronologie du 16 au 28 juillet

Date Événement
2026-07-16Lancement API (kimi.com, Kimi Work, Kimi Code) ; article « Open Frontier Intelligence » ; évaluation indépendante Artificial Analysis
2026-07-17Ouverture WAIC 2026 ; médias d'État présentent K3 comme le plus grand modèle open weight
2026-07-22–23Escalade des accusations américaines de distillation ; menaces de sanctions
2026-07-27Poids complets + rapport technique ; MoonEP et AgentEnv open sourced ; ~1,56 To sur HF, tendance #1 en 30 min
2026-07-28Réponse du ministère du Commerce chinois ; couverture médiatique des détails de licence

03 · Fiche technique

Paramètre Valeur
Paramètres totaux2,8T
Paramètres activés~104B par token
ArchitectureMoE sparse (Stable LatentMoE)
Routage experts896 experts, 16 actifs/token (~1,8 % sparsité)
AttentionKimi Delta Attention (KDA) + Gated MLA
Fenêtre de contexte1 048 576 tokens
MultimodalVision native (ViT-V2, 27 couches)
QuantificationMXFP4 poids, MXFP8 activations (QAT dès SFT)
Taille des poids~1,56 To
LicencePersonnalisée (non Modified MIT)

Chiffre clé #1 : 1,56 To de poids intégralement publiés avec 1M de contexte — un avantage structurel que les concurrents fermés ne peuvent pas offrir au même tarif API.

04 · KDA et Attention Residuals : l'ingénierie derrière l'échelle

4.1 Kimi Delta Attention (KDA)

Le Gated DeltaNet classique applique un coefficient d'oubli unique à toute la mémoire. KDA introduit des portes canal par canal : chaque dimension de feature possède son propre taux de décroissance. La formulation DPLR (Diagonal-Plus-Low-Rank) en chunks garantit une complexité linéaire et un KV cache minimal. K3 alterne couches KDA et attention globale Gated MLA pour soutenir un million de tokens sans explosion mémoire.

4.2 Attention Residuals (AttnRes)

Les connexions résiduelles classiques additionnent chaque couche de façon uniforme — en profondeur, les signaux précoces se diluent. AttnRes agrège sélectivement et dynamiquement les sorties de toutes les couches précédentes. Coût : un RMSNorm et un pseudo-query par couche (<2 % de paramètres). Gain d'entraînement : ~25 % d'efficacité. Le pseudo-query initialisé à zéro stabilise le warm-up.

4.3 Per-Head Muon et Stable LatentMoE

L'optimiseur Muon s'applique désormais par tête d'attention, offrant une convergence adaptative. Le MoE route 896 experts dont 16 actifs, avec Quantile Balancing et preuve mathématique MoonEP sur la redondance par nœud.

05 · MoonEP / FlashKDA / AgentEnv : l'écosystème publié avec les poids

Moonshot n'a pas seulement déposé des fichiers de poids : trois briques d'infrastructure accompagnent la publication — un geste salué par la communauté pour sa transparence technique.

Composant Rôle Indicateur
MoonEP Communication MoE à l'échelle supernœud ; réplication temporaire d'experts surchargés Preuve de borne supérieure sur le nombre d'experts redondants par nœud
FlashKDA Kernel KDA basé sur CUTLASS ; remplacement direct de chunk_kda Prefill sur H20 : 1,72–2,22× plus rapide que la baseline flash-linear-attention
AgentEnv Sandbox microVM Firecracker (avec KVCache.ai) pour RL agent parallèle Checkpoint 133 ms, restauration 49 ms, sursouscription jusqu'à 6,5×

Chiffre clé #2 : FlashKDA accélère le prefill de 1,72 à 2,22× — Moonshot publie une pile d'ingénierie, pas seulement des tenseurs.

06 · Benchmarks et positionnement marché

6.1 SWE-bench Verified (Vals AI, juillet 2026)

Modèle Score Date
Claude Opus 597,0 %2026-07-24
GPT-5.6 Sol96,2 %2026-07-09
Claude Fable 595,0 %2026-06-09
Kimi K393,4 %2026-07-16
Qwen3.7-Max79,4 %2026-05-19
DeepSeek-V476,2 %2026-04-23

6.2 Artificial Analysis Intelligence Index (max)

  • Claude Fable 5 : 60
  • GPT-5.6 Sol : 59
  • Kimi K3 : ~57 — 3e mondial, 1er open weight
  • GLM-5.2 : 51
  • DeepSeek V4 Pro : 44

Coût par tâche agent : K3 ~0,95 $ vs Fable 5 ~2,40 $ (−60 %) vs GLM-5.2 ~0,47 $. Lecture : plafond open weight, pas champion prix-performance. Kimi K3 mène l'Arena.ai Frontend Code Arena.

07 · Licence personnalisée : deux seuils à connaître

Moonshot n'emploie jamais le terme « open source ». La licence K3 est un document sur mesure — plus le Modified MIT de K2 :

  1. Seuil MAAS : activité Model-as-a-Service dépassant 20 M$ de revenus cumulés sur 12 mois → accord commercial séparé requis.
  2. Seuil d'échelle : plus de 100 M MAU ou 20 M$ de revenus mensuels → mention visible « Kimi K3 » dans l'interface.

Pour la majorité des équipes produit, aucun impact. Pour un projet d'API concurrente, revue juridique avant engagement architectural.

08 · Tarifs API et déploiement 64 GPU

API compatible OpenAI : https://api.moonshot.ai/v1, identifiant kimi-k3.

Type de token Prix / million
Entrée (cache hit)0,30 $
Entrée (cache miss)3,00 $
Sortie (raisonnement inclus)15,00 $

L'architecture Mooncake désagrégée atteint plus de 90 % de taux de cache hit sur les workloads de code — le coût effectif se rapproche souvent de 0,30 $/M en entrée.

Self-hosting : Moonshot recommande 64+ accélérateurs en supernœud et 1,56 To de stockage pour les poids. Sept fournisseurs tiers sur OpenRouter, tarifs alignés sur l'officiel.

Chiffre clé #3 : 1,56 To et 64 GPU — déployer K3 sur un MacBook n'est pas une option de production ; l'API ou le routage managé reste la réponse.

09 · 5 étapes de validation pour développeurs Mac

  1. Créer une clé API sur platform.kimi.ai ; valider kimi-k3 via SDK OpenAI — un test chacun : long document, correction de bug, refactor multi-fichiers
  2. Activer le cache de contexte ; mesurer taux de hit et coût réel $/tâche ; comparer avec Fable 5 et GPT-5.6
  3. Inspecter le dépôt Hugging Face moonshotai : shards 1,56 To, texte LICENSE, rapport technique PDF
  4. Environnement isolé (hors Mac principal) : Kimi Code ou Cursor avec routage K3 — ne pas exporter la clé dans le shell global
  5. Croiser le chapitre architecture de l'avis du 17/07 avec les mises à jour licence et infra pour finaliser votre note de choix
curl -s https://api.moonshot.ai/v1/chat/completions \ -H "Authorization: Bearer $MOONSHOT_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model": "kimi-k3", "messages": [{"role": "user", "content": "Résume la publication open weight de Kimi K3 du 27 juillet 2026."}]}'

10 · FAQ

Q : Kimi K3 est-il open source ?
R : Non au sens OSI. Open weight : poids, rapport et partie de l'infra sont publics ; données et code d'entraînement complet ne le sont pas.

Q : Usage commercial autorisé ?
R : Oui dans la plupart des cas. MAAS >20 M$/an ou MAU >100 M / revenus >20 M$/mois → clauses supplémentaires.

Q : Combien de GPU pour self-hosting ?
R : Minimum 64 accélérateurs (supernœud). Pour la majorité : API ou OpenRouter.

Q : Niveau de performance ?
R : SWE-bench 93,4 %, AA Index 3e mondial. Plus cher que GLM-5.2 — sommet open weight, pas meilleur rapport qualité-prix.

Q : Différence avec Kimi K2 ?
R : ~3× paramètres, AttnRes + Per-Head Muon, 1M contexte, licence personnalisée au lieu de Modified MIT.

11 · Location Mac isolée : valider K3 sans compromettre votre poste principal

Les poids sont là, mais 1,56 To et un cluster 64 GPU restent hors de portée sur Mac. La voie pragmatique : valider le workflow Kimi K3 API dans un environnement Apple Silicon éphémère — clé Moonshot sur la machine louée, pas dans le Keychain de production ; expériences à un million de tokens sans polluer le cache local ; comparaison A/B Claude/GPT dans un setup « destroy-after-acceptance ».

Vous pouvez brancher l'API depuis votre portable, mais le poste principal accumule les risques : fuites de clés dans .zshrc, runs long-context irréversibles, credentials mélangés. Un Mac loué sépare validation et livraison — facturation journalière plutôt que CapEx matériel. Tarifs : compute série M.

12 · Sources

  • Officiel : kimi.com/blog/kimi-k3, platform.kimi.ai, Hugging Face moonshotai
  • Infra : GitHub moonshotai/FlashKDA, MoonEP, AgentEnv
  • Benchmarks : Vals AI SWE-bench Verified, Artificial Analysis Intelligence Index
  • Presse : VentureBeat, Simon Willison, Scientific American, The Register
  • Contexte : ministère du Commerce 28/07, accusations de distillation, Hacker News, r/LocalLLaMA

Données au 28 juillet 2026. Vérifier LICENSE et dépôt HF avant décision de production.