Kimi K3 Open Weight: 2,8T MoE, 1M Token — Datenbasierter Release-Report
Zielgruppe & Problem: Mac-Entwickler und AI-Leads nach dem 27.-Juli-Release, die Open Weight vs. Open Source, Custom-Lizenz-Schwellen und 1,56TB-Self-Deploy bewerten müssen. Ergebnis: Spezifikationstabelle, KDA/AttnRes-Analyse, Infra-Stack, Benchmarks, API-Preise und 64-GPU-Schwelle. Struktur: Zeitstrahl, 4 Tabellen, 5 Validierungsschritte, FAQ×5, Mac-Miet-CTA.
Inhalt
Vorberichte: Kimi K3 Deep Dive (17.7.), Anticipation vor 27.7., Opus 5 + Destillationskontroverse.
Kurzantwort
Am 27. Juli 2026 veröffentlichte Moonshot AI die vollständigen Kimi-K3-Gewichte (~1,56TB auf Hugging Face), den Technischen Report sowie die Infra-Komponenten MoonEP und AgentEnv (FlashKDA war bereits offen). K3 ist ein 2,8T-Parameter-Sparse-MoE mit ~104B aktivierten Parametern, 1M Token Kontext und SWE-bench Verified 93,4%. Offiziell: open weight, nicht open source; Lizenz ist Custom mit $20M MAAS- und 100M MAU-Schwellen — nicht mehr Modified MIT wie bei K2.
Elf Tage nach dem API-Launch am 16. Juli legte Moonshot die vollständige Gewichtsdatei offen — der erste vollständig veröffentlichte 3T-Klasse-LLM weltweit. Innerhalb von 30 Minuten stand Kimi K3 an der Spitze der Hugging-Face-Trendliste. Für Mac-Entwickler ändert das wenig an der Hardware-Realität: Self-Hosting bleibt ein 64+-GPU-Problem; die API bleibt der pragmatische Pfad.
01 · Drei Entscheidungsengpässe
- Terminologie-Falle: Moonshot nutzt konsequent „open weight“, nie „open source“. OSI-konformes Open Source erfordert Trainingsdaten und reproduzierbare Pipelines — K3 liefert Gewichte, Report und Inferenz-Infra. Falsche Begriffe kosten Glaubwürdigkeit in r/LocalLLaMA und bei Compliance-Reviews.
- Zwei Lizenz-Schwellen: MAAS-Umsatz > $20M in 12 Monaten → separate Vereinbarung mit Moonshot. MAU > 100M oder Monatsumsatz > $20M → sichtbare „Kimi K3“-Kennzeichnung. Für Startups irrelevant; für API-Wettbewerber ein Compliance-Risiko.
- Leistung vs. Kosten vs. Deploy: AA Index Platz 3, SWE-bench 93,4%, aber ~$0,95/Task gegenüber GLM-5.2 bei $0,47. Self-Deploy: 1,56TB + 64+ GPUs. Eine Kennzahl allein reicht nicht für die Architekturentscheidung.
02 · Release-Zeitstrahl 16.–28. Juli
| Datum | Ereignis |
|---|---|
| 2026-07-16 | API-Launch (kimi.com, Kimi Work, Kimi Code); Blog „Open Frontier Intelligence“; Artificial Analysis unabhängiger Test |
| 2026-07-17 | WAIC 2026; staatliche Medien nennen K3 „größtes Open-Weight-Modell“ |
| 2026-07-22–23 | US-Destillationsvorwürfe (Kratsios, Bessent); Sanktionsdiskussion |
| 2026-07-27 | Vollständige Gewichte + Technischer Report; MoonEP & AgentEnv open sourced; HF ~1,56TB, Trend #1 in 30 Min. |
| 2026-07-28 | Chinesisches Handelsministerium antwortet auf US-AI-Kontroverse; Medienberichte zu Lizenzdetails |
03 · Spezifikationstabelle
| Parameter | Wert |
|---|---|
| Gesamtparameter | 2,8T |
| Aktivierte Parameter | ~104B pro Token |
| Architektur | Sparse MoE (Stable LatentMoE) |
| Experten-Routing | 896 Router-Experten, 16 aktiv/Token (~1,8% Sparsity) |
| Attention | Kimi Delta Attention (KDA) + Gated MLA |
| Kontextfenster | 1.048.576 Token (1M) |
| Multimodal | Native Vision (ViT-V2, 27 Layer) |
| Quantisierung | MXFP4 Gewichte, MXFP8 Aktivierungen (QAT ab SFT) |
| Gewichtsgröße | ~1,56TB (Hugging Face) |
| Lizenz | Custom (nicht Modified MIT) |
Hard Fact #1: 1,56TB + 1M Token — struktureller Vorteil, den Closed-Source-Konkurrenten bei gleichem API-Preis nicht replizieren können.
04 · KDA & Attention Residuals: Architektur auf Zahlenbasis
4.1 Kimi Delta Attention (KDA)
Gated DeltaNet nutzt einen skalaren Vergessensfaktor für den gesamten Zustand. KDA ersetzt das durch kanalweise Gates: jede Feature-Dimension erhält eine eigene Decay-Rate. Implementierung via chunkweiser DPLR-Formel (Diagonal-Plus-Low-Rank) — lineare Zeitkomplexität, drastisch reduzierter KV-Cache. K3 wechselt KDA-Schichten mit Gated-MLA-Global-Attention ab, um 1M Token bei minimalem Speicher zu halten.
4.2 Attention Residuals (AttnRes)
Klassische Residuals summieren Layer gleichmäßig — tiefe Netze verwässern frühe Signale. AttnRes aggregiert selektiv und input-abhängig alle vorherigen Layer-Ausgaben. Overhead: ein RMSNorm + Pseudo-Query pro Layer (<2% Parameter). Trainingsgewinn: ~25% Effizienz. Pseudo-Query startet bei Null → anfangs äquivalent zu Uniform-Averaging, stabil im Warmup.
4.3 Per-Head Muon & Stable LatentMoE
Muon-Optimizer pro Attention-Head statt global — adaptive Konvergenz je Head. MoE: 896 Experten, 16 aktiv, Quantile Balancing + MoonEP-Redundanzbeweis für Lastverteilung auf Supernodes.
05 · MoonEP / FlashKDA / AgentEnv
| Komponente | Funktion | Kennzahl |
|---|---|---|
| MoonEP | MoE-Kommunikation auf Supernode-Skala; temporäre Expert-Replikation für Token-Balance | Mathematischer Redundanz-Obergrenzen-Beweis pro Node |
| FlashKDA | CUTLASS-basierter KDA-Kernel; Drop-in für chunk_kda |
Prefill auf H20: 1,72–2,22× schneller als flash-linear-attention-Baseline |
| AgentEnv | Firecracker-microVM-Sandbox (mit KVCache.ai) für paralleles Agent-RL | Checkpoint 133ms, Restore 49ms, Oversubscription bis 6,5× (Moonshot-Angaben) |
Hard Fact #2: FlashKDA 1,72–2,22× Prefill-Beschleunigung — der Release liefert Engineering-Stack, nicht nur Gewichte.
06 · Benchmark-Vergleich
6.1 SWE-bench Verified (Vals AI, Juli 2026)
| Modell | Score | Release |
|---|---|---|
| Claude Opus 5 | 97,0% | 2026-07-24 |
| GPT-5.6 Sol | 96,2% | 2026-07-09 |
| Claude Fable 5 | 95,0% | 2026-06-09 |
| Kimi K3 | 93,4% | 2026-07-16 |
| Qwen3.7-Max | 79,4% | 2026-05-19 |
| DeepSeek-V4 | 76,2% | 2026-04-23 |
6.2 Artificial Analysis Intelligence Index (max)
- Claude Fable 5: 60
- GPT-5.6 Sol: 59
- Kimi K3: ~57 — global #3, Open Weight #1
- GLM-5.2: 51
- DeepSeek V4 Pro: 44
Kosten pro Agent-Task: K3 ~$0,95 vs. Fable 5 ~$2,40 (−60%) vs. GLM-5.2 ~$0,47. Fazit: höchste Open-Weight-Leistung, nicht beste Preis-Leistung. Arena.ai Frontend Code Arena: K3 führt.
07 · Custom-Lizenz: Zwei kommerzielle Schwellen
Moonshot verwendet nie „open source“. Die K3-Lizenz ist eine Custom-Datei — kein Modified MIT wie K2:
- MAAS-Umsatzschwelle: Model-as-a-Service mit >$20M kumuliertem Umsatz in 12 Monaten → separate Vereinbarung erforderlich.
- Skalierungs-Schwelle: MAU >100M oder Monatsumsatz >$20M → „Kimi K3“ prominent in der UI anzeigen.
Für die meisten Teams: keine Auswirkung. Für geplante K3-API-Konkurrenz: Legal Review vor Architekturentscheid.
08 · API-Preise & 64-GPU-Deploy
OpenAI-kompatible API: https://api.moonshot.ai/v1, Modell-ID kimi-k3.
| Token-Typ | Preis / 1M Token |
|---|---|
| Input (Cache Hit) | $0,30 |
| Input (Cache Miss) | $3,00 |
| Output (inkl. Reasoning) | $15,00 |
Mooncake-Disaggregated-Inference: Cache-Hit-Rate >90% bei Coding-Workloads → effektiver Input oft nahe $0,30/M.
Self-Deploy: Offizielle Empfehlung 64+ Beschleuniger (Supernode), 1,56TB Gewichte. Sieben Drittanbieter auf OpenRouter, Preise meist identisch mit Moonshot.
Hard Fact #3: 1,56TB + 64 GPUs — „K3 auf dem MacBook“ ist kein Produktionspfad; API oder Managed Routing ist die Antwort.
09 · 5 Validierungsschritte (Mac-Entwickler)
- API-Key auf platform.kimi.ai registrieren; OpenAI-SDK mit
kimi-k3— je ein Test für Langdokument, Bugfix, Multi-File-Refactor - Kontext-Cache aktivieren; Hit-Rate und effektiven $/Task protokollieren; gegen Fable 5 / GPT-5.6 abgleichen
- Hugging-Face-Repo moonshotai prüfen: 1,56TB-Shards, LICENSE-Text, Technischer Report PDF
- Isolierte Umgebung (nicht Daily-Driver-Mac): Kimi Code oder Cursor + K3-Routing — API-Key nicht in globale Shell exportieren
- Deep Dive 17.7. Architektur-Kapitel mit Lizenz- und Infra-Updates zu Entscheidungsdokument zusammenführen
10 · FAQ
F: Ist Kimi K3 Open Source?
A: Nein im OSI-Sinne. Open Weight: Gewichte, Report und Teile der Infra sind öffentlich; Trainingsdaten und vollständiger Trainingscode fehlen.
F: Kommerzielle Nutzung erlaubt?
A: Ja, in den meisten Fällen. MAAS >$20M/Jahr oder MAU >100M bzw. Monatsumsatz >$20M → zusätzliche Lizenzklauseln.
F: Wie viele GPUs für Self-Hosting?
A: Mindestens 64 Beschleuniger (Supernode). Für die meisten Teams: API oder OpenRouter.
F: Wie stark im Benchmark?
A: SWE-bench 93,4%, AA Index global #3. Teurer als GLM-5.2 — Open-Weight-Spitze, nicht Preis-Leistungs-Sieger.
F: Unterschied zu Kimi K2?
A: ~3× Parameter, AttnRes + Per-Head Muon, 1M Kontext, strengere Custom-Lizenz statt Modified MIT.
11 · Isolierte Mac-Miete: K3-API ohne Keychain-Risiko
1,56TB Download und 64-GPU-Cluster sind für Mac-Entwickler irrelevant. Der pragmatische Pfad: Kimi-K3-API in einer isolierten Apple-Silicon-Umgebung validieren — Moonshot-Key auf Miet-Mac statt im Produktions-Keychain, Million-Token-Experimente ohne lokale Cache-Kontamination, A/B gegen Claude/GPT in einem „destroy-after-acceptance“-Setup.
API-Tests lassen sich auf dem Laptop starten, aber der Daily Driver trägt Lieferrisiko: Key-Leaks in .zshrc, irreversible Long-Context-Läufe, gemischte Credentials. Ein dedizierter Miet-Mac trennt Validierung von Produktion — Tagesabrechnung statt Hardware-CapEx. Tarife: Bare-Metal-macOS-Preise.
12 · Quellen
- Offiziell: kimi.com/blog/kimi-k3, platform.kimi.ai, Hugging Face moonshotai
- Infra: GitHub moonshotai/FlashKDA, MoonEP, AgentEnv
- Benchmarks: Vals AI SWE-bench Verified, Artificial Analysis Intelligence Index
- Berichterstattung: VentureBeat, Simon Willison, Scientific American, The Register
- Kontext: Handelsministerium 28.7., Destillationsvorwürfe, Hacker News, r/LocalLLaMA
Stand: 28. Juli 2026. LICENSE-Text und HF-Repo vor Produktionsentscheid prüfen.