Open Weight 27. Juli 2026 2026-07-28

Kimi K3 Open Weight: 2,8T MoE, 1M Token — Datenbasierter Release-Report

Zielgruppe & Problem: Mac-Entwickler und AI-Leads nach dem 27.-Juli-Release, die Open Weight vs. Open Source, Custom-Lizenz-Schwellen und 1,56TB-Self-Deploy bewerten müssen. Ergebnis: Spezifikationstabelle, KDA/AttnRes-Analyse, Infra-Stack, Benchmarks, API-Preise und 64-GPU-Schwelle. Struktur: Zeitstrahl, 4 Tabellen, 5 Validierungsschritte, FAQ×5, Mac-Miet-CTA.

Kimi K3 Open-Weight-Release 27. Juli 2026: 2,8T MoE, MoonEP, FlashKDA und AgentEnv

Vorberichte: Kimi K3 Deep Dive (17.7.), Anticipation vor 27.7., Opus 5 + Destillationskontroverse.

Kurzantwort

Am 27. Juli 2026 veröffentlichte Moonshot AI die vollständigen Kimi-K3-Gewichte (~1,56TB auf Hugging Face), den Technischen Report sowie die Infra-Komponenten MoonEP und AgentEnv (FlashKDA war bereits offen). K3 ist ein 2,8T-Parameter-Sparse-MoE mit ~104B aktivierten Parametern, 1M Token Kontext und SWE-bench Verified 93,4%. Offiziell: open weight, nicht open source; Lizenz ist Custom mit $20M MAAS- und 100M MAU-Schwellen — nicht mehr Modified MIT wie bei K2.

Elf Tage nach dem API-Launch am 16. Juli legte Moonshot die vollständige Gewichtsdatei offen — der erste vollständig veröffentlichte 3T-Klasse-LLM weltweit. Innerhalb von 30 Minuten stand Kimi K3 an der Spitze der Hugging-Face-Trendliste. Für Mac-Entwickler ändert das wenig an der Hardware-Realität: Self-Hosting bleibt ein 64+-GPU-Problem; die API bleibt der pragmatische Pfad.

01 · Drei Entscheidungsengpässe

  1. Terminologie-Falle: Moonshot nutzt konsequent „open weight“, nie „open source“. OSI-konformes Open Source erfordert Trainingsdaten und reproduzierbare Pipelines — K3 liefert Gewichte, Report und Inferenz-Infra. Falsche Begriffe kosten Glaubwürdigkeit in r/LocalLLaMA und bei Compliance-Reviews.
  2. Zwei Lizenz-Schwellen: MAAS-Umsatz > $20M in 12 Monaten → separate Vereinbarung mit Moonshot. MAU > 100M oder Monatsumsatz > $20M → sichtbare „Kimi K3“-Kennzeichnung. Für Startups irrelevant; für API-Wettbewerber ein Compliance-Risiko.
  3. Leistung vs. Kosten vs. Deploy: AA Index Platz 3, SWE-bench 93,4%, aber ~$0,95/Task gegenüber GLM-5.2 bei $0,47. Self-Deploy: 1,56TB + 64+ GPUs. Eine Kennzahl allein reicht nicht für die Architekturentscheidung.

02 · Release-Zeitstrahl 16.–28. Juli

Datum Ereignis
2026-07-16API-Launch (kimi.com, Kimi Work, Kimi Code); Blog „Open Frontier Intelligence“; Artificial Analysis unabhängiger Test
2026-07-17WAIC 2026; staatliche Medien nennen K3 „größtes Open-Weight-Modell“
2026-07-22–23US-Destillationsvorwürfe (Kratsios, Bessent); Sanktionsdiskussion
2026-07-27Vollständige Gewichte + Technischer Report; MoonEP & AgentEnv open sourced; HF ~1,56TB, Trend #1 in 30 Min.
2026-07-28Chinesisches Handelsministerium antwortet auf US-AI-Kontroverse; Medienberichte zu Lizenzdetails

03 · Spezifikationstabelle

Parameter Wert
Gesamtparameter2,8T
Aktivierte Parameter~104B pro Token
ArchitekturSparse MoE (Stable LatentMoE)
Experten-Routing896 Router-Experten, 16 aktiv/Token (~1,8% Sparsity)
AttentionKimi Delta Attention (KDA) + Gated MLA
Kontextfenster1.048.576 Token (1M)
MultimodalNative Vision (ViT-V2, 27 Layer)
QuantisierungMXFP4 Gewichte, MXFP8 Aktivierungen (QAT ab SFT)
Gewichtsgröße~1,56TB (Hugging Face)
LizenzCustom (nicht Modified MIT)

Hard Fact #1: 1,56TB + 1M Token — struktureller Vorteil, den Closed-Source-Konkurrenten bei gleichem API-Preis nicht replizieren können.

04 · KDA & Attention Residuals: Architektur auf Zahlenbasis

4.1 Kimi Delta Attention (KDA)

Gated DeltaNet nutzt einen skalaren Vergessensfaktor für den gesamten Zustand. KDA ersetzt das durch kanalweise Gates: jede Feature-Dimension erhält eine eigene Decay-Rate. Implementierung via chunkweiser DPLR-Formel (Diagonal-Plus-Low-Rank) — lineare Zeitkomplexität, drastisch reduzierter KV-Cache. K3 wechselt KDA-Schichten mit Gated-MLA-Global-Attention ab, um 1M Token bei minimalem Speicher zu halten.

4.2 Attention Residuals (AttnRes)

Klassische Residuals summieren Layer gleichmäßig — tiefe Netze verwässern frühe Signale. AttnRes aggregiert selektiv und input-abhängig alle vorherigen Layer-Ausgaben. Overhead: ein RMSNorm + Pseudo-Query pro Layer (<2% Parameter). Trainingsgewinn: ~25% Effizienz. Pseudo-Query startet bei Null → anfangs äquivalent zu Uniform-Averaging, stabil im Warmup.

4.3 Per-Head Muon & Stable LatentMoE

Muon-Optimizer pro Attention-Head statt global — adaptive Konvergenz je Head. MoE: 896 Experten, 16 aktiv, Quantile Balancing + MoonEP-Redundanzbeweis für Lastverteilung auf Supernodes.

05 · MoonEP / FlashKDA / AgentEnv

Komponente Funktion Kennzahl
MoonEP MoE-Kommunikation auf Supernode-Skala; temporäre Expert-Replikation für Token-Balance Mathematischer Redundanz-Obergrenzen-Beweis pro Node
FlashKDA CUTLASS-basierter KDA-Kernel; Drop-in für chunk_kda Prefill auf H20: 1,72–2,22× schneller als flash-linear-attention-Baseline
AgentEnv Firecracker-microVM-Sandbox (mit KVCache.ai) für paralleles Agent-RL Checkpoint 133ms, Restore 49ms, Oversubscription bis 6,5× (Moonshot-Angaben)

Hard Fact #2: FlashKDA 1,72–2,22× Prefill-Beschleunigung — der Release liefert Engineering-Stack, nicht nur Gewichte.

06 · Benchmark-Vergleich

6.1 SWE-bench Verified (Vals AI, Juli 2026)

Modell Score Release
Claude Opus 597,0%2026-07-24
GPT-5.6 Sol96,2%2026-07-09
Claude Fable 595,0%2026-06-09
Kimi K393,4%2026-07-16
Qwen3.7-Max79,4%2026-05-19
DeepSeek-V476,2%2026-04-23

6.2 Artificial Analysis Intelligence Index (max)

  • Claude Fable 5: 60
  • GPT-5.6 Sol: 59
  • Kimi K3: ~57 — global #3, Open Weight #1
  • GLM-5.2: 51
  • DeepSeek V4 Pro: 44

Kosten pro Agent-Task: K3 ~$0,95 vs. Fable 5 ~$2,40 (−60%) vs. GLM-5.2 ~$0,47. Fazit: höchste Open-Weight-Leistung, nicht beste Preis-Leistung. Arena.ai Frontend Code Arena: K3 führt.

07 · Custom-Lizenz: Zwei kommerzielle Schwellen

Moonshot verwendet nie „open source“. Die K3-Lizenz ist eine Custom-Datei — kein Modified MIT wie K2:

  1. MAAS-Umsatzschwelle: Model-as-a-Service mit >$20M kumuliertem Umsatz in 12 Monaten → separate Vereinbarung erforderlich.
  2. Skalierungs-Schwelle: MAU >100M oder Monatsumsatz >$20M → „Kimi K3“ prominent in der UI anzeigen.

Für die meisten Teams: keine Auswirkung. Für geplante K3-API-Konkurrenz: Legal Review vor Architekturentscheid.

08 · API-Preise & 64-GPU-Deploy

OpenAI-kompatible API: https://api.moonshot.ai/v1, Modell-ID kimi-k3.

Token-Typ Preis / 1M Token
Input (Cache Hit)$0,30
Input (Cache Miss)$3,00
Output (inkl. Reasoning)$15,00

Mooncake-Disaggregated-Inference: Cache-Hit-Rate >90% bei Coding-Workloads → effektiver Input oft nahe $0,30/M.

Self-Deploy: Offizielle Empfehlung 64+ Beschleuniger (Supernode), 1,56TB Gewichte. Sieben Drittanbieter auf OpenRouter, Preise meist identisch mit Moonshot.

Hard Fact #3: 1,56TB + 64 GPUs — „K3 auf dem MacBook“ ist kein Produktionspfad; API oder Managed Routing ist die Antwort.

09 · 5 Validierungsschritte (Mac-Entwickler)

  1. API-Key auf platform.kimi.ai registrieren; OpenAI-SDK mit kimi-k3 — je ein Test für Langdokument, Bugfix, Multi-File-Refactor
  2. Kontext-Cache aktivieren; Hit-Rate und effektiven $/Task protokollieren; gegen Fable 5 / GPT-5.6 abgleichen
  3. Hugging-Face-Repo moonshotai prüfen: 1,56TB-Shards, LICENSE-Text, Technischer Report PDF
  4. Isolierte Umgebung (nicht Daily-Driver-Mac): Kimi Code oder Cursor + K3-Routing — API-Key nicht in globale Shell exportieren
  5. Deep Dive 17.7. Architektur-Kapitel mit Lizenz- und Infra-Updates zu Entscheidungsdokument zusammenführen
curl -s https://api.moonshot.ai/v1/chat/completions \ -H "Authorization: Bearer $MOONSHOT_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model": "kimi-k3", "messages": [{"role": "user", "content": "Fasse Kimi K3 Open-Weight-Release vom 27. Juli 2026 zusammen."}]}'

10 · FAQ

F: Ist Kimi K3 Open Source?
A: Nein im OSI-Sinne. Open Weight: Gewichte, Report und Teile der Infra sind öffentlich; Trainingsdaten und vollständiger Trainingscode fehlen.

F: Kommerzielle Nutzung erlaubt?
A: Ja, in den meisten Fällen. MAAS >$20M/Jahr oder MAU >100M bzw. Monatsumsatz >$20M → zusätzliche Lizenzklauseln.

F: Wie viele GPUs für Self-Hosting?
A: Mindestens 64 Beschleuniger (Supernode). Für die meisten Teams: API oder OpenRouter.

F: Wie stark im Benchmark?
A: SWE-bench 93,4%, AA Index global #3. Teurer als GLM-5.2 — Open-Weight-Spitze, nicht Preis-Leistungs-Sieger.

F: Unterschied zu Kimi K2?
A: ~3× Parameter, AttnRes + Per-Head Muon, 1M Kontext, strengere Custom-Lizenz statt Modified MIT.

11 · Isolierte Mac-Miete: K3-API ohne Keychain-Risiko

1,56TB Download und 64-GPU-Cluster sind für Mac-Entwickler irrelevant. Der pragmatische Pfad: Kimi-K3-API in einer isolierten Apple-Silicon-Umgebung validieren — Moonshot-Key auf Miet-Mac statt im Produktions-Keychain, Million-Token-Experimente ohne lokale Cache-Kontamination, A/B gegen Claude/GPT in einem „destroy-after-acceptance“-Setup.

API-Tests lassen sich auf dem Laptop starten, aber der Daily Driver trägt Lieferrisiko: Key-Leaks in .zshrc, irreversible Long-Context-Läufe, gemischte Credentials. Ein dedizierter Miet-Mac trennt Validierung von Produktion — Tagesabrechnung statt Hardware-CapEx. Tarife: Bare-Metal-macOS-Preise.

12 · Quellen

  • Offiziell: kimi.com/blog/kimi-k3, platform.kimi.ai, Hugging Face moonshotai
  • Infra: GitHub moonshotai/FlashKDA, MoonEP, AgentEnv
  • Benchmarks: Vals AI SWE-bench Verified, Artificial Analysis Intelligence Index
  • Berichterstattung: VentureBeat, Simon Willison, Scientific American, The Register
  • Kontext: Handelsministerium 28.7., Destillationsvorwürfe, Hacker News, r/LocalLLaMA

Stand: 28. Juli 2026. LICENSE-Text und HF-Repo vor Produktionsentscheid prüfen.