Kimi K3 Open Weights am 27. Juli: 2,8 Billionen Parameter, 1M Kontext — hält die Closed-Source-Prämie noch?
Zielgruppe: Mac-Entwickler und AI-Engineers, die den 27.7.-Release verfolgen, aber API (16.7.) und Gewichte (27.7.) verwechseln und unsicher sind, ob Self-Hosting oder Claude Fable 5 sinnvoller ist. Lieferumfang: Zeitstrahl, Spezifikationstabelle, Benchmark-Matrix, echte API-Kosten, Deployment-Schwellen, Release-Checkliste, Branchenkontext und fünf Vorbereitungsschritte.
📋 Inhaltsverzeichnis
Vertiefender Test: Kimi K3 Test (17.7.); Quervergleiche: GPT-5.6 Sol Benchmark, Claude Fable 5 Alternativen.
Featured Snippet
Moonshot AI veröffentlicht am 27. Juli 2026 auf Hugging Face die vollständigen Kimi-K3-Gewichte unter Modified MIT — ein 2,8T sparse-MoE-Modell mit 1.048.576 Token Kontext. API und Kimi-Suite sind seit dem 16. Juli verfügbar; der 27.7. ist der zweite Meilenstein (open weights).
01 · TL;DR
- 16. Juli: Kimi K3 live über Kimi App, Kimi Work, Kimi Code und API; Artificial Analysis veröffentlicht unabhängigen Test am selben Tag.
- 27. Juli: Vollständige Gewichte (Modified MIT) + Technischer Report (Architektur, Training, Evaluation).
- Positionierung: Erstes Open-Weight-Modell nahe 3T — direkter Druck auf Closed-Source-Preispolitik.
- Kernurteil: Kein „Fable-5-Killer" — AA Intelligence Index 57,1 (Platz 3), aber ~⅓ der Kosten bei nahezu Frontier-Niveau plus Open Weights + 1M Kontext.
02 · Drei Entscheidungsschmerzen
- Zwei Daten verwechseln: API seit 16.7. ≠ Gewichte ab 27.7. „K3 lokal auf dem Mac"-Tutorials vor dem Release sind Clickbait; Produktions-MoE braucht Supernodes, nicht Apple Silicon.
- „Open Source"-Semantik: Die Community trennt open weights und open source. K3 liefert Gewichte + Modified MIT; Trainingscode/Daten erst nach LICENSE-Lesen am 27.7. beurteilbar — falsche Begriffe kosten Glaubwürdigkeit auf r/LocalLLaMA.
- Benchmark vs. Rechnung vs. Stabilität: Frontend Code Arena #1, SWE Marathon 42,0 — aber GDPval, DeepSWE und Halluzinationsrate hinter Fable 5/Sol. Ein Task ~$0,94 (−65,8 % vs. Fable 5) heißt nicht automatisch produktionstaugliche Dialogqualität.
03 · Release-Zeitstrahl
| Datum | Ereignis |
|---|---|
| 2026-07-16 | Kimi K3 über API / Kimi-Suite; Artificial Analysis unabhängiger Test |
| 2026-07-17 | WAIC Shanghai — staatliche Medien werten K3 als nationalen Meilenstein |
| 2026-07-27 | Vollständige Gewichte (Hugging Face, Modified MIT) + Technischer Report |
Stand dieses Artikels (22. Juli): noch 5 Tage bis zum Gewichts-Drop — letztes Fenster für „kimi k3 download / local run"-SEO und interne Vorbereitung.
04 · Modellspezifikation
| Merkmal | Wert |
|---|---|
| Parameter | 2,8T — größtes Open-Weight-Modell |
| Architektur | Sparse MoE Stable LatentMoE: 896 Experten, 16 aktiv pro Token |
| Attention | Kimi Delta Attention (KDA) + AttnRes + Gated MLA |
| Kontext | 1.048.576 Token (~1M) |
| Modalität | Native Vision (Text + Bild, Produkt auch Video), Text-Output |
| Gewichtsformat | MXFP4 Gewichte + MXFP8 Aktivierungen |
| Skalierung | ~2,5× effizienter als K2 bei gleicher Compute |
| Training-Stabilität | Quantile Balancing, Per-Head Muon, SiTU |
| Langkontext-Decode | KDA bis 6,3× schneller bei 1M Token |
Hardcore-Datenpunkt #1: KDA macht 1M Kontext bei $3/M Input praktisch nutzbar — struktureller Vorteil gegenüber Closed-Source-Konkurrenz.
05 · API-Release vs. Open Weights
- 16. Juli (live): kimi.com, Kimi Code, API (
kimi-k3), OpenRouter (moonshotai/kimi-k3) — Produkt/API. - 27. Juli (geplant): Moonshot Hugging Face — vollständige 2,8T-Gewichte, Report, vLLM-Support für KDA/prefix caching — open weights.
06 · Benchmark-Matrix: Siege und Lücken
6.1 Intelligence Index (Artificial Analysis)
| Modell | Score |
|---|---|
| Claude Fable 5 | 59,9 |
| GPT-5.6 Sol | 58,9 |
| Kimi K3 | 57,1 (Rang 3 / 189) |
6.2 K3 führt oder gleicht auf
- Frontend Code Arena: #1 (UI-Code in Blindtests bevorzugt)
- Automation Bench, SpreadsheetBench 2: #1
- BrowseComp: 91,2 (#1; mit 1M-Kontext ohne Kompression ~90,4+)
- SWE Marathon: 42,0 — deutlich vor GPT-5.5 / GLM-5.2 (Teens)
- Terminal Bench 2.1: 88,3 ≈ Sol 88,8
- Program Bench: 77,8 vs. Sol 77,6
- FrontierSWE: 81,2 vs. Sol 71,3 (Fable 5: 86,6)
6.3 K3 hinterher
- GDPval v2 Elo: 1668–1687 vs. Fable 5 1760, Sol 1748
- DeepSWE: 67,5 vs. Sol 73,0
- Halluzinationsrate: vs. K2.6 gestiegen (offiziell bestätigt); Reddit berichtet mehr Fehlantworten in Self-Host-Setups
- Dialogqualität / Varianz: hinter Fable 5 und Sol
Moonshot räumt öffentlich ein, Gesamtleistung hinter Fable 5 und GPT-5.6 Sol liegt — seltene Transparenz bei chinesischen Frontier-Releases.
Hardcore-Datenpunkt #2: Artificial Analysis — K3 $0,94 pro Task, 65,8 % günstiger als Fable 5; „near-frontier at a third of the cost" ist belegbar.
07 · API-Preise & echte Kosten
| Posten | Preis / 1M Token |
|---|---|
| Input (Cache miss) | $3,00 |
| Input (Cache hit) | $0,30 |
| Output | $15,00 |
Höchste API-Preise unter chinesischen Anbietern, aber deutlich unter Opus 4.8 pro Task. Coding-Workloads: Cache-Hit >90 % → effektiver Input weit unter Listenpreis.
08 · Open Weights vs. Open Source
- Open weights: Vollständige Gewichtsdateien, Inferenz, Fine-Tuning (LICENSE-abhängig) — K3 gehört hierher.
- Open source: Zusätzlich Trainingscode, Daten, reproduzierbare Pipeline — am 27.7. LICENSE + Report prüfen.
Lizenz: Modified MIT. In externer Kommunikation „Open Weights" statt pauschal „vollständig Open Source" verwenden.
09 · Lokales Deployment: ehrliche Grenzen
- 4-bit-Gewichte ~1,4 TB
- Offiziell 64+ Beschleuniger Supernode, Expert- + Tensor-Parallelismus
- Referenz K2.7 Code (1T): INT4 ~577 GB — K3 ist 2,8× größer
Für die meisten: API ($3/$15). Self-Host nur bei Datenresidenz, Fine-Tuning oder extrem hohem Volumen.
Hardcore-Datenpunkt #3: 1,4 TB + 64 Karten — jeder „K3 auf dem MacBook"-Guide nach dem 27.7. ist für Produktion irrelevant.
10 · Was am 27. Juli konkret passiert
- Vollständige 2,8T-Gewichte auf Moonshot Hugging Face (Modified MIT)
- Technischer Report (Architektur, Training, Evaluation)
- vLLM-Support für KDA / prefix caching ab Release
- Erwartet: Ollama, GGUF-Quantisierungen wie bei K2 nachziehen
11 · Release-Checkliste (erste 2 Stunden)
- Hugging-Face-Repo: config, tokenizer, Shard-Index vollständig?
- LICENSE-Original (Modified-MIT-Klauseln)
- Quantisierungen synchron? (MXFP4 / NVFP4 / GGUF)
- vLLM / SGLang Startbefehle + Mindest-Hardware
- Unabhängiger 1M-Kontext-Retest in Drittanbieter-Harness
12 · Warum der 27.7. zählt
- Open vs. Closed fast gleichauf: Lücke von Prozentpunkten auf 2–3 Index-Punkte geschrumpft.
- Geopolitik: Release vor WAIC; US-Regulierung kann Closed Models kurzzeitig sperren — veröffentlichte Gewichte nicht.
- China-Welle: GLM-5.2, DeepSeek V4 Pro (1,6T), MiniMax — K3 ist der Gipfel.
- Moonshots Comeback: Nach DeepSeek R1 von Rang 7 zurück — K2 → K2.5 → K3 Open-Weight-Strategie.
13 · Fünf Schritte vor dem 27.7. (Mac-Entwickler)
- API Key auf platform.kimi.ai; OpenAI-SDK mit
kimi-k3— je ein Task Langdokument / Bugfix / Multi-File-Refactor - Kontext-Cache aktivieren; Hit-Rate und $/Task vs. Fable 5 / GPT-5.6 protokollieren
- Moonshot Hugging Face bookmarken; Kalender-Reminder 27.7.
- Isolierter Mac (nicht Hauptrechner): Kimi Code oder Cursor + K3-Routing testen
- Test vom 17.7. Architektur/Benchmark-Kapitel vorlesen — am Release-Tag nur HF-Link + LICENSE aktualisieren
14 · FAQ
F: Wann kommen die Gewichte?
A: 27. Juli 2026 Hugging Face + Report. API seit 16. Juli.
F: Wirklich Open Source?
A: Open weights + Modified MIT; fully open source hängt von Trainingscode/Daten ab.
F: Preis?
A: $3/$15 pro 1M; Cache-Input $0,30/M. ~$0,94/Task, −65,8 % vs. Fable 5.
F: Lokal auf Mac?
A: Nein. ~1,4 TB, 64+ Karten. API oder ggf. kleine GGUF-Distills später.
F: Stärker als Fable 5 / GPT-5.6?
A: Gesamt Platz 3 (57,1); Frontend + lange Coding-Sessions führend; Langzeit-Urteil hinterher.
F: Lizenz?
A: Modified MIT — HF-LICENSE am 27.7. maßgeblich.
F: K3 vs. DeepSeek?
A: K3 intelligenter (57,1), DeepSeek V4 Pro API viel günstiger ($3,48/M Output vs. $15/M). Budget → DeepSeek; 1M + größte Gewichte → K3.
15 · Isolierter Mac: API-Abnahme vor dem Gewichts-Drop
Bis zum 27.7. ist API-Validierung wichtiger als Gewichts-Download: Moonshot Key auf gemietetem Apple-Silicon-Knoten, Million-Token-Tests ohne Keychain auf dem Haupt-Mac, K3 vs. Claude/GPT am selben Repo in destroy-after-test-Umgebung. Windows/Linux erreichen kimi.com, aber keine volle Kimi-Code/macOS-Toolchain-Prüfung.
Tagesmiete M-Serie: Compute-Preise.
16 · Quellen
- Offiziell: kimi.com/en/blog/kimi-k3, platform.kimi.ai
- Artificial Analysis (Intelligence Index 57,1, 16.7.)
- VentureBeat, Northflank (Self-Host-Analyse), atoms.dev / llmrumors
- Community: r/LocalLLaMA, Hacker News
Datenstand: 22. Juli 2026 (5 Tage bis Gewichte). Nach 27.7. HF-Direktlink und LICENSE aktualisieren.