Open Weights 27. Juli 2026-07-22

Kimi K3 Open Weights am 27. Juli: 2,8 Billionen Parameter, 1M Kontext — hält die Closed-Source-Prämie noch?

Zielgruppe: Mac-Entwickler und AI-Engineers, die den 27.7.-Release verfolgen, aber API (16.7.) und Gewichte (27.7.) verwechseln und unsicher sind, ob Self-Hosting oder Claude Fable 5 sinnvoller ist. Lieferumfang: Zeitstrahl, Spezifikationstabelle, Benchmark-Matrix, echte API-Kosten, Deployment-Schwellen, Release-Checkliste, Branchenkontext und fünf Vorbereitungsschritte.

Kimi K3 Open Weights Release 27 Juli 2026 2,8T Benchmark Claude Fable 5 GPT-5.6

Vertiefender Test: Kimi K3 Test (17.7.); Quervergleiche: GPT-5.6 Sol Benchmark, Claude Fable 5 Alternativen.

Featured Snippet

Moonshot AI veröffentlicht am 27. Juli 2026 auf Hugging Face die vollständigen Kimi-K3-Gewichte unter Modified MIT — ein 2,8T sparse-MoE-Modell mit 1.048.576 Token Kontext. API und Kimi-Suite sind seit dem 16. Juli verfügbar; der 27.7. ist der zweite Meilenstein (open weights).

01 · TL;DR

  • 16. Juli: Kimi K3 live über Kimi App, Kimi Work, Kimi Code und API; Artificial Analysis veröffentlicht unabhängigen Test am selben Tag.
  • 27. Juli: Vollständige Gewichte (Modified MIT) + Technischer Report (Architektur, Training, Evaluation).
  • Positionierung: Erstes Open-Weight-Modell nahe 3T — direkter Druck auf Closed-Source-Preispolitik.
  • Kernurteil: Kein „Fable-5-Killer" — AA Intelligence Index 57,1 (Platz 3), aber ~⅓ der Kosten bei nahezu Frontier-Niveau plus Open Weights + 1M Kontext.

02 · Drei Entscheidungsschmerzen

  1. Zwei Daten verwechseln: API seit 16.7. ≠ Gewichte ab 27.7. „K3 lokal auf dem Mac"-Tutorials vor dem Release sind Clickbait; Produktions-MoE braucht Supernodes, nicht Apple Silicon.
  2. „Open Source"-Semantik: Die Community trennt open weights und open source. K3 liefert Gewichte + Modified MIT; Trainingscode/Daten erst nach LICENSE-Lesen am 27.7. beurteilbar — falsche Begriffe kosten Glaubwürdigkeit auf r/LocalLLaMA.
  3. Benchmark vs. Rechnung vs. Stabilität: Frontend Code Arena #1, SWE Marathon 42,0 — aber GDPval, DeepSWE und Halluzinationsrate hinter Fable 5/Sol. Ein Task ~$0,94 (−65,8 % vs. Fable 5) heißt nicht automatisch produktionstaugliche Dialogqualität.

03 · Release-Zeitstrahl

Datum Ereignis
2026-07-16Kimi K3 über API / Kimi-Suite; Artificial Analysis unabhängiger Test
2026-07-17WAIC Shanghai — staatliche Medien werten K3 als nationalen Meilenstein
2026-07-27Vollständige Gewichte (Hugging Face, Modified MIT) + Technischer Report

Stand dieses Artikels (22. Juli): noch 5 Tage bis zum Gewichts-Drop — letztes Fenster für „kimi k3 download / local run"-SEO und interne Vorbereitung.

04 · Modellspezifikation

Merkmal Wert
Parameter2,8T — größtes Open-Weight-Modell
ArchitekturSparse MoE Stable LatentMoE: 896 Experten, 16 aktiv pro Token
AttentionKimi Delta Attention (KDA) + AttnRes + Gated MLA
Kontext1.048.576 Token (~1M)
ModalitätNative Vision (Text + Bild, Produkt auch Video), Text-Output
GewichtsformatMXFP4 Gewichte + MXFP8 Aktivierungen
Skalierung~2,5× effizienter als K2 bei gleicher Compute
Training-StabilitätQuantile Balancing, Per-Head Muon, SiTU
Langkontext-DecodeKDA bis 6,3× schneller bei 1M Token

Hardcore-Datenpunkt #1: KDA macht 1M Kontext bei $3/M Input praktisch nutzbar — struktureller Vorteil gegenüber Closed-Source-Konkurrenz.

05 · API-Release vs. Open Weights

  • 16. Juli (live): kimi.com, Kimi Code, API (kimi-k3), OpenRouter (moonshotai/kimi-k3) — Produkt/API.
  • 27. Juli (geplant): Moonshot Hugging Face — vollständige 2,8T-Gewichte, Report, vLLM-Support für KDA/prefix caching — open weights.

06 · Benchmark-Matrix: Siege und Lücken

6.1 Intelligence Index (Artificial Analysis)

Modell Score
Claude Fable 559,9
GPT-5.6 Sol58,9
Kimi K357,1 (Rang 3 / 189)

6.2 K3 führt oder gleicht auf

  • Frontend Code Arena: #1 (UI-Code in Blindtests bevorzugt)
  • Automation Bench, SpreadsheetBench 2: #1
  • BrowseComp: 91,2 (#1; mit 1M-Kontext ohne Kompression ~90,4+)
  • SWE Marathon: 42,0 — deutlich vor GPT-5.5 / GLM-5.2 (Teens)
  • Terminal Bench 2.1: 88,3 ≈ Sol 88,8
  • Program Bench: 77,8 vs. Sol 77,6
  • FrontierSWE: 81,2 vs. Sol 71,3 (Fable 5: 86,6)

6.3 K3 hinterher

  • GDPval v2 Elo: 1668–1687 vs. Fable 5 1760, Sol 1748
  • DeepSWE: 67,5 vs. Sol 73,0
  • Halluzinationsrate: vs. K2.6 gestiegen (offiziell bestätigt); Reddit berichtet mehr Fehlantworten in Self-Host-Setups
  • Dialogqualität / Varianz: hinter Fable 5 und Sol

Moonshot räumt öffentlich ein, Gesamtleistung hinter Fable 5 und GPT-5.6 Sol liegt — seltene Transparenz bei chinesischen Frontier-Releases.

Hardcore-Datenpunkt #2: Artificial Analysis — K3 $0,94 pro Task, 65,8 % günstiger als Fable 5; „near-frontier at a third of the cost" ist belegbar.

07 · API-Preise & echte Kosten

Posten Preis / 1M Token
Input (Cache miss)$3,00
Input (Cache hit)$0,30
Output$15,00

Höchste API-Preise unter chinesischen Anbietern, aber deutlich unter Opus 4.8 pro Task. Coding-Workloads: Cache-Hit >90 % → effektiver Input weit unter Listenpreis.

08 · Open Weights vs. Open Source

  • Open weights: Vollständige Gewichtsdateien, Inferenz, Fine-Tuning (LICENSE-abhängig) — K3 gehört hierher.
  • Open source: Zusätzlich Trainingscode, Daten, reproduzierbare Pipeline — am 27.7. LICENSE + Report prüfen.

Lizenz: Modified MIT. In externer Kommunikation „Open Weights" statt pauschal „vollständig Open Source" verwenden.

09 · Lokales Deployment: ehrliche Grenzen

  • 4-bit-Gewichte ~1,4 TB
  • Offiziell 64+ Beschleuniger Supernode, Expert- + Tensor-Parallelismus
  • Referenz K2.7 Code (1T): INT4 ~577 GB — K3 ist 2,8× größer

Für die meisten: API ($3/$15). Self-Host nur bei Datenresidenz, Fine-Tuning oder extrem hohem Volumen.

Hardcore-Datenpunkt #3: 1,4 TB + 64 Karten — jeder „K3 auf dem MacBook"-Guide nach dem 27.7. ist für Produktion irrelevant.

10 · Was am 27. Juli konkret passiert

  • Vollständige 2,8T-Gewichte auf Moonshot Hugging Face (Modified MIT)
  • Technischer Report (Architektur, Training, Evaluation)
  • vLLM-Support für KDA / prefix caching ab Release
  • Erwartet: Ollama, GGUF-Quantisierungen wie bei K2 nachziehen

11 · Release-Checkliste (erste 2 Stunden)

  1. Hugging-Face-Repo: config, tokenizer, Shard-Index vollständig?
  2. LICENSE-Original (Modified-MIT-Klauseln)
  3. Quantisierungen synchron? (MXFP4 / NVFP4 / GGUF)
  4. vLLM / SGLang Startbefehle + Mindest-Hardware
  5. Unabhängiger 1M-Kontext-Retest in Drittanbieter-Harness

12 · Warum der 27.7. zählt

  1. Open vs. Closed fast gleichauf: Lücke von Prozentpunkten auf 2–3 Index-Punkte geschrumpft.
  2. Geopolitik: Release vor WAIC; US-Regulierung kann Closed Models kurzzeitig sperren — veröffentlichte Gewichte nicht.
  3. China-Welle: GLM-5.2, DeepSeek V4 Pro (1,6T), MiniMax — K3 ist der Gipfel.
  4. Moonshots Comeback: Nach DeepSeek R1 von Rang 7 zurück — K2 → K2.5 → K3 Open-Weight-Strategie.

13 · Fünf Schritte vor dem 27.7. (Mac-Entwickler)

  1. API Key auf platform.kimi.ai; OpenAI-SDK mit kimi-k3 — je ein Task Langdokument / Bugfix / Multi-File-Refactor
  2. Kontext-Cache aktivieren; Hit-Rate und $/Task vs. Fable 5 / GPT-5.6 protokollieren
  3. Moonshot Hugging Face bookmarken; Kalender-Reminder 27.7.
  4. Isolierter Mac (nicht Hauptrechner): Kimi Code oder Cursor + K3-Routing testen
  5. Test vom 17.7. Architektur/Benchmark-Kapitel vorlesen — am Release-Tag nur HF-Link + LICENSE aktualisieren
curl -s https://api.moonshot.ai/v1/chat/completions \ -H "Authorization: Bearer $MOONSHOT_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model": "kimi-k3", "messages": [{"role": "user", "content": "Fasse die Kimi K3 Open-Weight-Timeline zusammen."}]}'

14 · FAQ

F: Wann kommen die Gewichte?
A: 27. Juli 2026 Hugging Face + Report. API seit 16. Juli.

F: Wirklich Open Source?
A: Open weights + Modified MIT; fully open source hängt von Trainingscode/Daten ab.

F: Preis?
A: $3/$15 pro 1M; Cache-Input $0,30/M. ~$0,94/Task, −65,8 % vs. Fable 5.

F: Lokal auf Mac?
A: Nein. ~1,4 TB, 64+ Karten. API oder ggf. kleine GGUF-Distills später.

F: Stärker als Fable 5 / GPT-5.6?
A: Gesamt Platz 3 (57,1); Frontend + lange Coding-Sessions führend; Langzeit-Urteil hinterher.

F: Lizenz?
A: Modified MIT — HF-LICENSE am 27.7. maßgeblich.

F: K3 vs. DeepSeek?
A: K3 intelligenter (57,1), DeepSeek V4 Pro API viel günstiger ($3,48/M Output vs. $15/M). Budget → DeepSeek; 1M + größte Gewichte → K3.

15 · Isolierter Mac: API-Abnahme vor dem Gewichts-Drop

Bis zum 27.7. ist API-Validierung wichtiger als Gewichts-Download: Moonshot Key auf gemietetem Apple-Silicon-Knoten, Million-Token-Tests ohne Keychain auf dem Haupt-Mac, K3 vs. Claude/GPT am selben Repo in destroy-after-test-Umgebung. Windows/Linux erreichen kimi.com, aber keine volle Kimi-Code/macOS-Toolchain-Prüfung.

Tagesmiete M-Serie: Compute-Preise.

16 · Quellen

  • Offiziell: kimi.com/en/blog/kimi-k3, platform.kimi.ai
  • Artificial Analysis (Intelligence Index 57,1, 16.7.)
  • VentureBeat, Northflank (Self-Host-Analyse), atoms.dev / llmrumors
  • Community: r/LocalLLaMA, Hacker News

Datenstand: 22. Juli 2026 (5 Tage bis Gewichte). Nach 27.7. HF-Direktlink und LICENSE aktualisieren.