Grok 4.6 Veröffentlichung: 1,5T · SFT/RL-Upgrade · Grok 4.7 mit 2,1T
Zielgruppe & Datenlage: Mac-Entwickler und AI-Leads, die Grok 4.6 gegen Kimi K3 (2,8T) und das Gerücht Claude Fable 5.1 (August) einordnen müssen — bei null offiziellen Benchmarks für 4.6. Lieferumfang: Zeitstrahl 4.5→4.7, Spezifikationstabellen, Wettbewerbsmatrix, SFT/RL-Erklärung, Kontroversen (CSAM-Klage, Pacing the Frontier), 5 Prüfschritte, FAQ×5, Mac-Miet-CTA.
Inhalt
Kontext: Grok 4.5 Test (8.7.) · Kimi K3 Open Weight (28.7.) · OpenRouter API-Anleitung.
Kurzantwort (Featured Snippet)
Am 28. Juli 2026 antwortete Elon Musk auf Vercel-CEO Guillermo Rauch (@rauchg) auf X: Grok 4.6 mit 1,5T Parametern und massivem SFT/RL-Upgrade etwa am 7. August, gefolgt von Grok 4.7 mit 2,1T Ende August. xAI hat keine offiziellen Benchmarks, Modellkarten oder Preise für 4.6 veröffentlicht. Einzige Primärquelle: Musks X-Post. Planen Sie Musk time (± mehrere Tage bis zwei Wochen) ein.
Drei Wochen nach Grok 4.5 (8. Juli: $2/$6 pro Million Token, 500K Kontext, Terminal-Bench 83,3 %, SWE-Bench Pro 64,7 %) skizziert Musk einen Sommer mit drei Frontier-Modellen. Kimi K3 (2,8T, 1M Kontext, Open Weight ab 27. Juli) setzt messbare Benchmarks — Grok 4.6 noch nicht. Dieser Report trennt bestätigte Zahlen von Ankündigungen.
01 · Drei Entscheidungsengpässe
- Tweet vs. offizielle Quelle: Kernfakten (7. Aug., 1,5T, SFT/RL) stammen aus einer X-Antwort. Grok 4.5 lieferte Modellkarte + 15 Benchmarks — für 4.6 fehlt beides. Interne Roadmaps auf „bestätigt“ zu setzen, riskiert Widerspruch bei xAI-Blog-Update.
- Benchmark-Lücke bei Parameter-PR: 1,5T und 2,1T sind headline-stark, aber ohne unabhängige Messung. Kimi K3: SWE-bench 93,4 %, AA Index #3. Parameterzahl ≠ $/Task — Grok 4.5 zeigte ~15.954 Output-Token pro SWE-Bench-Pro-Task vs. ~67.020 bei Claude Opus 4.8 (Faktor ~4,2).
- Komprimierter Auswahlzyklus + Musk time: 4.5 → 4.6 → 4.7 in ~8 Wochen verkürzt Evaluierungsfenster. Musks Historie: Releases oft Tage bis zwei Wochen verspätet. API-Keys auf dem Daily-Driver fixieren, bevor 4.6 messbar ist, erhöht Wechselkosten.
02 · Release-Zeitstrahl: Grok 4.5 → 4.6 → 4.7
| Datum | Ereignis | Status |
|---|---|---|
| 2026-07-08 | Grok 4.5 GA: Coding/Agent-Fokus, Cursor-Co-Training, 500K Kontext, $2/$6, Terminal-Bench 83,3 %, SWE-Bench Pro 64,7 % | Veröffentlicht |
| 2026-07-16 | Kimi K3 hosted launch (2,8T MoE, 1M Kontext) | Veröffentlicht |
| 2026-07-27 | Kimi K3 vollständige Open-Weight-Freigabe (HF ~1,56TB) | Veröffentlicht |
| 2026-07-28 | Musk: Grok 4.6/4.7-Roadmap (@rauchg). Parallel: „Pacing the Frontier“-Brief (1.200+ Signierende) | Ankündigung |
| ~2026-08-07 | Grok 4.6: 1,5T, SFT/RL-Upgrade (Zieldatum, unbestätigt) | Geplant |
| ~2026-08 Ende | Grok 4.7: 2,1T, besser aber langsameres Serving, höhere Token-Effizienz | Geplant |
03 · Grok-Serie: Spezifikationstabelle
| Modell | Parameter | Kontext | API-Preis (In/Out pro M) | Benchmarks |
|---|---|---|---|---|
| Grok 4.5 | n/a | 500K | $2 / $6 | Terminal-Bench 83,3 %; SWE-Bench Pro 64,7 % |
| Grok 4.6 | 1,5T | n/a | n/a | Keine offiziellen |
| Grok 4.7 | 2,1T | n/a | n/a | Keine offiziellen |
Hard Fact: Grok 4.5 liefert messbare Token-Effizienz — nicht reine Parameter-Skalierung. 4.6 positioniert SFT/RL als Upgrade-Achse, nicht nur Größe.
04 · SFT/RL-Upgrade: Was die Daten bedeuten
4.1 SFT (Supervised Fine-Tuning)
Kuratierte Human-Demos korrigieren Output-Muster. Grok 4.5 nutzte Cursor-Session-Daten — messbar in Agent-Benchmarks, nicht in Rohparameterzahl.
4.2 RL (Reinforcement Learning)
Reward-Signale trainieren mehrstufige Agent-Aktionen. 4.6 soll hier „massiv“ upgraden (Musk-Wortlaut) — ohne veröffentlichte Evaluationsdaten.
4.3 Zwei-SKU-Strategie: 4.6 schnell, 4.7 stark
4.7: „besser in fast allem, aber langsamer beim Serving, Token-effizienter“ — analog Sonnet/Opus oder mini/full-Tiers. Kein Einheitsmodell für alle Workloads.
05 · Wettbewerbsmatrix (Stand 30.7.2026)
| Modell | Anbieter | Parameter | Kontext | Verifizierung |
|---|---|---|---|---|
| Grok 4.5 | xAI | n/a | 500K | xAI offiziell |
| Grok 4.6 | xAI | 1,5T | n/a | Nur Musk-Tweet |
| Kimi K3 | Moonshot | 2,8T MoE | 1M | Offiziell + Drittanbieter |
| Claude Fable 5.1 | Anthropic | n/a | n/a | Gerücht (Aug.) |
| GPT-5.6 Sol | OpenAI | n/a | n/a | OpenAI offiziell |
06 · Risiken & Kontext
- CSAM-Klage (Juli 2026): xAI verklagte einen Nutzer wegen Umgehung von Safety-Filtern. Erste Deepfake/CSAM-Klage des Unternehmens. Compliance-Risiko neben Technik-Score.
- Pacing the Frontier (28.7.): 1.200+ Mitarbeiter von OpenAI, Anthropic, Google DeepMind, Meta fordern bewusste Verlangsamung. xAI nicht unterzeichnet — während 4.6/4.7 beschleunigt werden.
- Null Benchmarks für 4.6: Im Gegensatz zu 4.5 keine Modellkarte. „1,5T + SFT/RL“ ist Vendor-Claim bis unabhängige Reproduktion.
07 · August 2026: höchste Release-Dichte
Grok 4.6 (~7.8.), Grok 4.7 (Ende Aug.), Gerücht Fable 5.1 (Aug.) und Kimi-K3-Nachwirkungen konvergieren. Entscheidungsmetrik: $/Task und Output-Token, nicht Leaderboard-Headlines. Musk time einplanen.
08 · 5 Validierungsschritte (Mac-Entwickler)
- Grok-4.5-Baseline messen: xAI-API oder Cursor — je 1 Task (Langdokument, Bugfix, Refactor). Output-Token und $/Task protokollieren.
- Offizielle Kanäle monitoren: x.ai/news, @xai — bei X vs. Blog-Divergenz Blog priorisieren.
- Kimi-K3-A/B jetzt: Gleiches Repo, gleicher Prompt — 4.6-Benchmark-Lücke überbrücken.
- Isolierter Miet-Mac: xAI-Key nicht im Daily-Driver-Keychain; Grok Build / Cursor-Routing testen.
- Wiki mit „unbestätigt“-Label: Quelle (Musk 28.7., @rauchg) + Update-SLA 24h nach xAI-GA.
09 · FAQ
F: Wann erscheint Grok 4.6?
A: Musk nannte ~7. August 2026 auf X — keine xAI-Bestätigung. Rechnen Sie mit Musk time (± Tage bis zwei Wochen).
F: Unterschied 4.6 vs. 4.7?
A: 4.6 = 1,5T + SFT/RL-Fokus. 4.7 = 2,1T, laut Musk überlegen außer Serving-Geschwindigkeit, token-effizienter. Beide unveröffentlicht.
F: Stärker als Kimi K3 / Fable 5.1?
A: Unbekannt. K3 hat verifizierte Benchmarks; Fable 5.1 ist Gerücht; 4.6 hat keine öffentlichen Scores.
F: Preis für 4.6?
A: Unbekannt. Referenz 4.5: $2/$6 pro Million Token.
F: Wo nutzbar?
A: Noch nirgends offiziell. 4.5-Pfad (Grok Build, API, Cursor) wahrscheinlich, aber unbestätigt.
10 · Isolierte Mac-Miete: Grok-API ohne Keychain-Risiko
1,5T lokale Inferenz auf MacBook: unrealistisch. API/Cursor ist der Pfad — aber xAI-Keys auf dem Daily Driver plus Long-Context-Tests erhöhen Leak- und Fehlkosten-Risiko. Isolierter Apple-Silicon-Miet-Mac: 4.5-Baseline fixieren, 4.6-A/B nach GA, Instanz zerstören.
Tarife: Bare-Metal-macOS-Preise.
11 · Quellen
- Primär: Musk X-Post 28.7.2026 (@rauchg)
- Offiziell: x.ai/news Grok 4.5, media.x.ai Modellkarte
- Wettbewerb: Moonshot Kimi K3, Artificial Analysis, Vals AI
- Kontext: Pacing the Frontier (The Verge), xAI CSAM-Klage (Ars Technica, TechCrunch)
- Fable 5.1: 36kr, WinCentral (unbestätigt)
Stand: 30. Juli 2026. Grok 4.6/4.7 vor xAI-GA als vorläufig behandeln.