DeepSeek V4 GA Release: Peak-Valley-Tarife, 1,6T-MoE & datenbasierter GPT-5.6-Vergleich
Wer hat welches Problem? Mac-Entwickler mit deepseek-chat/reasoner in Produktion stehen vor GA am 20.07. und Hard-Cutoff am 24.07., unsicher bei Peak-Valley-Kosten und Pro-vs-Flash-Routing. Was Sie erhalten: messbare Timeline, Architektur-Specs, Benchmark-Tabellen, Preismatrix, 6-Schritte-Migration und Entscheidungsmatrix. Enthält: Pain×3, CSA/HCA-Analyse, Vergleich GPT-5.6/Fable 5, FAQ×6.
Inhaltsverzeichnis
Kontext: GPT-5.6 Sol Benchmarks; lokale Inferenz: V4-Flash Mac-Inferenz; Preishintergrund: KI-Preissenkungen Juni 2026.
Nach drei Monaten Preview ist DeepSeek V4 am 20. Juli 2026 als GA-Release live. Die messbaren Änderungen: verbesserte Agent- und Code-Performance, erstmals Peak-Valley-Tarife und ein fester API-Migrationsstichtag. Dieser Leitfaden fasst Architektur, Benchmarks, Kosten und Migrationspfade in Tabellenform zusammen — für Teams, die Entscheidungen auf Zahlen statt auf Marketing stützen.
01 · Drei Migrations-Schmerzpunkte: GA ≠ kostenloser Modelltausch
- Hard-Cutoff 24.07.:
deepseek-chatunddeepseek-reasonerenden am 24.07.2026 um 23:59 Peking-Zeit. Hardcodierte Model-IDs in CI/CD führen nach dem Wochenende zu 404 — kein Grace-Period-Grau. - Peak-Valley-Rechnungsblindheit: Werktags 09:00–12:00 und 14:00–18:00 (Peking) verdoppeln die Sätze. Agent-Batch-Jobs ohne Cron-Scheduling können die Monatsrechnung gegenüber der Preview-Ära verdoppeln.
- Pro vs. Flash Fehlrouting:
reasonerkann zu Flash Think oder V4-Pro migrieren; Think Max braucht ≥384K Kontext. Vollmigration auf Pro erhöht Kosten, reine Flash-Nutzung senkt SWE-bench-Qualität — Szenario-Splitting ist Pflicht.
02 · Timeline: Preview bis GA
| Datum | Ereignis |
|---|---|
| 24.04.2026 | V4-Preview + Open Source (MIT): V4-Pro 1,6T, V4-Flash 284B |
| Mai 2026 | Produktions-Tuning-Versionen, API allgemein verfügbar |
| Juni 2026 | V4-Pro Output dauerhaft −75 % auf $0,87/M tokens |
| 29.06.2026 | E-Mail an API-Nutzer: GA Mitte Juli, Peak-Valley-Schema angekündigt |
| 19.07.2026 | GA-Grauzugang für ausgewählte Entwickler, Medienberichte |
| 20.07.2026 | GA-Release (Veröffentlichungsdatum dieses Artikels) |
| 24.07.2026 | deepseek-chat / deepseek-reasoner dauerhaft offline |
03 · Architektur: V4-Pro vs. V4-Flash
3.1 Spezifikationstabelle
| Parameter | V4-Pro | V4-Flash |
|---|---|---|
| Gesamtparameter | 1,6 Billionen (1,6T) | 284 Milliarden (284B) |
| Aktive Parameter/Token | 49B | 13B |
| Transformer-Layer | 61 | 43 |
| Kontextfenster | 1.000.000 tokens | 1.000.000 tokens |
| Max. Output | 384K tokens | 384K tokens |
| Präzision | FP4 (Experten) + FP8 | FP4 + FP8 gemischt |
| Pretraining | 33T+ tokens | 32T+ tokens |
| Lizenz | MIT | MIT |
3.2 CSA + HCA Hybrid-Attention
DeepSeek V4 ersetzt MLA (V2/V3) durch Compressed Sparse Attention (CSA) und Heavily Compressed Attention (HCA). CSA komprimiert KV 4× via Softmax-Gating, wählt top-k (Pro: 1024, Flash: 512) per FP4-Lightning-Indexer und behält ein 128-Token-Sliding-Window. HCA komprimiert 128× für globale Dense-Attention.
Datenpunkt #1: Bei 1M Kontext benötigt V4 nur 27 % der FLOPs von V3.2; KV-Cache-Speicher sinkt auf 10 % (Flash: 7 %).
3.3 mHC & Muon-Optimizer
Manifold-Constrained Hyper-Connections (mHC) nutzen 4-Kanal-Residualströme mit Birkhoff-Polytope-Constraint für stabile Gradienten in 61 Layern. Training via Muon-Optimizer (Newton-Schulz-Orthogonalisierung) statt AdamW.
3.4 Inferenzmodi
| Modus | Eigenschaft | Einsatz |
|---|---|---|
| Non-think | Keine CoT, niedrige Latenz | Q&A, Routing |
| Think High | Explizites Reasoning | Code-Debug, mittlere Komplexität |
| Think Max | Maximales Reasoning, ≥384K Kontext | Mathematik, Multi-Agent |
04 · Benchmark-Daten (Stand 20.07.2026)
| Benchmark | V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % ★ OSS-Spitze | 96,0 % | n/a | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench Pass@1 | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3.206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
Datenpunkt #2 (Artificial Analysis): Fable 5: $3,48/Task, Score 50. V4-Pro: $0,03/Task, Score 38. Kostenfaktor 116×, Qualitätsdelta ~31 %.
05 · Vergleich GPT-5.6 Sol & Claude Fable 5
| Dimension | V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open Source | ✅ MIT | ❌ | ❌ |
| Self-Hosting | ✅ | ❌ | ❌ |
| Kontext | 1M tokens | unveröffentlicht | 1M tokens |
| Output (Off-Peak) | $0,87/M | ~$15/M | $50/M |
| Output (Peak) | $1,74/M | — | — |
| DSGVO / Datensouveränität | ✅ On-Premise | ❌ | ❌ |
5.1 Entscheidungsmatrix
| Szenario | Empfehlung | Begründung |
|---|---|---|
| Budget / hohe Frequenz / On-Prem | V4-Pro / V4-Flash | $0,87/M bzw. $0,28/M Output, MIT-Lizenz |
| Maximale Code-Qualität | Claude Fable 5 | SWE-bench Pro 80,3 % |
| Algorithmik + Mathematik | GPT-5.6 Sol/Ultra | Terminal-Bench 85,1 %, Ökosystem |
| Massen-Dokumente (günstig) | V4-Flash | Cache-Hit Input $0,0028/M |
06 · Peak-Valley-Preise
| Modell | Position | Off-Peak | Peak |
|---|---|---|---|
| V4-Pro | Input (Cache-Hit) | $0,0035/M | 2× |
| Input (Cache-Miss) | $0,435/M | $0,87/M | |
| Output | $0,87/M | $1,74/M | |
| V4-Flash | Input (Cache-Hit) | $0,0028/M | 2× |
| Input (Cache-Miss) | $0,14/M | $0,28/M | |
| Output | $0,28/M | $0,56/M |
Peak-Fenster (Peking-Zeit): Werktags 09:00–12:00 und 14:00–18:00.
Datenpunkt #3: Selbst im Peak kostet V4-Pro Output ($1,74/M) 8,6× weniger als Claude Opus 4.8 ($15/M).
07 · API-Migration bis 24.07.2026 ⚠️
Warnung: deepseek-chat und deepseek-reasoner enden am 24.07.2026, 15:59 UTC (23:59 Peking). Migration vor diesem Zeitpunkt ist Pflicht.
7.1 Mapping-Tabelle
| Alt | Neu | Hinweis |
|---|---|---|
deepseek-chat | deepseek-v4-flash (Non-think) | Schnell, leichte Tasks |
deepseek-reasoner | deepseek-v4-flash (Think) oder deepseek-v4-pro | Pro für stärkeres Reasoning |
7.2 Sechs-Schritte-Migrations-Checkliste
- Codebase global nach
deepseek-chat/deepseek-reasonerdurchsuchen (inkl. CI/CD, Env-Vars) - Model-IDs gemäß Mapping ersetzen
- Think-Modus aktivieren:
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}} - Think Max: Kontextfenster ≥384K verifizieren
- Staging-Regression: Qualität und Latenz vor/nach Migration messen
- Produktionsswitch vor 24.07., Peak-Valley-Rechnung in Woche 1 überwachen
08 · Fazit
DeepSeek V4 GA ist kein reiner Marketing-Release: messbare Verbesserungen bei Agenten und Code, plus disziplinierte Peak-Valley-Preise. Der Wert liegt nicht darin, Fable 5 oder GPT-5.6 zu schlagen, sondern nahezu Frontier-Performance zu 1/10–1/100 der Kosten als Open Source mit 1M Kontext und DSGVO-tauglichem Self-Hosting.
09 · FAQ
F: GA vs. Preview?
A: Stabilere Produktion, bessere Agent/Code-Performance, Peak-Valley-Tarife. Architektur unverändert.
F: Wann endet deepseek-chat?
A: 24.07.2026, 23:59 Peking-Zeit.
F: Peak-Zeiten?
A: Werktags 09:00–12:00 und 14:00–18:00 Peking, Sätze verdoppelt.
F: V4-Pro vs. Fable 5?
A: Fable führt SWE-bench; V4-Pro ist OSS-Spitze bei 1/116 der Kosten.
F: Pro oder Flash?
A: Pro für Qualität, Flash für Volumen und Routing.
F: Mac-Deployment?
A: Flash quantisiert auf Mac Studio; Pro braucht Cluster. Siehe lokale Inferenz-Anleitung.
10 · Isolierte Mac-Miete: V4-Migration ohne Keychain-Risiko
Vor dem 24.07.-Cutoff ist ein globaler Model-ID-Tausch auf dem Haupt-MacBook riskant: alte deepseek-chat-Einträge in Shell-Profilen, Think-Mode-Experimente in lokalem Cache und gemischte Claude/GPT-Routing-Tests lassen sich nicht sauber isolieren. Ein dedizierter Apple-Silicon-Knoten ermöglicht reproduzierbare Regression mit deepseek-v4-flash und deepseek-v4-pro, Peak-Valley-Kostenvergleich und destroy-after-acceptance.
Windows/Linux-Teams können die API direkt testen, verpassen aber die Validierung mit macOS-Keychain, Xcode-Sidecar-Projekten und nativen Dev-Tools. Obwohl API-Migration auch vom Laptop aus möglich ist, liefert ein isolierter Mac reproduzierbare Ergebnisse mit geringerem Credential-Leak-Risiko — Tagesmiete senkt die Hardware-Hürde. Tarife: M-Serie Compute-Preise.
11 · Quellen
- DeepSeek API-Docs: api-docs.deepseek.com
- arXiv: 2606.19348
- Hugging Face: deepseek-ai
- Artificial Analysis: artificialanalysis.ai
Datenstand: 20.07.2026. Benchmarks und Preise können sich ändern — offizielle Dokumentation maßgeblich.