Open-Source-LLM DeepSeek V4 GA 2026-07-20

DeepSeek V4 GA Release: Peak-Valley-Tarife, 1,6T-MoE & datenbasierter GPT-5.6-Vergleich

Wer hat welches Problem? Mac-Entwickler mit deepseek-chat/reasoner in Produktion stehen vor GA am 20.07. und Hard-Cutoff am 24.07., unsicher bei Peak-Valley-Kosten und Pro-vs-Flash-Routing. Was Sie erhalten: messbare Timeline, Architektur-Specs, Benchmark-Tabellen, Preismatrix, 6-Schritte-Migration und Entscheidungsmatrix. Enthält: Pain×3, CSA/HCA-Analyse, Vergleich GPT-5.6/Fable 5, FAQ×6.

DeepSeek V4 GA Release Peak-Valley-Preise MoE-Architektur Benchmarks GPT-5.6 Vergleich Juli 2026

Kontext: GPT-5.6 Sol Benchmarks; lokale Inferenz: V4-Flash Mac-Inferenz; Preishintergrund: KI-Preissenkungen Juni 2026.

Nach drei Monaten Preview ist DeepSeek V4 am 20. Juli 2026 als GA-Release live. Die messbaren Änderungen: verbesserte Agent- und Code-Performance, erstmals Peak-Valley-Tarife und ein fester API-Migrationsstichtag. Dieser Leitfaden fasst Architektur, Benchmarks, Kosten und Migrationspfade in Tabellenform zusammen — für Teams, die Entscheidungen auf Zahlen statt auf Marketing stützen.

01 · Drei Migrations-Schmerzpunkte: GA ≠ kostenloser Modelltausch

  1. Hard-Cutoff 24.07.: deepseek-chat und deepseek-reasoner enden am 24.07.2026 um 23:59 Peking-Zeit. Hardcodierte Model-IDs in CI/CD führen nach dem Wochenende zu 404 — kein Grace-Period-Grau.
  2. Peak-Valley-Rechnungsblindheit: Werktags 09:00–12:00 und 14:00–18:00 (Peking) verdoppeln die Sätze. Agent-Batch-Jobs ohne Cron-Scheduling können die Monatsrechnung gegenüber der Preview-Ära verdoppeln.
  3. Pro vs. Flash Fehlrouting: reasoner kann zu Flash Think oder V4-Pro migrieren; Think Max braucht ≥384K Kontext. Vollmigration auf Pro erhöht Kosten, reine Flash-Nutzung senkt SWE-bench-Qualität — Szenario-Splitting ist Pflicht.

02 · Timeline: Preview bis GA

Datum Ereignis
24.04.2026V4-Preview + Open Source (MIT): V4-Pro 1,6T, V4-Flash 284B
Mai 2026Produktions-Tuning-Versionen, API allgemein verfügbar
Juni 2026V4-Pro Output dauerhaft −75 % auf $0,87/M tokens
29.06.2026E-Mail an API-Nutzer: GA Mitte Juli, Peak-Valley-Schema angekündigt
19.07.2026GA-Grauzugang für ausgewählte Entwickler, Medienberichte
20.07.2026GA-Release (Veröffentlichungsdatum dieses Artikels)
24.07.2026deepseek-chat / deepseek-reasoner dauerhaft offline

03 · Architektur: V4-Pro vs. V4-Flash

3.1 Spezifikationstabelle

Parameter V4-Pro V4-Flash
Gesamtparameter1,6 Billionen (1,6T)284 Milliarden (284B)
Aktive Parameter/Token49B13B
Transformer-Layer6143
Kontextfenster1.000.000 tokens1.000.000 tokens
Max. Output384K tokens384K tokens
PräzisionFP4 (Experten) + FP8FP4 + FP8 gemischt
Pretraining33T+ tokens32T+ tokens
LizenzMITMIT

3.2 CSA + HCA Hybrid-Attention

DeepSeek V4 ersetzt MLA (V2/V3) durch Compressed Sparse Attention (CSA) und Heavily Compressed Attention (HCA). CSA komprimiert KV 4× via Softmax-Gating, wählt top-k (Pro: 1024, Flash: 512) per FP4-Lightning-Indexer und behält ein 128-Token-Sliding-Window. HCA komprimiert 128× für globale Dense-Attention.

Datenpunkt #1: Bei 1M Kontext benötigt V4 nur 27 % der FLOPs von V3.2; KV-Cache-Speicher sinkt auf 10 % (Flash: 7 %).

3.3 mHC & Muon-Optimizer

Manifold-Constrained Hyper-Connections (mHC) nutzen 4-Kanal-Residualströme mit Birkhoff-Polytope-Constraint für stabile Gradienten in 61 Layern. Training via Muon-Optimizer (Newton-Schulz-Orthogonalisierung) statt AdamW.

3.4 Inferenzmodi

Modus Eigenschaft Einsatz
Non-thinkKeine CoT, niedrige LatenzQ&A, Routing
Think HighExplizites ReasoningCode-Debug, mittlere Komplexität
Think MaxMaximales Reasoning, ≥384K KontextMathematik, Multi-Agent

04 · Benchmark-Daten (Stand 20.07.2026)

Benchmark V4-Pro Claude Fable 5 GPT-5.6 Ultra Opus 4.8
SWE-bench Verified80,6 % ★ OSS-Spitze96,0 %n/a~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench Pass@193,5 %88,1 %87,4 %83,2 %
Codeforces Elo3.206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

Datenpunkt #2 (Artificial Analysis): Fable 5: $3,48/Task, Score 50. V4-Pro: $0,03/Task, Score 38. Kostenfaktor 116×, Qualitätsdelta ~31 %.

05 · Vergleich GPT-5.6 Sol & Claude Fable 5

Dimension V4-Pro GPT-5.6 Sol Claude Fable 5
Open Source✅ MIT
Self-Hosting
Kontext1M tokensunveröffentlicht1M tokens
Output (Off-Peak)$0,87/M~$15/M$50/M
Output (Peak)$1,74/M
DSGVO / Datensouveränität✅ On-Premise

5.1 Entscheidungsmatrix

Szenario Empfehlung Begründung
Budget / hohe Frequenz / On-PremV4-Pro / V4-Flash$0,87/M bzw. $0,28/M Output, MIT-Lizenz
Maximale Code-QualitätClaude Fable 5SWE-bench Pro 80,3 %
Algorithmik + MathematikGPT-5.6 Sol/UltraTerminal-Bench 85,1 %, Ökosystem
Massen-Dokumente (günstig)V4-FlashCache-Hit Input $0,0028/M

06 · Peak-Valley-Preise

Modell Position Off-Peak Peak
V4-ProInput (Cache-Hit)$0,0035/M
Input (Cache-Miss)$0,435/M$0,87/M
Output$0,87/M$1,74/M
V4-FlashInput (Cache-Hit)$0,0028/M
Input (Cache-Miss)$0,14/M$0,28/M
Output$0,28/M$0,56/M

Peak-Fenster (Peking-Zeit): Werktags 09:00–12:00 und 14:00–18:00.

Datenpunkt #3: Selbst im Peak kostet V4-Pro Output ($1,74/M) 8,6× weniger als Claude Opus 4.8 ($15/M).

07 · API-Migration bis 24.07.2026 ⚠️

Warnung: deepseek-chat und deepseek-reasoner enden am 24.07.2026, 15:59 UTC (23:59 Peking). Migration vor diesem Zeitpunkt ist Pflicht.

7.1 Mapping-Tabelle

Alt Neu Hinweis
deepseek-chatdeepseek-v4-flash (Non-think)Schnell, leichte Tasks
deepseek-reasonerdeepseek-v4-flash (Think) oder deepseek-v4-proPro für stärkeres Reasoning

7.2 Sechs-Schritte-Migrations-Checkliste

  1. Codebase global nach deepseek-chat / deepseek-reasoner durchsuchen (inkl. CI/CD, Env-Vars)
  2. Model-IDs gemäß Mapping ersetzen
  3. Think-Modus aktivieren: extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
  4. Think Max: Kontextfenster ≥384K verifizieren
  5. Staging-Regression: Qualität und Latenz vor/nach Migration messen
  6. Produktionsswitch vor 24.07., Peak-Valley-Rechnung in Woche 1 überwachen
# ❌ Alt (ab 24.07. ungültig) client.chat.completions.create(model="deepseek-chat", messages=[...]) # ✅ Neu client.chat.completions.create( model="deepseek-v4-pro", # oder deepseek-v4-flash messages=[...], # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}} )

08 · Fazit

DeepSeek V4 GA ist kein reiner Marketing-Release: messbare Verbesserungen bei Agenten und Code, plus disziplinierte Peak-Valley-Preise. Der Wert liegt nicht darin, Fable 5 oder GPT-5.6 zu schlagen, sondern nahezu Frontier-Performance zu 1/10–1/100 der Kosten als Open Source mit 1M Kontext und DSGVO-tauglichem Self-Hosting.

09 · FAQ

F: GA vs. Preview?
A: Stabilere Produktion, bessere Agent/Code-Performance, Peak-Valley-Tarife. Architektur unverändert.

F: Wann endet deepseek-chat?
A: 24.07.2026, 23:59 Peking-Zeit.

F: Peak-Zeiten?
A: Werktags 09:00–12:00 und 14:00–18:00 Peking, Sätze verdoppelt.

F: V4-Pro vs. Fable 5?
A: Fable führt SWE-bench; V4-Pro ist OSS-Spitze bei 1/116 der Kosten.

F: Pro oder Flash?
A: Pro für Qualität, Flash für Volumen und Routing.

F: Mac-Deployment?
A: Flash quantisiert auf Mac Studio; Pro braucht Cluster. Siehe lokale Inferenz-Anleitung.

10 · Isolierte Mac-Miete: V4-Migration ohne Keychain-Risiko

Vor dem 24.07.-Cutoff ist ein globaler Model-ID-Tausch auf dem Haupt-MacBook riskant: alte deepseek-chat-Einträge in Shell-Profilen, Think-Mode-Experimente in lokalem Cache und gemischte Claude/GPT-Routing-Tests lassen sich nicht sauber isolieren. Ein dedizierter Apple-Silicon-Knoten ermöglicht reproduzierbare Regression mit deepseek-v4-flash und deepseek-v4-pro, Peak-Valley-Kostenvergleich und destroy-after-acceptance.

Windows/Linux-Teams können die API direkt testen, verpassen aber die Validierung mit macOS-Keychain, Xcode-Sidecar-Projekten und nativen Dev-Tools. Obwohl API-Migration auch vom Laptop aus möglich ist, liefert ein isolierter Mac reproduzierbare Ergebnisse mit geringerem Credential-Leak-Risiko — Tagesmiete senkt die Hardware-Hürde. Tarife: M-Serie Compute-Preise.

11 · Quellen

Datenstand: 20.07.2026. Benchmarks und Preise können sich ändern — offizielle Dokumentation maßgeblich.