DeepSeek V4 Offiziell 31.7. 2026-08-05

DeepSeek V4-Flash-0731 offiziell — Benchmarks, Preise und die Agent-„Kill Line"

Zielgruppe: Entwickler und Agent-Teams, die DeepSeek V4-Flash-0731 gegen Kimi K3, Qwen3.8-Max und Claude bewerten und wissen müssen, ob die Agent-Scores belastbar sind und was der Bruchteil-Preis wirklich bedeutet. Lieferumfang: verifizierter Zeitstrahl April–August, Preis- und Benchmark-Tabellen, Harness-Kontext, Vorbehalte und fünf Mac-Isolations-Schritte mit DSGVO-Blick. Struktur: drei Schmerzpunkte, Datentabellen, technischer Deep-Dive, FAQ×5.

DeepSeek V4-Flash-0731 offizieller Release Juli 2026 284 Milliarden Parameter Agent-Benchmarks Preisvergleich Claude Opus

Querverweise: DeepSeek V4 GA (Juli); Kimi K3 Open Weight; Preiskontext: OpenAI GPT-5.6 Luna -80 %.

Am 31. Juli 2026 hat DeepSeek V4-Flash-0731 zur offiziellen API-Beta befördert: dieselben 284 Milliarden Gesamtparameter und 13 Milliarden aktivierte Parameter wie im April-Preview — nur das Post-Training ist neu. Auf Agent-Benchmarks übertrifft Flash jetzt die größere V4-Pro-Preview, bei einem Listenpreis von grob 1/36 bis 1/179 gegenüber Claude Opus 4.8. Die Flaggschiff-Version V4-Pro und das Agent-Framework Harness sind weiterhin nicht veröffentlicht.

01 · Drei Entscheidungsschmerzpunkte: Warum „offiziell" nicht „neu" bedeutet

  1. Marketing vs. Architektur: „DeepSeek V4 offiziell" klingt nach einem neuen Modell — tatsächlich ist die Parameterzahl und Struktur unverändert. Wer nur Schlagzeilen liest, übersieht, dass die Leistungssprünge ausschließlich aus Post-Training stammen und auf Harness-abhängigen Agent-Scores basieren.
  2. API-only, kein Consumer-Update: Der 31.-Juli-Build gilt nur für die API; App und Web-Chat blieben auf dem alten Stand. Teams, die Endnutzer-Flows testen, sehen andere Verhalten als reine API-Integratoren — ein häufiger Blindspot bei Migrationsentscheidungen.
  3. Datenschutz und Stabilität unter Last: Übersee-Entwickler berichten laut 21st Century Business Herald über niedrige Cache-Trefferquoten und gelegentliche Timeouts beim Safety-Classifier. Für EU-Teams mit DSGVO-Pflichten bedeutet das: Prompt-Inhalte können häufiger ungecacht verarbeitet werden, Latenz schwankt — Kosten und Audit-Trail werden unplanbarer als die Headline-Preistabelle suggeriert.

02 · Zeitstrahl: Von der Preview im April bis zum Stichtag 5. August

  • 24. April 2026: DeepSeek-V4-Preview mit zwei MIT-lizenzierten MoE-Modellen — V4-Pro (1,6T gesamt / 49B aktiv) und V4-Flash (284B / 13B), jeweils 1 Mio. Token Kontext.
  • 24. Juli 2026: Legacy-Aliase deepseek-chat und deepseek-reasoner werden abgeschaltet; Traffic routet vollständig auf die V4-Familie.
  • 27. Juli 2026: Moonshot AI veröffentlicht Kimi K3 Open Weights (2,8T gesamt) — größter Open-Weight-Drop des Monats, direkter Druck auf DeepSeek.
  • 31. Juli 2026: deepseek-v4-flash wird offizielle API-Beta (Build-Tag „0731"). Open Weights landen am selben Tag auf Hugging Face. Changelog nennt erstmals DeepSeek Harness — „demnächst". Nur API, keine App/Web-Aktualisierung.
  • 5. August 2026 (Stichtag): V4-Pro offiziell weiterhin ohne Datum. Chinesische Medien zitieren anonyme Quellen mit internem Test ab KW 30 und möglichem GA-Fenster 10.–20. Augustvon DeepSeek nicht bestätigt.

03 · Kerndaten und Preistabelle

Modell Status Gesamt / aktiv Kontext Input (Miss/Hit pro M) Output (pro M) Lizenz
V4-Flash-0731Offiziell (31.7.)284B / 13B1M$0,14 / $0,0028$0,28MIT
V4-ProPreview (24.4.)1,6T / 49B1M$0,435 / $0,003625$0,87MIT
Kimi K3Open Weights (27.7.)2,8T / ~104B (Schätzung)~1,05M$3,00 / $0,30$15,00Modified MIT
GLM-5.2Open (Juni 2026)~744B / ~40B1Mn. v.n. v.MIT
Qwen3.8-MaxAPI GA (2.8.)2,4T / 95B1M$2,00 / ~$0,17–0,25$6,00Open Weight versprochen

Alle Preise sind Herstellerlisten — keine unabhängige Prüfung. DeepSeek kündigte einen 2× Peak-Hour-Zuschlag (9–12 Uhr und 14–18 Uhr Peking-Zeit) an, ohne festes Datum.

Hardfact #1: V4-Flash-0731 Input $0,14 pro Million Token (Cache-Miss) — laut 21st Century Business Herald etwa 36× günstiger als Claude Opus 4.8 bei Miss, 179× bei Cache-Hit.

Hardfact #2: Terminal Bench 2.0 — V4-Flash-0731 82,7 vs. V4-Pro-Preview 67,9 (Herstellerangabe, Harness minimal mode).

Hardfact #3: Artificial Analysis Intelligence Index 50 bei durchschnittlich $0,03 pro Task — Kimi K3 Index 57 bei $0,86/Task (Drittquelle).

04 · Technischer Deep-Dive: Post-Training, Architektur und Harness

4.1 Gleiche Architektur, neues Post-Training

DeepSeek bestätigt ausdrücklich: V4-Flash-0731 ist in Größe und Struktur identisch mit dem April-Preview. Der gesamte Agent-Benchmark-Sprung stammt aus einem erneuten Post-Training-Pass — ein 284B/13B-Modell schlägt damit ein 1,6T/49B-Modell derselben Familie. Das widerspricht der Branchenannahme „größer = besser" und unterstreicht den Wettbewerbsfokus auf Datenqualität und Trainingsmethoden in der zweiten Jahreshälfte 2026.

4.2 Hybrid-Attention, mHC und Muon

Laut Technical Report „DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence" (unverändert seit Preview):

  • Hybrid-Attention (CSA + HCA, extern „DSA"): senkt Compute und Speicher bei langem Kontext;
  • Manifold-Constrained Hyper-Connections (mHC): verbesserte Residual-Verbindungen;
  • Muon-Optimierer: schnellere Konvergenz und Trainingsstabilität.

DeepSeek behauptet für V4-Pro bei 1M Token: nur 27 % der per-Token-FLOPs und 10 % des KV-Cache gegenüber V3.2 — Herstellerzahlen ohne unabhängige Reproduktion, aber relevant für Million-Token-Kostenplanung.

4.3 Harness: erstes Inhouse-Agent-Framework

Der 31.-Juli-Changelog nennt erstmals DeepSeek Harness — Datei-I/O, Tool-Calls, mehrstufige Engineering-Tasks, positioniert als Antwort auf Claude Code. Alle veröffentlichten Agent-Scores (Terminal Bench 2.0, Toolathlon) wurden im noch nicht öffentlichen „minimal mode" bei max effort, top_p 0,95, temperature 1,0 gemessen. DeepSeek warnt selbst: Agent-Scores sind „extrem sensitiv gegenüber der Harness-Wahl" — keine pauschale Portierung auf Claude Code oder Cursor.

05 · Wettbewerbsmatrix: V4-Flash vs. Kimi K3 vs. Qwen3.8-Max

Modell Labor Release Gesamt AA Intelligence Index $/Task (AA)
V4-Flash-0731DeepSeek31.7. offiziell284B50$0,03
Kimi K3Moonshot16.7. Preview / 27.7. Weights2,8T57$0,86
GLM-5.2Zhipu / Z.aiJuni 2026~744B~1 Pkt. über Flashn. v.
Qwen3.8-MaxAlibaba2.8. GA2,4Tn. v.n. v.
GPT-5.6 SolOpenAIClosed9+ Pkt. über Flash$1,86
Claude Fable 5AnthropicClosed9+ Pkt. über Flash$3,15

Die Spannung: Auf dem unabhängigen Artificial-Analysis-Index liegt V4-Flash nicht an der Spitze — hinter Kimi K3 und GLM-5.2. Die Kosten pro Task sind jedoch etwa 1/29 von Kimi K3, 1/62 von GPT-5.6 Sol und 1/105 von Claude Fable 5. DeepSeek konkurriert nicht um Rang eins, sondern um „ausreichend intelligent zum Mindestpreis" — passend zur siebenwöchigen OpenRouter-Spitzenposition der Preview-Version.

06 · Vorbehalte: Benchmarks, Usability und unbestätigte Termine

  • Harness-abhängige Agent-Scores: Terminal Bench 2.0 (82,7) mit unreleased Harness minimal mode — bis Dritte mit Claude Code oder Cursor reproduzieren, als „Vendor plus Framework" behandeln.
  • Praxis-Feedback: Niedrige Cache-Hit-Rate und Safety-Classifier-Timeouts laut 21st Century Business Herald — Compute-Budget begrenzt, was Post-Training allein heilen kann.
  • V4-Pro und Harness ohne Datum: Medien nennen 10.–20. August; offizieller Changelog nur „so bald wie möglich".
  • Finanzierungsgerüchte: Berichte über ~7,4 Mrd. $ Runde (Tencent, NetEase) und ~71 Mrd. $ Bewertung — anonyme Quellen, keine regulatorische Bestätigung.

07 · Kill Line, Community-Stimmung und Chip-Markt

Vor dem 31. Juli verspottete die chinesische AI-Community Gründer Liang Wenfeng als „Liang Baikai" (leeres Versprechen), weil V4-Pro den Juli-Termin verpasste. Nach dem Flash-Release kehrte der Spitzname „Liang Sheng" zurück — ein schneller Stimmungsbarometer.

Substanzieller ist der Begriff „斩杀线" (Kill Line): DeepSeeks Kombination aus „gut genug" plus Extrempreis setzt eine Marktschwelle. Konkurrenten ohne klaren Qualitäts- oder Preisvorteil verlieren Relevanz — erklärt parallele Preissenkungen wie GPT-5.6 Luna -80 %. Ein Branchenkontakt zu 21st Century Business Herald: „Jedes große Modellunternehmen muss vor Liang Wenfeng laufen, um zu überleben."

Am Release-Tag (31. Juli) reagierten Nvidia, Broadcom und AMD kaum — im Gegensatz zum Chip-Selloff nach DeepSeek-R1 Anfang 2025. Der Markt behandelt „mehr mit weniger Compute" inzwischen als Normalzustand chinesischer Engineering-Effizienz.

08 · Fünf Mac-Validierungsschritte (DSGVO-sensible Agent-Tests)

  1. DeepSeek-API-Key in isolierter Umgebung anlegen; Legacy-Alias deepseek-chat auf deepseek-v4-flash migrieren — Audit-Log der Model-Strings für Compliance dokumentieren
  2. Baseline-Tasks (SWE-Fix, Terminal-Bench-Subset, Langkontext-Summary) einmal mit V4-Flash-0731 und einmal mit V4-Pro-Preview fahren — Latenz, Cache-Hit-Rate und $/Task protokollieren
  3. Gleiche Aufgabe parallel gegen Kimi K3 API und Qwen3.8-Max; Artificial-Analysis-$/Task mit eigener Rechnung abgleichen
  4. Agent-Harness extern testen: Claude Code oder OpenClaw mit DeepSeek-Endpunkt — nicht nur Hersteller-Harness-Scores als Entscheidungsgrundlage
  5. Entscheidungsmatrix mit Team erstellen; Re-Test-Termin setzen, sobald V4-Pro GA oder Harness öffentlich wird — bis dahin keine produktionskritische Vollmigration
# OpenAI-kompatibler Endpunkt (Isolations-Mac) export OPENAI_API_KEY="your-deepseek-key" export OPENAI_BASE_URL="https://api.deepseek.com/v1" curl https://api.deepseek.com/v1/chat/completions \ -H "Authorization: Bearer $OPENAI_API_KEY" \ -d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"Ping"}]}'

09 · FAQ

F1: Ist DeepSeek V4 Open Source?
A: Ja. V4-Pro und V4-Flash inkl. 0731-Build liegen unter MIT auf Hugging Face — kommerzielle Nutzung, Fine-Tuning und Weiterverteilung erlaubt.

F2: Wie viel günstiger ist V4-Flash als Claude Opus 4.8?
A: Laut 21st Century Business Herald: Cache-Miss-Input ~36×, Cache-Hit ~179×, Output ~89× pro Million Token — Listenpreise, nicht unabhängig geprüft.

F3: Wann kommt V4-Pro offiziell?
A: Kein bestätigtes Datum. Gerüchte 10.–20. August sind nicht von DeepSeek bestätigt.

F4: DeepSeek-Benchmarks vertrauen?
A: SWE-bench Verified und etablierte Dritt-Benchmarks haben mehr Gewicht. Agent-Scores (Terminal Bench 2.0) sind Harness-abhängig — auf unabhängige Reproduktion warten.

F5: Was ist DeepSeek Harness?
A: Erstes eigenes Agent-Ausführungsframework (Dateien, Tools, Engineering-Tasks) — Alternative zu Claude Code. Im Changelog vom 31. Juli erstmals genannt, noch nicht öffentlich.

10 · Mac-Miete: DeepSeek-Agent-Pipelines ohne Daily-Driver-Risiko

Die V4-Flash-API senkt Token-Kosten drastisch, doch auf dem Haupt-Entwicklungsrechner bleiben Risiken: API-Keys in globaler Shell, ungecachte Million-Token-Läufe mit unplanbaren Rechnungen, Konflikte zwischen Claude Code und OpenClaw, und für EU-Teams die Frage, wo Prompt-Daten physisch verarbeitet werden. Windows- und Linux-Hosts erreichen die API, validieren aber selten macOS-native Keychain-, Xcode- und TCC-Szenarien vollständig.

Kurzfristige API-Tests auf dem Laptop sind sinnvoll für Preisvergleiche; wer reproduzierbare Agent-Umgebungen, auditierbare Isolation und stabile Apple-Ökosystem-Kompatibilität will, profitiert von einem dedizierten Apple-Silicon-Mac. Tagesmiete statt CapEx passt zum Rhythmus „0731 beobachten → Harness abwarten → zerstören". Tarife: Bare-Metal-macOS-Preise.

Cloud-API reicht für die erste Selektion; für DSGVO-sensible Agent-Pipelines mit destroy-after-test und parallelen Harness-Vergleichen ist ein gemieteter Mac mini M4 oft die bessere Ökonomie — besonders wenn V4-Pro GA mehrere Toolchains gleichzeitig erfordert.

11 · Quellen

  • DeepSeek offizielle API-Dokumentation und Changelog (api-docs.deepseek.com)
  • Technical Report „DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence" und Hugging-Face-Model Cards
  • Artificial Analysis (Intelligence Index, $/Task), zitiert über Wantrich Financial und Meyka
  • 21st Century Business Herald — Usability-Feedback und Preisvergleich Claude Opus 4.8
  • Kuai Technology / ifeng Tech, V2EX-Diskussion, 36Kr EU, HTX Insights
  • Offizielle Ankündigungen Moonshot AI (Kimi K3), Zhipu/Z.ai (GLM-5.2), Alibaba Cloud (Qwen3.8-Max)

Vor Produktionsentscheidungen Preise, Benchmarks und V4-Pro/Harness-Status erneut prüfen — alle Angaben Stand 5. August 2026.