DeepSeek V4-Flash-0731 offiziell — Benchmarks, Preise und die Agent-„Kill Line"
Zielgruppe: Entwickler und Agent-Teams, die DeepSeek V4-Flash-0731 gegen Kimi K3, Qwen3.8-Max und Claude bewerten und wissen müssen, ob die Agent-Scores belastbar sind und was der Bruchteil-Preis wirklich bedeutet. Lieferumfang: verifizierter Zeitstrahl April–August, Preis- und Benchmark-Tabellen, Harness-Kontext, Vorbehalte und fünf Mac-Isolations-Schritte mit DSGVO-Blick. Struktur: drei Schmerzpunkte, Datentabellen, technischer Deep-Dive, FAQ×5.
📋 Inhaltsverzeichnis
Querverweise: DeepSeek V4 GA (Juli); Kimi K3 Open Weight; Preiskontext: OpenAI GPT-5.6 Luna -80 %.
Am 31. Juli 2026 hat DeepSeek V4-Flash-0731 zur offiziellen API-Beta befördert: dieselben 284 Milliarden Gesamtparameter und 13 Milliarden aktivierte Parameter wie im April-Preview — nur das Post-Training ist neu. Auf Agent-Benchmarks übertrifft Flash jetzt die größere V4-Pro-Preview, bei einem Listenpreis von grob 1/36 bis 1/179 gegenüber Claude Opus 4.8. Die Flaggschiff-Version V4-Pro und das Agent-Framework Harness sind weiterhin nicht veröffentlicht.
01 · Drei Entscheidungsschmerzpunkte: Warum „offiziell" nicht „neu" bedeutet
- Marketing vs. Architektur: „DeepSeek V4 offiziell" klingt nach einem neuen Modell — tatsächlich ist die Parameterzahl und Struktur unverändert. Wer nur Schlagzeilen liest, übersieht, dass die Leistungssprünge ausschließlich aus Post-Training stammen und auf Harness-abhängigen Agent-Scores basieren.
- API-only, kein Consumer-Update: Der 31.-Juli-Build gilt nur für die API; App und Web-Chat blieben auf dem alten Stand. Teams, die Endnutzer-Flows testen, sehen andere Verhalten als reine API-Integratoren — ein häufiger Blindspot bei Migrationsentscheidungen.
- Datenschutz und Stabilität unter Last: Übersee-Entwickler berichten laut 21st Century Business Herald über niedrige Cache-Trefferquoten und gelegentliche Timeouts beim Safety-Classifier. Für EU-Teams mit DSGVO-Pflichten bedeutet das: Prompt-Inhalte können häufiger ungecacht verarbeitet werden, Latenz schwankt — Kosten und Audit-Trail werden unplanbarer als die Headline-Preistabelle suggeriert.
02 · Zeitstrahl: Von der Preview im April bis zum Stichtag 5. August
- 24. April 2026: DeepSeek-V4-Preview mit zwei MIT-lizenzierten MoE-Modellen — V4-Pro (1,6T gesamt / 49B aktiv) und V4-Flash (284B / 13B), jeweils 1 Mio. Token Kontext.
- 24. Juli 2026: Legacy-Aliase
deepseek-chatunddeepseek-reasonerwerden abgeschaltet; Traffic routet vollständig auf die V4-Familie. - 27. Juli 2026: Moonshot AI veröffentlicht Kimi K3 Open Weights (2,8T gesamt) — größter Open-Weight-Drop des Monats, direkter Druck auf DeepSeek.
- 31. Juli 2026:
deepseek-v4-flashwird offizielle API-Beta (Build-Tag „0731"). Open Weights landen am selben Tag auf Hugging Face. Changelog nennt erstmals DeepSeek Harness — „demnächst". Nur API, keine App/Web-Aktualisierung. - 5. August 2026 (Stichtag): V4-Pro offiziell weiterhin ohne Datum. Chinesische Medien zitieren anonyme Quellen mit internem Test ab KW 30 und möglichem GA-Fenster 10.–20. August — von DeepSeek nicht bestätigt.
03 · Kerndaten und Preistabelle
| Modell | Status | Gesamt / aktiv | Kontext | Input (Miss/Hit pro M) | Output (pro M) | Lizenz |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | Offiziell (31.7.) | 284B / 13B | 1M | $0,14 / $0,0028 | $0,28 | MIT |
| V4-Pro | Preview (24.4.) | 1,6T / 49B | 1M | $0,435 / $0,003625 | $0,87 | MIT |
| Kimi K3 | Open Weights (27.7.) | 2,8T / ~104B (Schätzung) | ~1,05M | $3,00 / $0,30 | $15,00 | Modified MIT |
| GLM-5.2 | Open (Juni 2026) | ~744B / ~40B | 1M | n. v. | n. v. | MIT |
| Qwen3.8-Max | API GA (2.8.) | 2,4T / 95B | 1M | $2,00 / ~$0,17–0,25 | $6,00 | Open Weight versprochen |
Alle Preise sind Herstellerlisten — keine unabhängige Prüfung. DeepSeek kündigte einen 2× Peak-Hour-Zuschlag (9–12 Uhr und 14–18 Uhr Peking-Zeit) an, ohne festes Datum.
Hardfact #1: V4-Flash-0731 Input $0,14 pro Million Token (Cache-Miss) — laut 21st Century Business Herald etwa 36× günstiger als Claude Opus 4.8 bei Miss, 179× bei Cache-Hit.
Hardfact #2: Terminal Bench 2.0 — V4-Flash-0731 82,7 vs. V4-Pro-Preview 67,9 (Herstellerangabe, Harness minimal mode).
Hardfact #3: Artificial Analysis Intelligence Index 50 bei durchschnittlich $0,03 pro Task — Kimi K3 Index 57 bei $0,86/Task (Drittquelle).
04 · Technischer Deep-Dive: Post-Training, Architektur und Harness
4.1 Gleiche Architektur, neues Post-Training
DeepSeek bestätigt ausdrücklich: V4-Flash-0731 ist in Größe und Struktur identisch mit dem April-Preview. Der gesamte Agent-Benchmark-Sprung stammt aus einem erneuten Post-Training-Pass — ein 284B/13B-Modell schlägt damit ein 1,6T/49B-Modell derselben Familie. Das widerspricht der Branchenannahme „größer = besser" und unterstreicht den Wettbewerbsfokus auf Datenqualität und Trainingsmethoden in der zweiten Jahreshälfte 2026.
4.2 Hybrid-Attention, mHC und Muon
Laut Technical Report „DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence" (unverändert seit Preview):
- Hybrid-Attention (CSA + HCA, extern „DSA"): senkt Compute und Speicher bei langem Kontext;
- Manifold-Constrained Hyper-Connections (mHC): verbesserte Residual-Verbindungen;
- Muon-Optimierer: schnellere Konvergenz und Trainingsstabilität.
DeepSeek behauptet für V4-Pro bei 1M Token: nur 27 % der per-Token-FLOPs und 10 % des KV-Cache gegenüber V3.2 — Herstellerzahlen ohne unabhängige Reproduktion, aber relevant für Million-Token-Kostenplanung.
4.3 Harness: erstes Inhouse-Agent-Framework
Der 31.-Juli-Changelog nennt erstmals DeepSeek Harness — Datei-I/O, Tool-Calls, mehrstufige Engineering-Tasks, positioniert als Antwort auf Claude Code. Alle veröffentlichten Agent-Scores (Terminal Bench 2.0, Toolathlon) wurden im noch nicht öffentlichen „minimal mode" bei max effort, top_p 0,95, temperature 1,0 gemessen. DeepSeek warnt selbst: Agent-Scores sind „extrem sensitiv gegenüber der Harness-Wahl" — keine pauschale Portierung auf Claude Code oder Cursor.
05 · Wettbewerbsmatrix: V4-Flash vs. Kimi K3 vs. Qwen3.8-Max
| Modell | Labor | Release | Gesamt | AA Intelligence Index | $/Task (AA) |
|---|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 31.7. offiziell | 284B | 50 | $0,03 |
| Kimi K3 | Moonshot | 16.7. Preview / 27.7. Weights | 2,8T | 57 | $0,86 |
| GLM-5.2 | Zhipu / Z.ai | Juni 2026 | ~744B | ~1 Pkt. über Flash | n. v. |
| Qwen3.8-Max | Alibaba | 2.8. GA | 2,4T | n. v. | n. v. |
| GPT-5.6 Sol | OpenAI | Closed | — | 9+ Pkt. über Flash | $1,86 |
| Claude Fable 5 | Anthropic | Closed | — | 9+ Pkt. über Flash | $3,15 |
Die Spannung: Auf dem unabhängigen Artificial-Analysis-Index liegt V4-Flash nicht an der Spitze — hinter Kimi K3 und GLM-5.2. Die Kosten pro Task sind jedoch etwa 1/29 von Kimi K3, 1/62 von GPT-5.6 Sol und 1/105 von Claude Fable 5. DeepSeek konkurriert nicht um Rang eins, sondern um „ausreichend intelligent zum Mindestpreis" — passend zur siebenwöchigen OpenRouter-Spitzenposition der Preview-Version.
06 · Vorbehalte: Benchmarks, Usability und unbestätigte Termine
- Harness-abhängige Agent-Scores: Terminal Bench 2.0 (82,7) mit unreleased Harness minimal mode — bis Dritte mit Claude Code oder Cursor reproduzieren, als „Vendor plus Framework" behandeln.
- Praxis-Feedback: Niedrige Cache-Hit-Rate und Safety-Classifier-Timeouts laut 21st Century Business Herald — Compute-Budget begrenzt, was Post-Training allein heilen kann.
- V4-Pro und Harness ohne Datum: Medien nennen 10.–20. August; offizieller Changelog nur „so bald wie möglich".
- Finanzierungsgerüchte: Berichte über ~7,4 Mrd. $ Runde (Tencent, NetEase) und ~71 Mrd. $ Bewertung — anonyme Quellen, keine regulatorische Bestätigung.
07 · Kill Line, Community-Stimmung und Chip-Markt
Vor dem 31. Juli verspottete die chinesische AI-Community Gründer Liang Wenfeng als „Liang Baikai" (leeres Versprechen), weil V4-Pro den Juli-Termin verpasste. Nach dem Flash-Release kehrte der Spitzname „Liang Sheng" zurück — ein schneller Stimmungsbarometer.
Substanzieller ist der Begriff „斩杀线" (Kill Line): DeepSeeks Kombination aus „gut genug" plus Extrempreis setzt eine Marktschwelle. Konkurrenten ohne klaren Qualitäts- oder Preisvorteil verlieren Relevanz — erklärt parallele Preissenkungen wie GPT-5.6 Luna -80 %. Ein Branchenkontakt zu 21st Century Business Herald: „Jedes große Modellunternehmen muss vor Liang Wenfeng laufen, um zu überleben."
Am Release-Tag (31. Juli) reagierten Nvidia, Broadcom und AMD kaum — im Gegensatz zum Chip-Selloff nach DeepSeek-R1 Anfang 2025. Der Markt behandelt „mehr mit weniger Compute" inzwischen als Normalzustand chinesischer Engineering-Effizienz.
08 · Fünf Mac-Validierungsschritte (DSGVO-sensible Agent-Tests)
- DeepSeek-API-Key in isolierter Umgebung anlegen; Legacy-Alias
deepseek-chataufdeepseek-v4-flashmigrieren — Audit-Log der Model-Strings für Compliance dokumentieren - Baseline-Tasks (SWE-Fix, Terminal-Bench-Subset, Langkontext-Summary) einmal mit V4-Flash-0731 und einmal mit V4-Pro-Preview fahren — Latenz, Cache-Hit-Rate und $/Task protokollieren
- Gleiche Aufgabe parallel gegen Kimi K3 API und Qwen3.8-Max; Artificial-Analysis-$/Task mit eigener Rechnung abgleichen
- Agent-Harness extern testen: Claude Code oder OpenClaw mit DeepSeek-Endpunkt — nicht nur Hersteller-Harness-Scores als Entscheidungsgrundlage
- Entscheidungsmatrix mit Team erstellen; Re-Test-Termin setzen, sobald V4-Pro GA oder Harness öffentlich wird — bis dahin keine produktionskritische Vollmigration
09 · FAQ
F1: Ist DeepSeek V4 Open Source?
A: Ja. V4-Pro und V4-Flash inkl. 0731-Build liegen unter MIT auf Hugging Face — kommerzielle Nutzung, Fine-Tuning und Weiterverteilung erlaubt.
F2: Wie viel günstiger ist V4-Flash als Claude Opus 4.8?
A: Laut 21st Century Business Herald: Cache-Miss-Input ~36×, Cache-Hit ~179×, Output ~89× pro Million Token — Listenpreise, nicht unabhängig geprüft.
F3: Wann kommt V4-Pro offiziell?
A: Kein bestätigtes Datum. Gerüchte 10.–20. August sind nicht von DeepSeek bestätigt.
F4: DeepSeek-Benchmarks vertrauen?
A: SWE-bench Verified und etablierte Dritt-Benchmarks haben mehr Gewicht. Agent-Scores (Terminal Bench 2.0) sind Harness-abhängig — auf unabhängige Reproduktion warten.
F5: Was ist DeepSeek Harness?
A: Erstes eigenes Agent-Ausführungsframework (Dateien, Tools, Engineering-Tasks) — Alternative zu Claude Code. Im Changelog vom 31. Juli erstmals genannt, noch nicht öffentlich.
10 · Mac-Miete: DeepSeek-Agent-Pipelines ohne Daily-Driver-Risiko
Die V4-Flash-API senkt Token-Kosten drastisch, doch auf dem Haupt-Entwicklungsrechner bleiben Risiken: API-Keys in globaler Shell, ungecachte Million-Token-Läufe mit unplanbaren Rechnungen, Konflikte zwischen Claude Code und OpenClaw, und für EU-Teams die Frage, wo Prompt-Daten physisch verarbeitet werden. Windows- und Linux-Hosts erreichen die API, validieren aber selten macOS-native Keychain-, Xcode- und TCC-Szenarien vollständig.
Kurzfristige API-Tests auf dem Laptop sind sinnvoll für Preisvergleiche; wer reproduzierbare Agent-Umgebungen, auditierbare Isolation und stabile Apple-Ökosystem-Kompatibilität will, profitiert von einem dedizierten Apple-Silicon-Mac. Tagesmiete statt CapEx passt zum Rhythmus „0731 beobachten → Harness abwarten → zerstören". Tarife: Bare-Metal-macOS-Preise.
Cloud-API reicht für die erste Selektion; für DSGVO-sensible Agent-Pipelines mit destroy-after-test und parallelen Harness-Vergleichen ist ein gemieteter Mac mini M4 oft die bessere Ökonomie — besonders wenn V4-Pro GA mehrere Toolchains gleichzeitig erfordert.
11 · Quellen
- DeepSeek offizielle API-Dokumentation und Changelog (api-docs.deepseek.com)
- Technical Report „DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence" und Hugging-Face-Model Cards
- Artificial Analysis (Intelligence Index, $/Task), zitiert über Wantrich Financial und Meyka
- 21st Century Business Herald — Usability-Feedback und Preisvergleich Claude Opus 4.8
- Kuai Technology / ifeng Tech, V2EX-Diskussion, 36Kr EU, HTX Insights
- Offizielle Ankündigungen Moonshot AI (Kimi K3), Zhipu/Z.ai (GLM-5.2), Alibaba Cloud (Qwen3.8-Max)
Vor Produktionsentscheidungen Preise, Benchmarks und V4-Pro/Harness-Status erneut prüfen — alle Angaben Stand 5. August 2026.