DeepSeek V4 0731 officiel 2026-08-05

DeepSeek V4-Flash-0731 officiel : même 284B, nouveau post-entraînement, une fraction du prix d'Opus 4.8

Pour qui ? Développeurs et studios créatifs sur Mac qui pilotent des agents (Claude Code, OpenClaw, pipelines VFX/jeu) via l'API DeepSeek et doivent distinguer « version officielle » de « nouveau modèle ». Contenu : chronologie avril–août, tableaux tarifs et benchmarks, architecture CSA/HCA, comparaison Kimi K3·Qwen3.8·Claude, controverses Harness, impact industrie. Structure : frictions×3 · cadres dorés · 5 étapes Mac isolé · FAQ×5 · CTA location.

DeepSeek V4-Flash-0731 officiel 284B benchmarks agents prix Claude Opus 4.8 2026

Contexte V4 GA : DeepSeek V4 sortie GA & tarifs peak-valley · Kimi K3 : Kimi K3 open weight · Qwen3.8-Max : Qwen3.8-Max GA · guerre des prix : baisse GPT-5.6 Luna -80 %.

Le 31 juillet 2026, DeepSeek a promu V4-Flash-0731 en version officielle API (tag de build 0731). Les paramètres restent ceux d'avril : 284B total / 13B actifs — ce n'est pas un nouveau modèle, mais un post-entraînement entièrement refait. Sur les benchmarks Agent, il dépasse la preview V4-Pro (67,9) avec 82,7 sur Terminal Bench 2.0, pour un coût par token qui représente une fraction de Claude Opus 4.8 (environ ×36 en entrée cache miss, ×179 en cache hit, ×89 en sortie selon les tarifs cités par la presse économique chinoise). Le flagship V4-Pro officiel et le framework Agent maison Harness restent « bientôt » — et cette mise à jour est API uniquement : l'app et le chat web n'ont pas suivi.

01 · Trois frictions décisionnelles : « officiel » ne veut pas dire « nouveau modèle »

  1. Écart marketing / livrable : les titres « DeepSeek V4 version officielle » laissent croire à l'arrivée du Pro 1,6T. En réalité, seul Flash est passé en GA le 31 juillet. V4-Pro officiel et Harness n'ont qu'une mention dans le changelog, sans date. Quand la promesse d'un GA Pro mi-juillet a glissé, la communauté chinoise a surnommé le fondateur Liang Wenfeng « Liang Baikai » (promesses vides) — avant de rebasculer vers « Liang Sheng » (le sage) quand Flash a dépassé les attentes. Pour un studio de post-prod ou une équipe jeu, confondre Flash et Pro fausse les budgets GPU et les SLA agents.
  2. Benchmarks vs ressenti terrain : le 82,7 de Terminal Bench 2.0 est mesuré avec Harness minimal mode (non publié), max reasoning, top_p 0,95, temperature 1,0. Le changelog DeepSeek prévient que les scores Agent sont « extrêmement sensibles au choix du harness ». Des retours développeurs outre-mer (cités par 21st Century Business Herald) signalent un faible taux de cache hit en entrée et des timeouts sporadiques du classificateur de sécurité — le contraste entre « score en hausse » et instabilité opérationnelle est réel.
  3. Pollution de l'environnement API sur Mac de prod : Kimi K3 (27/07), Qwen3.8-Max (02/08) et la baisse GPT-5.6 Luna (-80 % le 30/07) s'empilent sur le même Mac de lead dev. Les alias deepseek-chat et deepseek-reasoner ont été retirés le 24 juillet ; rater la bascule vers deepseek-v4-flash fait échouer silencieusement les pipelines. Changer la chaîne Agent sur la machine principale expose clés API, caches à 1M tokens et configs Cursor irréversibles.

02 · Chronologie : de la preview d'avril à l'officiel Flash de juillet

  • 24 avril 2026 : lancement preview DeepSeek-V4, poids ouverts MIT — V4-Pro (1,6T / 49B actifs) et V4-Flash (284B / 13B), contexte 1M tokens.
  • 24 juillet 2026 : retrait définitif de deepseek-chat et deepseek-reasoner ; tout le trafic bascule vers la famille V4.
  • 27 juillet 2026 : Moonshot AI publie les poids Kimi K3 (2,8T) sur Hugging Face — pression concurrentielle maximale à quelques jours de l'update Flash.
  • 31 juillet 2026 : V4-Flash-0731 en bêta API officielle, poids synchronisés Hugging Face ; première mention officielle de DeepSeek Harness (« à paraître bientôt »). API seulement — app et web inchangés.
  • 2 août 2026 : Qwen3.8-Max passe en GA API — la fenêtre des LLM chinois ouverts se resserre encore.
  • 5 août 2026 (rédaction) : V4-Pro officiel toujours « dès que possible ». Les médias chinois évoquent des tests internes fin juillet et une fenêtre GA 10–20 août — rumeur non confirmée par DeepSeek.

03 · Données clés en un coup d'œil

Modèle Statut Total / actifs Contexte Entrée (miss/hit, $/M) Sortie ($/M) Licence
V4-Flash-0731Officiel (31/07)284B / 13B1M$0,14 / $0,0028$0,28MIT
V4-ProPreview (24/04)1,6T / 49B1M$0,435 / $0,003625$0,87MIT
Kimi K3Poids (27/07)2,8T / ~104B (est.)~1,05M$3,00 / $0,30$15,00Kimi K3 License
GLM-5.2Ouvert (juin)~744B / ~40B1Mnon vérifié icinon vérifiéMIT
Qwen3.8-MaxAPI GA (02/08)2,4T / 95B1M$2,00 / ~$0,17–0,25$6,00open promis (poids en attente)

Tarifs : données publiques DeepSeek, Moonshot, Alibaba (auto-déclarées). DeepSeek a annoncé une majoration ×2 en heures de pointe (9h–12h et 14h–18h heure de Pékin), sans date d'effet confirmée au 5 août.

Trois chiffres à retenir

  • 82,7 vs 67,9 — Terminal Bench 2.0 : V4-Flash-0731 bat la preview V4-Pro (mesure vendor + Harness minimal mode).
  • $0,03 / tâche — coût moyen par tâche selon l'indice Artificial Analysis ; Kimi K3 à $0,86, Claude Fable 5 à $3,15.
  • 27 % / 10 % — métriques officielles V4-Pro à 1M tokens vs V3.2 (FLOPs par token et empreinte KV Cache) ; reproduction tierce encore limitée.

04 · Architecture & post-entraînement : « mieux entraîné », pas « plus gros »

4.1 Structure inchangée, post-entraînement neuf

Point central souvent ignoré : V4-Flash-0731 est identique en taille et en structure à la preview d'avril. DeepSeek attribue l'intégralité du gain Agent au post-entraînement relancé, pas à un scale-up. Un modèle 284B/13B qui dépasse un 1,6T/49B de la même famille confirme la tendance 2026 : la qualité des données et des méthodes de post-entraînement rivalise avec le simple empilement de paramètres — pertinent pour les pipelines créatifs où l'on enchaîne génération de scripts, revue de storyboards et refactoring de plugins Unreal/Blender sans budget illimité.

4.2 CSA+HCA, mHC, optimiseur Muon : le million de tokens à coût utilisable

Le rapport technique DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence décrit trois leviers architecturaux :

  • Attention hybride (CSA + HCA) : attention sparse compressée + attention fortement compressée, commercialisée sous DSA (DeepSeek Sparse Attention) — réduction compute et VRAM en long contexte.
  • mHC (Manifold-Constrained Hyper-Connections) : amélioration des connexions résiduelles classiques.
  • Optimiseur Muon : convergence et stabilité d'entraînement accrues.

Chiffres officiels : à 1M tokens, V4-Pro n'exigerait que 27 % des FLOPs par token et 10 % du KV Cache de V3.2. Si ces ordres de grandeur tiennent, le contexte million-token passe du slogan marketing à une structure de coût viable — utile pour ingérer un dépôt Xcode entier, une bible de production ou des logs de render farm en une passe.

4.3 Harness : réponse maison à Claude Code, encore fermé

Le changelog du 31 juillet nomme pour la première fois DeepSeek Harness : framework d'exécution Agent (lecture/écriture fichiers, appels d'outils, commandes shell, tâches d'ingénierie multi-étapes). Jusqu'ici, les équipes DeepSeek s'appuyaient sur Claude Code, OpenCode et outils tiers. Tous les benchmarks Agent publiés (Terminal Bench 2.0, Toolathlon, etc.) utilisent le mode minimal de Harness, non encore public. Le message officiel est clair : ne pas assimiler ces scores à la capacité brute du modèle dans votre harness habituel.

05 · Comparaison : guerre hexagonale des LLM chinois et ligne de prix globale

Modèle Labo Sortie / poids Params totaux AA Intelligence Index Coût/tâche (AA)
V4-Flash-0731DeepSeek31/07 officiel284B50$0,03
Kimi K3Moonshot16/07 · 27/072,8T57$0,86
GLM-5.2Z.aijuin~744B~+1 pt vs Flashnon vérifié
Qwen3.8-MaxAlibaba02/08 GA2,4Tnon vérifiénon vérifié
GPT-5.6 SolOpenAIferméND+9 pts vs Flash$1,86
Claude Fable 5AnthropicferméND+9 pts vs Flash$3,15

Indice et coût/tâche : Artificial Analysis (tiers), reprise par médias financiers. Benchmarks Agent DeepSeek : mesure vendor + Harness — méthodologies distinctes, non fusionnées ici.

Position paradoxale : sur l'indice indépendant, V4-Flash trail Kimi K3 et GLM-5.2 en « intelligence », mais le coût par tâche est environ 1/29 de Kimi, 1/62 de GPT-5.6 Sol, 1/105 de Claude Fable 5. DeepSeek ne vise pas le sommet du leaderboard : intelligence suffisante + prix imbattable — logique qui a tenu la preview Flash en tête du classement OpenRouter pendant sept semaines consécutives. Pour un studio qui batch-descriptions d'assets, QA de localisation ou agents de build nocturne, c'est souvent le bon compromis.

06 · Controverses : des scores flatteurs, des réserves légitimes

  • Benchmarks dépendants de Harness : le 82,7 de Terminal Bench 2.0 repose sur un framework non public. En attendant reproduction avec Claude Code, Cursor ou OpenClaw, classer en « vendor + harness spécifique ».
  • Problèmes d'usage réel : retours développeurs — faible cache hit, timeouts du classificateur de sécurité. Le narratif « score en explosion » coexiste avec une instabilité opérationnelle.
  • Calendrier V4-Pro / Harness non confirmé : fenêtre 10–20 août = rumeurs médias chinois. Le changelog officiel dit seulement « dès que possible ».
  • Rumeurs financement / IPO : tour ~7,4 Md$ (Tencent, NetEase), valorisation ~48,7 Md$, ronde suivante visant ~71 Md$ — sources anonymes, pas de dépôt réglementaire ni communiqué DeepSeek. Contexte uniquement.

07 · Impact industrie : la « ligne de coupe » et la désensibilisation des puces

Dans les forums développeurs chinois circule le terme 斩杀线 (zhǎn shā xiàn) — « ligne de coupe » : la combinaison DeepSeek « performance suffisante + prix plancher » fixe un seuil de marché. Si un concurrent ne dépasse pas clairement Flash en capacité et ne peut pas baisser davantage les prix, il risque l'invisibilité — d'où la baisse de 80 % sur GPT-5.6 Luna à la même période. Citation d'un incubateur IA rapportée par 21st Century Business Herald : « Toutes les grandes entreprises de modèles courent devant Liang Wenfeng — quelle que soit la méthode, il faut rester devant DeepSeek pour survivre. »

Le 31 juillet, Nvidia, Broadcom et AMD n'ont pas chuté de façon marquée — contraste frappant avec le sell-off des actions IA de début 2025 après DeepSeek-R1. Le marché semble intégrer « DeepSeek fait plus avec moins » comme récit d'ingénierie structurel, pas comme signal automatiquement baissier pour la demande de compute.

Prix vs Claude Opus 4.8 (tarifs cités, auto-déclarés)

  • Entrée cache miss : Flash environ ×36 moins cher
  • Entrée cache hit : environ ×179 moins cher
  • Sortie : environ ×89 moins cher — l'arme de Flash est le $/token, pas le plafond d'intelligence absolu

08 · 5 étapes Mac isolé : valider V4-Flash-0731 avant la prod

  1. Exécuter trois tâches de référence via deepseek-v4-flash (résumé long, correctif mono-fichier, refactor multi-fichiers) ; vérifier l'absence d'appels deepseek-chat depuis le 24 juillet
  2. Sur Mac isolé : OPENAI_BASE_URL=https://api.deepseek.com + clé API uniquement — ne pas stocker la clé dans le shell global ou Keychain du Mac principal
  3. Paralléliser les mêmes prompts sur Kimi K3 et Qwen3.8-Max ; noter $/tâche, latence et taux de succès
  4. Documenter l'écart entre benchmarks Harness minimal mode et mesures Claude Code / OpenClaw — ne pas inscrire le 82,7 dans un SLA interne
  5. Après validation : détruire l'environnement isolé ; mettre à jour la doc d'équipe avec la checklist tarifs peak et bascule Pro
# Endpoint compatible OpenAI (Mac isolé) export OPENAI_BASE_URL="https://api.deepseek.com" export OPENAI_API_KEY="votre-cle-deepseek" curl https://api.deepseek.com/chat/completions \ -H "Authorization: Bearer $OPENAI_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"Résumez la sortie V4-Flash-0731."}]}'

09 · FAQ

Q1 : Principale différence V4 vs V3.2 ?
A : Contexte 1M tokens natif, coûts long contexte fortement réduits (27 % FLOPs, 10 % KV Cache selon données V4-Pro). Optimisation Agent et compatibilité Claude Code, OpenCode.

Q2 : Flash ou Pro au quotidien ?
A : Dialogue, tâches simples, appels massifs, pipelines Agent → V4-Flash-0731. Raisonnement profond et budget large → preview V4-Pro, puis réévaluation à la sortie officielle.

Q3 : V4 Pro officiel disponible maintenant ?
A : Non au 5 août 2026. GA Flash API uniquement ; app/web non à jour. Pro et Harness : « bientôt » ; 10–20 août = non confirmé.

Q4 : Faire confiance aux benchmarks DeepSeek ?
A : SWE-bench Verified et benchmarks tiers transparents : relativement oui. Terminal Bench 2.0 et scores Agent : dépendants de Harness — reproduire avec d'autres outils avant conclusion.

Q5 : Impact concret pour un développeur ?
A : API OpenAI/Anthropic : deepseek-v4-flash pointe automatiquement vers la nouvelle version. Migrer immédiatement si vous utilisiez deepseek-chat ou deepseek-reasoner.

10 · Louer un Mac pour valider : protéger la machine de prod avant Harness

V4-Flash-0731 affiche des tarifs agressifs, mais basculer Claude Code, OpenClaw et les endpoints DeepSeek sur le Mac de lead dev expose à des risques concrets : clés API empilées dans ~/.zshrc, Keychain et configs IDE ; expériences à 1M tokens qui saturent cache et disque de façon difficile à annuler ; écart probable entre benchmarks Harness et votre harness réel tant que Harness n'est pas public.

Depuis Windows ou Linux, l'appel API est trivial — mais valider Xcode, Keychain, quantification locale des poids MIT Flash et workflows Agent macOS natifs exige un environnement Apple Silicon propre. Pour un studio créatif qui compare Flash, Kimi K3 et Qwen3.8 sur les mêmes scripts de pipeline (build nocturne, revue de shots, génération de variantes), un Mac isolé facturé à la journée offre une conclusion reproductible sans acheter du hardware dédié.

macOS propre · SSH distant · facturation journalière : MacDate permet de terminer la chaîne Agent V4-Flash en bas coût, puis de détruire le nœud pour éviter fuite de clés et pollution de config. Tarifs : compute série M.

11 · Sources

  • Documentation API et changelog DeepSeek (api-docs.deepseek.com)
  • Rapport technique DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence et fiches Hugging Face
  • Benchmarks Artificial Analysis (reprise médias financiers)
  • 21st Century Business Herald, Kuai Technology / ifeng, fil V2EX
  • Annonces officielles Moonshot (Kimi K3), Z.ai (GLM-5.2), Alibaba Cloud (Qwen3.8-Max)

Vérifier tarifs, benchmarks et statut V4-Pro/Harness avant publication. Données au 5 août 2026.