DeepSeek V4 sortie GA : tarifs peak-valley, architecture 1,6T et lecture face à GPT-5.6
Qui est concerné ? Les équipes qui codent sur Mac avec deepseek-chat ou reasoner doivent absorber la GA du 20 juillet et la coupure API du 24, sans maîtriser encore les tarifs peak-valley ni le choix Pro/Flash. Ce guide apporte : chronologie, déconstruction architecturale, tableaux de benchmarks, grille tarifaire, migration en six étapes et matrice de décision. Structure : friction×3, specs CSA/HCA, comparatif GPT-5.6/Fable 5, FAQ×6.
Sommaire
Pour approfondir : analyse GPT-5.6 Sol ; inférence locale : V4-Flash sur Mac ; contexte tarifaire : puce IA DeepSeek.
Trois mois après la preview d'avril, DeepSeek V4 franchit le cap de la version GA le 20 juillet 2026. Ce n'est pas une simple montée de version : c'est l'entrée dans une ère de tarification structurée, avec des tarifs peak-valley calqués sur l'électricité, et une fenêtre de migration API d'à peine quatre jours. Pour les studios créatifs et les équipes produit qui ont bâti leurs agents sur deepseek-chat, l'enjeu est double — préserver la qualité de code tout en maîtrisant une facture qui peut doubler aux heures de pointe.
01 · Trois points de friction : la GA n'efface pas la dette technique
- Échéance du 24 juillet. Les identifiants
deepseek-chatetdeepseek-reasonerdisparaissent le 24 juillet à 23:59 (heure de Pékin). Tout service encore codé en dur sur ces noms s'arrête net — pas de bascule progressive. - Angle mort sur la facture peak-valley. Les créneaux 09:00–12:00 et 14:00–18:00 (lun–ven, Pékin) doublent les tarifs. Un agent de revue documentaire lancé en pleine journée peut gonfler la note mensuelle sans que l'équipe finance n'ait été prévenue.
- Pro vs Flash : le mauvais routage coûte cher. Migrer tout vers Pro augmente la facture ; tout basculer sur Flash dégrade le SWE-bench. Think Max exige ≥384K de contexte — un choix binaire est rarement le bon.
02 · Chronologie : de la preview à la version pleine
| Date | Événement |
|---|---|
| 24 avr. 2026 | Preview V4 + open source MIT : V4-Pro 1,6T, V4-Flash 284B |
| Mai 2026 | Versions tuning production, API généralisée |
| Juin 2026 | Baisse permanente V4-Pro output −75 % → $0,87/M |
| 29 juin 2026 | E-mail API : GA mi-juillet, schéma peak-valley dévoilé |
| 19 juil. 2026 | Accès gris GA pour développeurs sélectionnés |
| 20 juil. 2026 | Sortie GA (date de publication) |
| 24 juil. 2026 | deepseek-chat / deepseek-reasoner hors ligne définitif |
03 · Architecture : le duo V4-Pro / V4-Flash
3.1 Fiche technique
| Spécification | V4-Pro | V4-Flash |
|---|---|---|
| Paramètres totaux | 1,6 billion (1,6T) | 284 milliards (284B) |
| Paramètres actifs/token | 49B | 13B |
| Couches Transformer | 61 | 43 |
| Fenêtre de contexte | 1 000 000 tokens | 1 000 000 tokens |
| Output max | 384K tokens | 384K tokens |
| Précision | FP4 (experts) + FP8 | FP4 + FP8 mixte |
| Licence | MIT | MIT |
3.2 CSA + HCA : repenser l'attention longue
DeepSeek V4 abandonne le MLA des versions V2/V3 au profit d'un couple Compressed Sparse Attention (CSA) et Heavily Compressed Attention (HCA). Le CSA compresse le KV 4×, sélectionne top-k via un indexeur FP4, et conserve une fenêtre glissante de 128 tokens. Le HCA compresse 128× pour capturer les dépendances globales.
Chiffre clé #1 : à 1M de contexte, V4 n'utilise que 27 % des FLOPs de V3.2 ; la mémoire KV tombe à 10 % (Flash : 7 %).
3.3 mHC et optimiseur Muon
Les Manifold-Constrained Hyper-Connections stabilisent 61 couches via quatre flux résiduels contraints au polytope de Birkhoff. L'entraînement repose sur l'optimiseur Muon (orthogonalisation Newton-Schulz), plus stable qu'AdamW sur ces profondeurs.
3.4 Modes d'inférence
| Mode | Caractéristique | Usage |
|---|---|---|
| Non-think | Sans chaîne de pensée, latence minimale | Q&R, routage |
| Think High | Raisonnement explicite | Debug code, tâches moyennes |
| Think Max | Raisonnement maximal, ≥384K contexte | Mathématiques, agents longue chaîne |
04 · Benchmarks : le palmarès open source
| Benchmark | V4-Pro | Claude Fable 5 | GPT-5.6 Ultra |
|---|---|---|---|
| SWE-bench Verified | 80,6 % ★ record OSS | 96,0 % | n/d |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % |
| LiveCodeBench Pass@1 | 93,5 % | 88,1 % | 87,4 % |
| Codeforces Elo | 3 206 | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % |
Chiffre clé #2 (Artificial Analysis) : Fable 5 3,48 $/tâche (score 50) ; V4-Pro 0,03 $/tâche (score 38). Rapport de coût ×116 pour ~31 % d'écart de score.
05 · Face à GPT-5.6 Sol et Claude Fable 5
| Dimension | V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open source | ✅ MIT | ❌ | ❌ |
| Auto-hébergement | ✅ | ❌ | ❌ |
| Contexte | 1M tokens | non publié | 1M tokens |
| Output (hors peak) | 0,87 $/M | ~15 $/M | 50 $/M |
| Souveraineté des données | ✅ on-premise | ❌ | ❌ |
5.1 Matrice de scénarios
| Scénario | Recommandation | Raison |
|---|---|---|
| Budget serré / volume / souveraineté | V4-Pro / V4-Flash | 0,87 $/M ou 0,28 $/M output, licence MIT |
| Code maximal, coût secondaire | Claude Fable 5 | SWE-bench Pro 80,3 % |
| Algorithmes & mathématiques | GPT-5.6 Sol/Ultra | Terminal-Bench 85,1 % |
| Documents massifs (coût minimal) | V4-Flash | Input cache-hit 0,0028 $/M |
06 · Tarifs peak-valley : lire la facture comme un créneau électrique
| Modèle | Poste | Hors peak | Peak |
|---|---|---|---|
| V4-Pro | Input (cache-hit) | 0,0035 $/M | ×2 |
| Input (cache-miss) | 0,435 $/M | 0,87 $/M | |
| Output | 0,87 $/M | 1,74 $/M | |
| V4-Flash | Input (cache-hit) | 0,0028 $/M | ×2 |
| Input (cache-miss) | 0,14 $/M | 0,28 $/M | |
| Output | 0,28 $/M | 0,56 $/M |
Créneaux peak (heure de Pékin) : semaine 09:00–12:00 et 14:00–18:00.
Chiffre clé #3 : même en peak, V4-Pro output (1,74 $/M) reste 8,6× moins cher qu'Opus 4.8 (15 $/M).
07 · Migration API avant le 24 juillet ⚠️
Alerte : deepseek-chat et deepseek-reasoner cessent le 24 juillet 2026 à 15:59 UTC (23:59 Pékin). Toute production non migrée s'interrompt.
7.1 Table de correspondance
| Ancien | Nouveau | Note |
|---|---|---|
deepseek-chat | deepseek-v4-flash (non-think) | Tâches légères |
deepseek-reasoner | deepseek-v4-flash (think) ou deepseek-v4-pro | Pro pour raisonnement avancé |
7.2 Checklist migration en six étapes
- Rechercher globalement
deepseek-chatetdeepseek-reasoner(CI/CD, variables d'environnement) - Remplacer les IDs selon la table de correspondance
- Activer le mode think :
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}} - Think Max : vérifier contexte ≥384K tokens
- Régression staging : comparer qualité et latence avant/après
- Bascule production avant le 24 juil., surveiller la facture peak-valley la première semaine
08 · Synthèse
DeepSeek V4 GA marque la maturité d'un modèle open source capable de rivaliser sur le code à une fraction du coût des frontières fermées. Les tarifs peak-valley ajoutent de la complexité, mais le rapport performance/prix reste exceptionnel pour les équipes soucieuses de souveraineté des données et de contexte million-token.
09 · FAQ
Q : GA vs preview ?
R : Agents, maths et code améliorés ; tarification peak-valley ; architecture inchangée.
Q : Fin de deepseek-chat ?
R : 24 juillet 2026, 23:59 heure de Pékin.
Q : Heures peak ?
R : Semaine 09:00–12:00 et 14:00–18:00 Pékin, tarifs doublés.
Q : V4-Pro vs Fable 5 ?
R : Fable mène SWE-bench ; V4-Pro record OSS à 1/116 du coût.
Q : Pro ou Flash ?
R : Pro pour qualité, Flash pour volume.
Q : Déploiement Mac ?
R : Voir guide inférence locale.
10 · Location Mac isolée : valider la migration V4 sans polluer votre poste
Remplacer deepseek-chat directement sur le MacBook principal expose vos projets créatifs à des risques concrets : configurations shell obsolètes, expériences Think Mode qui polluent le cache local, et impossibilité de tester le routage multi-modèles (Claude, GPT) en isolation. Un nœud Apple Silicon loué à la journée offre un bac à sable jetable après validation : cloner le dépôt, configurer la clé DeepSeek, comparer flash vs pro sur la facture peak-valley, puis détruire le nœud.
L'API se teste depuis n'importe quel OS, mais la chaîne macOS native — Keychain, outils Xcode, sidecars — ne se reproduit pas sur Windows ou Linux. Si vous visez une acceptation reproductible avant le 24 juillet, un Mac isolé reste l'option la plus propre ; la location journalière évite l'investissement matériel. Tarifs : bare-metal macOS.
11 · Sources
- Documentation API : api-docs.deepseek.com
- arXiv : 2606.19348
- Hugging Face : deepseek-ai
- Artificial Analysis : artificialanalysis.ai
Données au 20 juillet 2026. Benchmarks et tarifs susceptibles d'évoluer — se référer à la documentation officielle.