Cinq jours pour inverser le récit : DeepSeek hausse, Qwen s'ouvre, GLM-5.3 accélère
Qui est pris au piège ? Les équipes qui font passer leurs agents par DeepSeek, Qwen ou GLM reçoivent trois nouvelles qui se contredisent : une hausse à quatre chiffres, un checkpoint à 2,4 billions de paramètres, un saut de code sur la même base. Ce que vous emportez : la grille officielle, les seuils de licence, et pourquoi « modèle chinois = modèle le moins cher » ne tient plus. Parcours : le récit de la semaine, trois pièges de lecture, les trois laboratoires, une matrice de prix, ce qui reste non vérifié, cinq gestes sur un Mac isolé, cinq questions.
Sommaire
Pour la GA du 3 août : Qwen3.8-Max expliqué. Pour Flash : DeepSeek V4 Flash, benchmarks et prix. Pour la baisse américaine : GPT-5.6 Luna, baisse de prix.
01 · Une semaine qui a inversé le récit
Il y a des semaines où le marché parle plus fort que les communiqués. Celle du 12 au 17 août 2026 en est une. Le 12, Alibaba dépose sur Hugging Face et ModelScope un checkpoint Max qu'il n'avait jamais ouvert — Qwen3.8-2.4T-A95B — tandis que xAI livre Grok 4.6. Le 13, DeepSeek-V4-Pro passe en GA et annonce une hausse effective le 17 ; Google, le même jour, solde Gemini 3.7 Flash. Le 14, Zhipu envoie GLM-5.3 sans changer la base de 743 milliards. À minuit, heure de Pékin, le 17 août, la nouvelle grille DeepSeek s'applique.
Cinq jours, trois laboratoires, trois gestes qui semblent se contredire : l'un renchérit, l'autre ouvre, le troisième n'entraîne plus le socle et double presque six fois un benchmark d'agents. Ensemble, ils disent autre chose que « la Chine vend encore moins cher ». Ils disent que le levier a changé de place : de la guerre du prix seul à la guerre du pouvoir de tarifer.
02 · Trois pièges de lecture
- Le « 1 100 % » n'est pas la facture. C'est la ligne d'entrée en cache-hit aux heures de pointe — celle qui partait le plus près de zéro. La sortie, qui pèse sur la plupart des vrais comptes, a augmenté de 350 %.
- Poids ouverts n'égale pas Apache 2.0. Qwen3.8-Max se télécharge, mais un métier Model-as-a-Service ou AI Work Assistant au-delà de 50 millions de dollars sur 12 mois exige une licence commerciale séparée. Au-delà de 100 millions de MAU ou 20 millions de dollars de revenu mensuel, le nom du modèle doit s'afficher.
- « Modèle chinois = moins cher » n'est plus une boussole. Le V4-Pro hors pointe reste sous Claude Opus 5 ; Qwen3.8-Max international et GPT-5.6 Luna battent désormais DeepSeek sur au moins une dimension.
03 · Ce que le calendrier raconte
Reculer d'un mois change la lumière. Le 16 juillet, Moonshot ouvre Kimi K3 (2,8T) et attire l'attention des services de sécurité américains. Le 30 juillet, OpenAI coupe Luna de 80 %. Les 2 et 3 août, Alibaba prévisualise puis héberge Qwen3.8-Max. Les 6 et 7 août, Luna devient le défaut gratuit, texte illimité. Le 10 août, Meta sort Muse Glimmer (30B, Apache 2.0) et promet les poids de Muse Spark 1.2. Puis vient la semaine du 12.
| Date | Événement |
|---|---|
| 16 juillet 2026 | Moonshot ouvre Kimi K3 (2,8T), examen de sécurité aux États-Unis |
| 30 juillet 2026 | OpenAI baisse GPT-5.6 Luna de 80 % |
| 2–3 août 2026 | Alibaba prévisualise puis lance Qwen3.8-Max en API hébergée |
| 6–7 août 2026 | Luna devient le défaut gratuit, texte illimité |
| 10 août 2026 | Meta publie Muse Glimmer (30B, Apache 2.0) et tease les poids de Muse Spark 1.2 |
| 12 août 2026 | Alibaba publie Qwen3.8-2.4T-A95B sur Hugging Face / ModelScope ; xAI livre Grok 4.6 |
| 13 août 2026 | DeepSeek-V4-Pro en GA, hausse au 17 août ; Google solde Gemini 3.7 Flash |
| 14 août 2026 | Zhipu livre GLM-5.3, même base 743B que GLM-5.2 |
| 17 août 2026, 00:00 Pékin | Nouvelle grille DeepSeek en vigueur |
04 · DeepSeek : offrir le temps, vendre la pointe
La lecture facile serait : « le modèle chinois le moins cher a cédé à la marge ». La structure dit autre chose. Un tarif plat et toujours bas servait d'acquisition tant que les GPU suivaient. Quand l'usage a crû plus vite que la capacité, il a fallu rendre visible la rareté. « Encourager une planification plus souple » est le langage d'entreprise pour : le compute de pointe manque, déplacez vous-mêmes la charge.
Heures de pointe officielles : 9 h–12 h et 14 h–18 h, heure de Pékin. Une modélisation indépendante pour un usage lourd — environ 84 millions de tokens par mois, surtout hors pointe, la moitié en cache-hit — donne une facture proche de 1,8×, réelle, loin des titres les plus sombres.
| Ligne (pour 1M tokens) | Ancien | Hors pointe | Pointe | Hausse de pointe |
|---|---|---|---|---|
| V4-Flash cache-hit (entrée) | ¥0,02 | ¥0,05 | ¥0,10 | ~400 % |
| V4-Flash cache-miss (entrée) | ¥1,0 | ¥1,5 | ¥3,0 | 200 % |
| V4-Flash sortie | ¥2,0 | ¥4,5 | ¥9,0 | 350 % |
| V4-Pro cache-hit (entrée) | ¥0,025 | ¥0,15 | ¥0,30 | ~1 100 % |
| V4-Pro cache-miss (entrée) | ¥3,0 | ¥4,5 | ¥9,0 | 200 % |
| V4-Pro sortie | ¥6,0 | ¥13,5 | ¥27,0 | 350 % |
Autre détail souvent manqué : aux heures de pointe, l'API officielle DeepSeek dépasse désormais certains revendeurs (GMI Cloud, Novita et d'autres affichent V4-Pro sous le nouveau tarif de pointe). L'idée que « l'officiel est toujours le moins cher » vient de se briser.
05 · Qwen : offrir les poids, garder le plafond
Ouvrir Qwen3.8-Max n'est pas un geste de générosité simple. Alibaba publie le checkpoint complet à 2,4T et y attache une licence sur mesure — pas l'Apache 2.0 des petits Qwen. L'esprit : gagner l'esprit des développeurs, surtout à l'étranger, tout en gardant un levier sur la poignée d'entreprises capables d'en faire un métier d'inférence concurrent. C'est un pari différent de Muse Glimmer, livré sous Apache 2.0 sans restriction.
| Fiche | Détail |
|---|---|
| Paramètres | 2,4T au total, 95B actifs par token (MoE, 512 experts, 10 routés + 1 partagé) |
| Contexte | 262 144 tokens natifs (checkpoint ouvert), extensible à ~1,01M ; Max hébergé à 1M par défaut |
| Cadence | Aperçu le 2 août → API le 3 → poids ouverts le 12 |
| API internationale | 2 $ / M entrée, 6 $ / M sortie |
| Licence | Pas Apache 2.0 — « Qwen3.8-Max License » sur mesure |
| Pourquoi cela compte | Premier Max ouvert ; Qwen3.5 / 3.6 / 3.7 Max étaient restés API only |
Une rumeur à tuer : la licence interdirait le téléchargement depuis les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud. C'est faux. Le texte publié n'a aucune clause territoriale. Dans un cycle aussi rapide, lire le fichier LICENSE — pas le fil d'annonce — prend quelques secondes.
06 · GLM-5.3 : même socle, autre souffle
Le fait le plus intéressant n'est pas le score, c'est la méthode : même base de 743 milliards que GLM-5.2, pas de réentraînement, et un saut d'environ 6× sur Terminal-Bench 3.0 (4,6 % → 28,3 %) uniquement en agrandissant les environnements de reinforcement learning en post-entraînement. Quand les lois d'échelle du préentraînement s'essoufflent, le RL de post-entraînement devient un levier à part, avec un plancher de coût bien plus bas qu'un nouveau modèle de fondation.
| Benchmark | GLM-5.2 | GLM-5.3 | Écart |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | +23,7 pts |
| DeepSWE | 46,2 % | 66,9 % | +20,7 pts |
| ALE CLI | 23,8 % | 28,5 % | +4,7 pts |
| CyberGym | 77,2 % | 84,5 % | +7,3 pts |
| AutomationBench | 26,2 % | 48,2 % | +22,0 pts |
Chiffres déclarés par Zhipu — aucune reprise tierce n'a encore été publiée. Sur Terminal-Bench 3.0, GLM-5.3 reste derrière GPT-5.6 Sol (34,6 %) et Claude Fable 5 (33,7 %). C'est un sommet open-weight, pas une victoire de frontière.
07 · Qui est encore le moins cher ?
Conversion approximative à ¥7,15 pour 1 dollar.
| Modèle | Entrée (pour 1M tokens) | Sortie (pour 1M tokens) | Poids ouverts ? |
|---|---|---|---|
| DeepSeek V4-Pro (pointe) | ¥9,0 (~1,26 $) | ¥27,0 (~3,78 $) | Non |
| DeepSeek V4-Pro (hors pointe) | ¥4,5 (~0,63 $) | ¥13,5 (~1,89 $) | Non |
| Qwen3.8-Max (API internationale) | 2,00 $ | 6,00 $ | Oui (licence sur mesure) |
| OpenAI GPT-5.6 Luna | 0,20 $ | 1,20 $ | Non |
| Claude Opus 5 (implicite) | ~5,00 $ | ~25,00 $ | Non |
La réponse courte : non. Même après la hausse, le hors-pointe de V4-Pro reste bien sous Claude Opus 5, mais ce n'est plus l'option la moins chère — Qwen3.8-Max international et Luna sous-cotent DeepSeek hors pointe. « Chinois = le moins cher » a tenu une bonne partie de 2025 et du début 2026 ; ce n'est plus une hypothèse sûre.
08 · Ce qui reste non vérifié
- Le titre « 1 100 % » est exact et trompeur. Il ne concerne que l'entrée en cache-hit aux heures de pointe. La sortie a augmenté de 350 %. Les rédactions citent des lignes différentes comme si elles étaient toute l'histoire.
- Zhenwu M890 / Pangu AL128 : plusieurs médias financiers chinois affirment que Qwen3.8-Max tourne sur les puces maison d'Alibaba et des supernœuds « Pangu AL128 ». Ni la documentation technique d'Alibaba ni un benchmark tiers n'ont confirmé ces puces de façon indépendante.
- Une « grave » faille Cursor attribuée à GLM-5.3 : VentureBeat et Zhipu ; les détails techniques manquent. Source vendeur, pas un audit indépendant.
- Contrôles d'export du MOFCOM : des rumours de représailles chinoises sur l'IA et les semi-conducteurs restent des bruits de presse, pas une annonce officielle.
09 · Deux guerres de prix en parallèle
Depuis environ un mois, les laboratoires chinois enchaînent à un rythme que la presse financière locale appelle « 一周三更 » — trois mises à jour par semaine : DeepSeek, Alibaba, Zhipu, plus Kimi K3 (16 juillet, 2,8T) et MiniMax H3 avant eux. Le cadre habituel : les poids ouverts chinois « forcent une repricification mondiale ».
Les laboratoires américains jouent l'inverse côté grand public : OpenAI coupe Luna de 80 % le 30 juillet, puis la rend gratuite et illimitée une semaine plus tard ; Google solde un modèle le 13 août. La Chine ouvre des vaisseaux et encadre le sommet contraint ; les États-Unis courent vers le gratuit et le bon marché au bas de l'entonnoir. Deux stratégies réelles, deux étages différents.
Il existe aussi une lecture géopolitique qu'il faut nommer avec soin. Kimi K3 a déjà attiré l'examen américain en juillet ; le choix d'Alibaba d'ouvrir un Max 2,4T dans cette fenêtre a été lu comme une façon de figer l'esprit international avant un durcissement possible. C'est une interprétation informée, pas un fait établi.
10 · Cinq gestes sur un Mac isolé
Si vous allez retoucher le routage de production, ne le faites pas sur l'ordinateur qui porte déjà les clés de l'entreprise. Prenez un nœud Apple Silicon jetable :
- Cartographier les heures de pointe. Déplacer les lots hors de 09:00–12:00 et 14:00–18:00, heure de Pékin. Voir si vos trente derniers jours ressemblent au cas 1,8× ou au titre 1 100 %.
- Lire la licence, pas le fil. Parcourir la règle des 50 millions de dollars (MaaS / AI Work Assistant) et celle des 100 millions de MAU ou 20 millions de dollars de revenu mensuel. L'usage interne est souvent libre ; revendre de l'inférence ne l'est pas « parce que le checkpoint s'est téléchargé ».
- Comparer une même suite. V4-Pro, Qwen3.8-Max, GLM-5.3 sur le même jeu d'agents. Journaliser le cache-hit, la part de sortie, le coût par tâche achevée.
- Isoler sur un Mac loué. Choisir un nœud à la journée dans les tarifs macOS bare-metal. Garder clés et journaux hors du trousseau quotidien.
- Détruire le nœud. Exporter le modèle de coût et le cron hors pointe, puis effacer la location.
11 · FAQ
DeepSeek reste-t-il moins cher que GPT-5.6 ou Claude après la hausse ?
Hors pointe, oui face à Claude Opus 5 — mais ce n'est plus l'option unique la moins chère. GPT-5.6 Luna (0,20 / 1,20 $ par million de tokens) et Qwen3.8-Max international (2 / 6 $) sous-cotent désormais DeepSeek hors pointe sur au moins une dimension. DeepSeek reste relativement bon marché pour un modèle de frontière, plus le moins cher tout court.
Puis-je utiliser gratuitement les poids ouverts de Qwen3.8-Max dans un produit commercial ?
Oui, dans la plupart des cas — projets personnels et usage interne d'entreprise. L'exception ne vise que le Model-as-a-Service ou l'AI Work Assistant ayant gagné plus de 50 millions de dollars sur 12 mois consécutifs ; ce palier exige une licence commerciale séparée d'Alibaba.
Qwen3.8-Max est-il interdit aux utilisateurs des États-Unis, de l'UE ou du Royaume-Uni ?
Non. La rumeur a circulé, elle est fausse : la licence publiée n'a aucune restriction géographique. Les limites tiennent au chiffre d'affaires, non au lieu où vous ou vos utilisateurs vous trouvez. La Corée du Sud n'est pas non plus exclue.
Quelle est la vraie différence entre GLM-5.3 et GLM-5.2 ?
Rien au niveau du socle — même fondation à 743 milliards de paramètres. Les gains (environ 6× sur Terminal-Bench 3.0) viennent entièrement du reinforcement learning mis à l'échelle en post-entraînement, sans réentraîner la base.
Meta ouvrira-t-il vraiment son vaisseau amiral, pas seulement Muse Glimmer ?
Pas encore. Muse Glimmer est un distillé 30B, pas le vrai vaisseau. Les poids ouverts de Muse Spark 1.2, plus grand et encore fermé, ont été promis « bientôt » ; au moment d'écrire, ils n'ont pas paru. Traitez cela comme une intention déclarée, non comme un fait.
12 · Louer un Mac pour trancher
On peut retoucher des clés API sur un portable personnel, ou lancer un duel unique sur une instance Windows ou Linux. Cela suffit pour un script jetable. Cela convient mal à un modèle de coût que l'on veut garder : les secrets d'entreprise partagent le trousseau des clés d'évaluation, un dérapage aux heures de pointe peut faire sauter le budget du mois, et les images cloud génériques manquent les outils natifs macOS / Apple Silicon. Si vous voulez une conclusion de coût reproductible, une facturation à la journée et du vrai matériel Apple, un Mac isolé est le laboratoire le plus propre. Louer évite d'acheter une machine pour une semaine de grille tarifaire. Voir les tarifs macOS bare-metal et commander des nœuds de calcul M4.
13 · Sources
- Annonce tarifaire officielle de DeepSeek, recoupée avec Wall Street CN, IT Home, AIGC.cn et les discussions V2EX
- Dépôts officiels Qwen (Hugging Face / ModelScope) et le South China Morning Post sur les termes de licence
- Page technique officielle GLM-5.3 de Zhipu (Z.ai), plus VentureBeat et StableLearn
- Blog officiel de Meta AI Research et couverture VentureBeat de Muse Glimmer
- Médias financiers chinois (Yicai / 第一财经, Sohu Finance) sur le rythme et le cadrage du cycle open-weight
Tarifs, licences et benchmarks reflètent l'information publique à la date de publication. Vérifiez les textes officiels avant de republier. Les points marqués non vérifiés (puces domestiques, faille Cursor, rumeurs d'export) n'ont pas été confirmés de façon indépendante.