Qwen3.8-Max d'Alibaba : 2,4T paramètres, 5e sur Arena — open source la semaine prochaine ?
Pour qui ? Développeurs et équipes agent qui comparent Qwen3.8-Max, Kimi K3 et DeepSeek V4 sans savoir si « open source » est réel, si les scores Arena tiennent, ni quand les poids arrivent. Ce guide : chronologie GA vérifiée, tableau de specs, matrice concurrentielle, controverse du badge open source, cinq étapes Mac isolé pour tester l'API sans risque. Structure : trois frictions, tableaux, architecture, FAQ×5, location Mac.
Sommaire
Articles connexes : Kimi K3 open weight expliqué ; DeepSeek V4 GA, tarifs et benchmarks.
Le 3 août 2026, Alibaba a atteint la disponibilité générale (GA) de Qwen3.8-Max — MoE sparse de 2,4 trillions de paramètres avec 95 milliards activés par passage — et lancé l'agent « Qwen Office ». L'API est en ligne aujourd'hui. Les poids, non. Cet écart entre le discours marketing et les artefacts téléchargeables est le cœur du sujet avant d'engager du trafic de production.
01 · Trois frictions décisionnelles : pourquoi les benchmarks ne suffisent pas
- Le site affiche « Open-Source », Hugging Face est vide. qwen.ai a porté le badge open source le jour du GA, mais au 4 août aucun dépôt de poids, aucun fichier LICENSE, aucune date ferme — seule une promesse floue « la semaine prochaine » (~10 août). Le marketing a devancé les livrables vérifiables.
- Chaque score phare passe par le harness Alibaba. PaperBench, QwenSWEBench et RecreationBench sont des suites internes. Artificial Analysis et Arena.ai n'avaient pas reproduit indépendamment les chiffres GA à la publication. Le score texte Arena 1496 est marqué Preliminary.
- La preview a créé un déficit de confiance. La preview du 19 juillet masquait le nombre de paramètres activés, livrait aucun tableau public et interdisait les appels automatisés en production dans les conditions d'utilisation. Le GA a révélé les 95B activés — des semaines après que des équipes routaient déjà du trafic au tarif preview.
02 · Chronologie : deux semaines de sorties compressées
- 16 juillet : Moonshot AI sort Kimi K3 — 2,8T paramètres, 896 experts routés dont 16 activés — avec rapport technique et calendrier open weight clair.
- 19 juillet : Preview Qwen3.8-Max sur Token Plan, Qoder et QoderWork à ~10 % du tarif GA attendu. Paramètres activés et benchmarks retenus.
- 27 juillet : Poids Kimi K3 sur Hugging Face, avec MoonEP et bibliothèques infra associées.
- 31 juillet : DeepSeek publie V4-Flash en GA — empreinte paramétrique identique à V4-Pro preview mais scores agent et code nettement supérieurs.
- 3 août : Qwen3.8-Max en GA avec tableau de scores complet et lancement Qwen Office. Actions Alibaba Hong Kong +7 % ; ADR US +4,5 %.
- ~10 août (promis) : Qwen3.8-Max et le distillé Qwen3.8-27B prévus sur Hugging Face et ModelScope. Clauses de licence encore non publiées.
03 · Fiche technique
| Champ | Qwen3.8-Max |
|---|---|
| Date GA | 3 août 2026 |
| Total / activés | 2,4T / 95B |
| Architecture | MoE sparse + attention hybride (lignée Qwen3.5) |
| Contexte | 1M tokens (mode thinking ~983K entrée, ~131K sortie max) |
| Tarif API | Entrée 2 $/M tokens, sortie 6 $/M tokens |
| Tarif Chine | 12 ¥/M entrée, 36 ¥/M sortie ; cache dès 1,5 ¥/M |
| Arena Texte (snapshot 1 août) | Rang #5, score 1496 (Preliminary) |
| Arena Vision | Rang #2, derrière Claude Fable 5 seul |
| PaperBench (Alibaba) | 93,0 (+28,2 vs génération précédente) |
| SWE-bench Pro (Alibaba) | 67,7 (vs 80,0 de Fable 5) |
| Statut poids | Promis ~10 août ; absent de Hugging Face au 4 août |
Donnée #1 : À 2 $/6 $ par million de tokens, Qwen3.8-Max sous-tarife Claude Opus 5 (5 $/25 $) et Claude Fable 5 (10 $/50 $) — la raison la plus nette pour un essai avant l'arrivée des poids.
Donnée #2 : Rang Arena Texte #5 à 1496 — seul modèle non-Anthropic dans le top 8 — mais l'entrée reste marquée preliminary, pas final.
Donnée #3 : Réaction boursière GA — +7 % Hong Kong, +4,5 % US — signale que le marché lit un retour d'Alibaba sur le récit IA, pas un simple refresh de modèle.
04 · Architecture : ce que 2,4T paramètres achètent vraiment
4.1 MoE + attention hybride plutôt qu'empilement dense
Le mixture-of-experts sparse permet de stocker 2,4 trillions de paramètres en mémoire tout en n'activant que 95 milliards par token. Le coût d'inférence suit l'empreinte activée — proche d'un modèle cent milliards plutôt qu'un transformer dense 2,4T. Le pari est l'efficience architecturale, pas la vanité paramétrique.
4.2 Trois niveaux de reasoning_effort
Qwen3.8-Max expose les modes low, medium et xhigh (défaut xhigh). Appelez via enable_thinking sur les endpoints OpenAI-compatibles ou reasoning.effort sur les routes Anthropic-compatibles — utile pour brouillons rapides versus boucles agent profondes sur le même ID modèle.
4.3 Agents longue durée et positionnement écosystème
Les cas publics Alibaba incluent un run de codage autonome 16 jours sans intervention humaine, une optimisation de conception de puce en 500+ étapes, et RecreationBench — benchmark boîte noire qui reconstruit des applications réelles. La double compatibilité API OpenAI et Anthropic permet à Claude Code, Codex, Qoder CLI, Qwen Code et OpenClaw de pointer vers QwenCloud sans réécrire les clients.
05 · Comparatif : Qwen3.8-Max, Kimi K3, DeepSeek V4, Claude
| Modèle | Total / activés | API (entrée / sortie / M) | Poids ouverts | Benchmarks indépendants |
|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 95B | 2 $ / 6 $ | Pas encore (promis) | Aucun au jour GA |
| Kimi K3 | 2,8T / ~50B | 3 $ / 15 $ | Oui (27 juil.) | AA Index ~57,11 |
| DeepSeek V4-Flash | Identique à V4-Pro | Table publique incomplète | Oui | 9 benches agent/code > V4-Pro |
| Claude Opus 5 | Non publié | 5 $ / 25 $ | Fermé | Arena top tier |
| Claude Fable 5 | Non publié | 10 $ / 50 $ | Fermé | Arena Texte #1 |
Le seul test indépendant vérifiable — tâche d'architecture sur projet réel à 269 fichiers — donne Kimi K3 83 et Qwen3.8-Max preview 80. Bande de parité, pas knockout. Kimi K3 gagne sur l'auditabilité ; Qwen3.8-Max sur le prix et le multimodal.
06 · Controverse : le badge open source avant les binaires
- Badge avant binaires. qwen.ai a labellé le modèle open source le jour GA alors que Hugging Face et ModelScope n'avaient ni dépôt, ni licence, ni checksum.
- Leaderboards auto-évalués. QwenSWEBench, QwenQoderBench, CoWorkBench et RecreationBench sont maintenus par Alibaba — utiles pour les tendances intra-Qwen, pas pour des verdicts cross-vendor.
- Notes de bas de page qui questionnent les rivaux sans ouvrir leurs méthodes. Le tableau Alibaba suggère que les résultats Fable 5 « peuvent impliquer un fallback » — scepticisme légitime, mais le harness Alibaba est tout aussi opaque pour une reproduction tierce.
- Opacité de la preview. La preview de juillet bloquait les appels automatisés en production et sortait sans model card ni rapport de sécurité. Le GA a comblé le gap sur les paramètres, pas sur la vérification.
Rien de cela ne prouve que Qwen3.8-Max est faible — le test Kimi K3 le place dans la même ligue — mais les claims « premier tiers mondial » reposent encore principalement sur les tableurs Alibaba jusqu'à l'arrivée des poids et des scores indépendants.
07 · Contexte : course paramétrique et vents contraires réglementaires
- 2026, l'année de l'expansion trillion-paramètre : DeepSeek V4-Pro (1,6T) → Qwen3.8-Max (2,4T) → Kimi K3 (2,8T). Mais DeepSeek V4-Flash a montré qu'on peut hausser les scores agent sans grossir le compteur — le récit glisse de la taille vers l'efficience.
- Retour rare d'Alibaba vers l'open weight : Les générations Qwen Max précédentes restaient fermées. Promettre des poids Max marque un pivot stratégique vers la coalition open weight que Kimi et DeepSeek mènent déjà.
- Qwen dans Apple Intelligence Chine : Une variante Qwen compressée sous 4 GB tourne on-device sur iPhone 15+ dans la pile Chine — étendant la portée d'Alibaba à des centaines de millions de terminaux.
- Contraste politique US-Chine : Dans la même fenêtre, OpenAI et Anthropic ont révélé des incidents de jailbreak agent sur des systèmes d'entreprise réels. Le 4 août, la Maison-Blanche a convoqué les grands labs pour un cadre volontaire de tests cybersécurité — open weight en Chine, scrutiny agent à Washington.
08 · Cinq étapes Mac isolé pour acceptance toolchain agent
- Enregistrer une clé API QwenCloud et exécuter des tâches de référence — résumé long document, correction d'un bug, refactor multi-fichiers — via SDK OpenAI ou Anthropic-compatibles. Journaliser les deltas de latence entre modes
xhighetlow. - Pointer
ANTHROPIC_BASE_URLou un endpoint OpenAI-compatible vers QwenCloud depuis une machine isolée. Brancher Claude Code, OpenClaw ou Qoder CLI sans écrire les clés dans le profil shell du poste principal. - Rejouer la même tâche architecture 269 fichiers contre Kimi K3 et DeepSeek V4-Flash. Noter scores en revue aveugle et facturation $/tâche côte à côte.
- Surveiller Hugging Face et ModelScope pour les dépôts Qwen3.8-Max et Qwen3.8-27B. Lire la LICENSE avant de planifier un déploiement Ollama local — essais API GA et hosting sur poids sont des chemins d'achat distincts.
- Documenter les critères de sélection avec notre guide Kimi K3 et le tableau ci-dessus. Planifier un point de re-test vers le 10 août promis pour les poids.
09 · FAQ
Q1 : Qwen3.8-Max est utilisable maintenant ? Les poids sont open source ?
R : L'API est en ligne sur QwenCloud avec endpoints compatibles OpenAI et Anthropic. Les poids ne sont pas encore ouverts. Alibaba a promis une sortie vers le 10 août sur Hugging Face et ModelScope — confirmez via les annonces officielles avant de planifier du self-hosting.
Q2 : Qwen3.8-Max ou Kimi K3 ?
R : Aucun benchmark unique tranche. Un test indépendant en double aveugle donne Kimi K3 83 et Qwen3.8-Max preview 80. Kimi K3 mène sur open weight et scores tiers ; Qwen3.8-Max sur prix API et couverture multimodale.
Q3 : 2,4 trillions de paramètres = inaccessible ?
R : Seuls 95B s'activent par passage ; les coûts API ressemblent à un modèle cent milliards. Le déploiement privé complet exige un datacenter multi-nœuds. La plupart des équipes attendent le distillé Qwen3.8-27B promis.
Q4 : Croire aux benchmarks Alibaba ?
R : Signaux directionnels, pas verdict final. Les plateformes indépendantes n'avaient pas reproduit les scores GA au 4 août. Faites des A/B sur vos tâches de production avant migration.
Q5 : Impact pour les utilisateurs courants ?
R : Des modèles Qwen compressés alimentent déjà Apple Intelligence sur iPhone 15+ en Chine. Qwen3.8-Max prolonge la pile qui remontera vers l'IA système pour des utilisateurs grand public — pas seulement les développeurs API.
10 · Location Mac : validation agent Qwen3.8-Max sans risquer le poste principal
Qwen3.8-Max réduit la friction de migration avec une double compatibilité API OpenAI et Anthropic, mais les tests d'acceptance sur votre machine de développement principale gardent des risques réels : clés API qui fuient dans les configs shell globales, expériences million-token qui polluent le cache local, setups Claude Code / OpenClaw côte à côte difficiles à rollback.
Appeler l'API depuis un portable Windows ou un VPS Linux suffit pour des smoke tests, mais ne valide pas complètement les workflows agent natifs macOS — adjacence Xcode, isolation Keychain, chaînes de certificats, ou coexistence Ollama locale une fois les poids disponibles. Les essais API court terme sont adaptés au calcul de prix ; pour une sandbox Apple Silicon reproductible avec facturation journalière sans achat matériel, louer un Mac mini M4 isolé est souvent la voie la plus propre. Tarifs : tarifs bare-metal macOS.
Vous pouvez valider Qwen3.8-Max depuis n'importe quelle machine avec curl et une clé API — mais cette voie sert aux comparaisons de coût rapides, pas à la signature-off agent production. Pour des toolchains stables, compatibilité Apple native et clés qui ne touchent jamais votre poste quotidien, un nœud Mac loué garde l'expérience jetable pendant que les poids restent fermés.
11 · Sources
- Blog officiel Alibaba Cloud et communiqués (annonce GA Qwen3.8-Max, pages tarifaires)
- Alibaba Cloud Community et Alibaba Press Room (déclarations anglaises)
- Leaderboards publics Arena.ai texte et vision (snapshot 1 août 2026)
- Presse tech chinoise : ITBear, Sina Finance et médias sectoriels (réaction boursière GA)
- Analyses indépendantes : Apidog, Yotta Labs, eesel AI, Context Studios, MarkTechPost, TechNode, SiliconANGLE
- Apple Intelligence Chine : TechCrunch, Memeburn, Digital Market Reports
Vérifiez les annonces officielles, dates de sortie open weight et figures de benchmark avant décision de production — les chiffres peuvent évoluer avec les mises à jour Alibaba.