Chinesisches LLM GA 2026 2026-08-04

Qwen3.8-Max Open Source? 2,4 Billionen Parameter — Arena Platz 5 und das Gewichte-Timing

Zielgruppe: Entwickler und Agent-Teams, die Qwen3.8-Max neben Kimi K3 und DeepSeek V4 bewerten und wissen müssen, ob „Open Source" real ist, ob Arena-Werte halten und wann Gewichte landen. Lieferumfang: verifizierter GA-Zeitstrahl, Kerndatentabelle, Wettbewerbsmatrix, Open-Weight-Kontroverse und fünf Mac-Isolations-Schritte für sichere API-Tests. Struktur: drei Schmerzpunkte, Datentabellen, Architektur-Deep-Dive, FAQ×5.

Alibaba Qwen3.8-Max August 2026 GA 2,4 Billionen Parameter MoE Arena Text-Ranking Platz fünf

Querverweise: Kimi K3 Open Weight; Apple Intelligence und Qwen in China: Apple Intelligence China-Zulassung; DeepSeek-Vergleich: DeepSeek V4 GA.

Am 3. August 2026 hat Alibaba das Flaggschiff Qwen3.8-Max offiziell GA gestellt: 2,4 Billionen Gesamtparameter, 95 Milliarden aktiviert, parallel das Agent-Produkt „Qianwen Office". In der Arena-Text-Rangliste der Top 8 ist Qwen3.8-Max das einzige Nicht-Anthropic-Modell — alle Benchmarks stammen jedoch bislang aus Alibaba-eigenen Tests; unabhängige Plattformen haben die GA-Version noch nicht reproduziert.

01 · Drei Entscheidungsschmerzpunkte: Warum Benchmarks allein nicht reichen

  1. „Open Source" auf qwen.ai, Gewichte fehlen: Am GA-Tag war das Label gesetzt, doch Hugging Face und ModelScope zeigten zum Stichtag 4. August kein Repository, keine Lizenz und kein fixes Datum — nur das Versprechen „nächste Woche". Marketing läuft dem verifizierbaren Artefakt voraus.
  2. Benchmarks aus dem eigenen Haus: PaperBench, QwenSWEBench und RecreationBench sind überwiegend intern. Artificial Analysis und Arena.ai lieferten zum 4. August keine unabhängige GA-Reproduktion; der Arena-Score 1496 trägt den Status „Preliminary".
  3. Preview-Transparenzschulden: Die Vorschau vom 19. Juli nannte weder aktivierte Parameter noch Scoretabellen und untersagte automatisierte Produktionsaufrufe. Erst GA offenbarte 95 Mrd. aktivierte Parameter — mehrere unabhängige Tester empfahlen bis dahin: „erst im eigenen Szenario prüfen, nicht migrieren".

02 · Zeitstrahl: Vom Preview zum GA in zwei Wochen

  • 16. Juli: Moonshot veröffentlicht Kimi K3 — 2,8T Parameter (896 Experten, 16 aktiv), mit unabhängigen Reviews und Tech Report.
  • 19. Juli: Qwen3.8-Max Preview, Anbindung an Token Plan / Qoder / QoderWork, Preis auf 10 % des erwarteten GA-Tarifs — ohne aktivierte Parameter und ohne Scoretabelle.
  • 27. Juli: Kimi K3 Gewichte auf Hugging Face, inkl. Attention-Kernel und MoE-Kommunikationsbibliotheken.
  • 31. Juli: DeepSeek V4-Flash GA — Parameterzahl unverändert, Agent- und Code-Benchmarks deutlich über V4-Pro-Preview.
  • 3. August: Qwen3.8-Max GA mit vollständiger Scoretabelle, „Qianwen Office" live. Alibaba-Aktie HK +7 %, US-Listing +4,5 %.
  • ca. 10. August (erwartet): Qwen3.8-Max und Destillat Qwen3.8-27B auf Hugging Face / ModelScope — Lizenz und exaktes Datum noch offen.

03 · Kerndaten auf einen Blick

Merkmal Qwen3.8-Max
Release-Datum3. August 2026 (GA)
Gesamt- / aktivierte Parameter2,4T / 95 Mrd.
ArchitekturSparse MoE auf Qwen3.5-Basis + Hybrid-Attention
Kontextfenster1 Mio. Token (Thinking-Modus ~983k, Output-Cap ~131k)
API-PreisInput $2/M Token, Output $6/M Token
China-PreisInput 12 ¥/M, Output 36 ¥/M, Cache-Treffer ab 1,5 ¥
Arena Text (Snapshot 1.8.)Platz 5, 1496 Punkte (Preliminary)
Arena VisionPlatz 2, hinter Claude Fable 5
PaperBench (Alibaba)93,0 (+28,2 ggü. Vorgänger)
SWE-bench Pro (Alibaba)67,7 (Fable 5: 80,0)
Gewichte Open SourceVersprochen, zum Stichtag nicht live

Hardfact #1: API $2/$6 pro Million Token — deutlich unter Claude Opus 5 ($5/$25) und Claude Fable 5 ($10/$50).

Hardfact #2: Arena Text Platz 5 mit 1496 Punkten — einziges Nicht-Anthropic-Modell in den Top 8, Status „Preliminary".

Hardfact #3: Börsenreaktion am Release-Tag HK +7 %, US +4,5 % — Markt liest das als Rückeroberung der AI-Erzählung durch Alibaba.

04 · Architektur-Deep-Dive: Was hinter 2,4 Billionen steckt

4.1 MoE + Hybrid-Attention statt reiner Parameter-Inflation

Sparse MoE hält die Gesamtgröße bei 2,4T, aktiviert aber nur 95 Mrd. pro Forward Pass — Inferenzkosten nähern sich Hundert-Milliarden-Modellen, nicht einem vollen 2,4T-Aufruf. Das ist Architektur-Effizienz für Preiswettbewerb, kein reines Größen-Marketing.

4.2 reasoning_effort in drei Stufen

Stufen low, medium, xhigh (Default: xhigh) erlauben Latenz-Tiefe-Trade-offs. Aufruf über enable_thinking oder Anthropic-kompatibles Feld reasoning.effort.

4.3 Langläufer-Agenten und Ökosystem

Alibaba nennt 16-tägige autonome Coding-Projekte ohne menschlichen Eingriff, Chip-Design-Optimierung mit 500+ Schritten und RecreationBench zur Black-Box-App-Nachbildung. API unterstützt OpenAI- und Anthropic-Protokoll — direkte Anbindung an Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw.

05 · Wettbewerbsmatrix: Qwen3.8-Max, Kimi K3, DeepSeek V4, Claude

Modell Gesamt / aktiv Preis Input/Output (pro M) Gewichte offen Unabhängige Reviews
Qwen3.8-Max2,4T / 95 Mrd.$2 / $6Nein (versprochen)Keine GA-Reproduktion
Kimi K32,8T / ~50 Mrd.$3 / $15Ja (27.7.)AA Index ≈ 57,11
DeepSeek V4-Flashunverändert vs. V4-Prokeine vollständige TabelleJa9 Agent/Code-Benchmarks > V4-Pro
Claude Opus 5nicht veröffentlicht$5 / $25NeinArena-Spitze
Claude Fable 5nicht veröffentlicht$10 / $50NeinArena Text #1

Ein vergleichbarer unabhängiger Blindtest (269-Dateien-Architektur): Kimi K3 83, Qwen3.8-Max Preview 80 — Differenz zu klein für „klarer Sieger", eher Gleichstand mit unterschiedlichen Stärken.

06 · Kontroverse: Open-Source-Label vor den Gewichten

  • Label ohne Artefakt: Kein HF-/ModelScope-Repo, keine Lizenz, kein fixes Datum — nur „nächste Woche".
  • Eigene Benchmark-Suiten: QwenSWEBench, QwenQoderBench, CoWorkBench, RecreationBench — Methodik nicht bis zur Dritt-Reproduzierbarkeit offengelegt.
  • Fußnoten gegen Wettbewerber: Hinweis, Fable-5-Ergebnisse könnten „Fallback" betreffen — ohne gleichwertige Transparenz der eigenen Tests.
  • Preview-Restriktionen: Kein Model Card, keine Sicherheitsbewertung, Verbot automatisierter Produktionsaufrufe bis GA.

Das disqualifiziert die Leistung nicht — der Blindtest zeigt Parität mit Kimi K3 — aber „Weltspitze" bleibt bis Gewichte und unabhängige Scores vorliegen eine Alibaba-These, keine verifizierte Tatsache.

07 · Einordnung: Parameter-Wettlauf trifft Effizienz-Narrativ

  • 2026 als Trillionen-Jahr: DeepSeek V4-Pro (1,6T) → Qwen3.8-Max (2,4T) → Kimi K3 (2,8T). DeepSeek V4-Flash zeigt jedoch: Agent-Fähigkeit steigt ohne Parameter-Sprung — Effizienz ersetzt Größen-PR.
  • Alibabas seltene Open-Weight-Kehrtwende: Frühere Max-Generationen blieben geschlossen; dieses Mal versprochenes Max-Open-Weight — im Lager mit Kimi K3 und DeepSeek.
  • Qwen in Apple Intelligence China: Komprimiert unter 4 GB auf iPhone 15+ — kommerzielle Reichweite über Milliarden Geräte, nicht nur API.
  • US-China-Agent-Kontext: Parallel Agent-Jailbreak-Schlagzeilen bei OpenAI/Anthropic und freiwillige Sicherheits-Framework-Diskussion im Weißen Haus (4. August) — ein Markt beschleunigt Open Weights, der andere verschärft Agent-Governance.

08 · Fünf Mac-Isolations-Schritte (Agent-Toolchain-Abnahme)

  1. QwenCloud API-Key registrieren; Baseline-Tasks (Langdokument, Bugfix, Multi-File-Refactor) je einmal mit OpenAI- oder Anthropic-SDK — Latenz-Delta zwischen xhigh und low protokollieren
  2. In isolierter Umgebung ANTHROPIC_BASE_URL oder OpenAI-kompatiblen Endpunkt setzen; Claude Code / OpenClaw / Qoder CLI anbinden — API-Key nicht in der globalen Shell des Daily Drivers
  3. Gleiche 269-Dateien-Architekturaufgabe gegen Kimi K3 und DeepSeek V4-Flash fahren; Blind-Score und $/Task-Rechnung vergleichen
  4. Hugging Face / ModelScope auf Qwen3.8-Max und Qwen3.8-27B überwachen — LICENSE und Upload-Zeitpunkt dokumentieren, erst dann lokales Ollama-Szenario bewerten
  5. Mit Kimi-K3-Analyse und obiger Matrix Team-Entscheidungsdokument erstellen; Re-Test-Termin um den 10. August setzen
# Anthropic-kompatibler Endpunkt (Isolations-Umgebung) export ANTHROPIC_BASE_URL="https://dashscope.aliyuncs.com/compatible-mode/v1" export ANTHROPIC_API_KEY="your-qwen-api-key" claude -p "Fasse den Qwen3.8-Max GA vom 3. August 2026 zusammen."

09 · FAQ

F1: Kann man Qwen3.8-Max jetzt nutzen? Ist es schon Open Source?
A: API über QwenCloud live, OpenAI- und Anthropic-kompatibel. Gewichte noch geschlossen; erwartet um den 10. August auf Hugging Face und ModelScope — Datum laut offizieller Ankündigung.

F2: Qwen3.8-Max oder Kimi K3 — wer gewinnt?
A: Kein einheitlicher Benchmark. Blindtest: K3 83, Qwen Preview 80. K3: offene Gewichte, Drittscores. Qwen: günstigere API, stärkere Multimodalität.

F3: Sind 2,4 Billionen Parameter unbezahlbar?
A: Abgerechnet werden ~95 Mrd. aktivierte Parameter. Voll-Deployment braucht Multi-Node-Rechenzentrum; für die meisten Teams ist Qwen3.8-27B die realistische Open-Weight-Option.

F4: Alibabas Benchmarks vertrauen?
A: Richtungsweisend, nicht final. Eigene Suiten dominieren; unabhängige GA-Reproduktion fehlt noch. A/B in eigenen Workloads vor Migration.

F5: Relevanz für Endnutzer?
A: Komprimierte Qwen-Modelle treiben Apple Intelligence in China auf iPhone 15+ — systemweite AI, nicht nur Entwickler-API.

10 · Mac-Miete: Qwen3.8-Max Agent-Tests ohne Daily-Driver-Risiko

Die Qwen3.8-Max-API senkt Migrationskosten über Dual-Protokoll, doch auf dem Haupt-Entwicklungsrechner bleiben Risiken: API-Key in globaler Shell, irreversible Long-Context-Läufe, Konflikte zwischen Claude Code und OpenClaw. Windows- und Linux-Nutzer erreichen die API, validieren aber selten macOS-native Keychain-, Xcode- und TCC-Szenarien vollständig.

Kurzfristige API-Tests auf dem Laptop sind sinnvoll; wer reproduzierbare Agent-Umgebungen, vollständige Apple-Ökosystem-Kompatibilität und geringeres Key-Leak-Risiko will, profitiert von einem isolierten Apple-Silicon-Mac. Tagesmiete statt CapEx passt zum Rhythmus „GA beobachten → Gewichte abwarten → zerstören". Tarife: Bare-Metal-macOS-Preise.

Cloud-API für die erste Selektion reicht; für auditierbare Agent-Pipelines mit destroy-after-test ist ein gemieteter Mac mini M4 oft die bessere Ökonomie — besonders wenn das Gewichte-Fenster um den 10. August mehrere parallele Toolchains erfordert.

11 · Quellen

  • Alibaba Cloud Blog und Pressemitteilungen (Qwen3.8-Max GA, Preisseite)
  • Alibaba Cloud Community, Alibaba Press Room (englische Ankündigungen)
  • Arena.ai Text- und Vision-Rankings (Snapshot 1. August 2026)
  • Branchenberichte: ITBear, Sina Finance, chinesische Tech-Medien
  • Unabhängige Analysen: Apidog, Yotta Labs, eesel AI, Context Studios, MarkTechPost, TechNode, SiliconANGLE
  • Apple Intelligence China: TechCrunch, Memeburn, Digital Market Reports

Vor Produktionsentscheidungen offizielle Ankündigungen, Open-Weight-Termine und Benchmark-Updates erneut prüfen — Zahlen können sich nach GA noch ändern.