DeepSeek-Peak +1.100 %, Qwen 2,4T Open Weights, GLM-5.3: die Zahlen hinter dem August-Schwenk
Wer steckt fest? Teams, die Agenten über DeepSeek, Qwen oder GLM routen, sehen drei widersprüchliche Schlagzeilen: eine vierstellige Preiserhöhung, ein 2,4-Billionen-Parameter-Checkpoint und ein Coding-Sprung auf derselben Basis. Was Sie erhalten: die offizielle Tarifkarte, die Lizenzschwellen und warum „chinesisches Modell = günstigstes Modell“ nicht mehr trägt. Aufbau: drei Fehlannahmen, alle Positionszahlen zuerst, dann Kalender, drei Labor-Logiken, Preismatrix, ungeprüfte Claims, Fünf-Schritte-Mac mit DSGVO-Isolation, FAQ.
Inhaltsverzeichnis
Zur Qwen-GA vom 3. August: Qwen3.8-Max Open-Source-Analyse. Zum Flash-Review: DeepSeek V4 Flash Benchmark und Preis. Zur US-Senkung: GPT-5.6 Luna-Preissenkung.
Leitdaten zuerst. Die Schlagzeile „1.100 %“ gilt nur für Peak-Cache-Hit-Input von V4-Pro — die Position, die zuvor am nächsten bei null lag. Output, der die meisten realen Rechnungen dominiert, stieg um 350 %. Eine unabhängige Kostenmodellierung für einen Heavy User mit rund 84 Millionen Token pro Monat, überwiegend Off-Peak und etwa der Hälfte Cache-Hits, landet bei etwa 1,8× der alten Rechnung. Wer Routing umstellt, sollte diese 1,8×-Last modellieren — nicht die vierstellige Headline.
01 · Drei Fehlannahmen in der Tarifkarte
- Die 1.100-%-Headline ist eine Position, keine Rechnung. Peak-Cache-Hit-Input stieg am stärksten, weil er am nächsten bei null startete. Output stieg um 350 %.
- Open Weights sind nicht Apache 2.0. Qwen3.8-Max ist herunterladbar, aber ein MaaS- oder AI-Work-Assistant-Geschäft über 50 Millionen USD in einem beliebigen 12-Monats-Fenster braucht eine separate kommerzielle Lizenz. Produkte über 100 Millionen MAU oder 20 Millionen USD Monatsumsatz müssen den Modellnamen anzeigen.
- „Chinesisches Modell = günstigstes Modell“ ist unsicher. Off-Peak-V4-Pro unterbietet weiter Claude Opus 5, aber internationales Qwen3.8-Max und GPT-5.6 Luna schlagen DeepSeek in mindestens einer Dimension.
02 · Peak-Tarife: alle sechs Positionen
Wirksam ab 17. August 2026, 00:00 Pekingzeit. Peak-Stunden: 9–12 und 14–18 Uhr Pekingzeit. Alle Beträge in Yuan pro 1 Million Token.
| Position (pro 1M Token) | Alt | Neu Off-Peak | Neu Peak | Peak-Anstieg |
|---|---|---|---|---|
| V4-Flash Cache-Hit (Input) | ¥0,02 | ¥0,05 | ¥0,10 | ~400 % |
| V4-Flash Cache-Miss (Input) | ¥1,0 | ¥1,5 | ¥3,0 | 200 % |
| V4-Flash Output | ¥2,0 | ¥4,5 | ¥9,0 | 350 % |
| V4-Pro Cache-Hit (Input) | ¥0,025 | ¥0,15 | ¥0,30 | ~1.100 % |
| V4-Pro Cache-Miss (Input) | ¥3,0 | ¥4,5 | ¥9,0 | 200 % |
| V4-Pro Output | ¥6,0 | ¥13,5 | ¥27,0 | 350 % |
Ein Detail, das internationale Berichte oft auslassen: zur Peak-Zeit liegt die offizielle DeepSeek-API nun über mehreren Resellern (GMI Cloud, Novita und andere listen V4-Pro unter dem neuen Peak-Satz). Die Annahme „offizielle API ist immer der günstigste DeepSeek-Weg“ ist gebrochen.
03 · Qwen-Spezifikation und Lizenzschwellen
| Merkmal | Wert |
|---|---|
| Parameter | 2,4T gesamt, 95B aktiv pro Token (MoE, 512 Experten, 10 geroutet + 1 shared) |
| Kontext | 262.144 Token nativ (offener Checkpoint), erweiterbar auf ~1,01M; gehostetes Max standardmäßig 1M |
| Kadenz | Preview 2. August → API 3. August → Open Weights 12. August |
| API international | 2 USD / M Input, 6 USD / M Output |
| Lizenz | Nicht Apache 2.0 — eigene „Qwen3.8-Max License“ |
| Bedeutung | Erster Max-Tier-Open-Weight von Alibaba; Qwen3.5 / 3.6 / 3.7 Max blieben API-only |
Zwei harte Gates: verdient ein MaaS- oder AI-Work-Assistant-Geschäft in 12 aufeinanderfolgenden Monaten über 50 Millionen USD, braucht es eine separate kommerzielle Lizenz. Liegt ein Produkt bei 100 Millionen MAU oder 20 Millionen USD Monatsumsatz, muss der Modellname angezeigt werden. Ein geografisches Verbot für USA, EU, UK oder Südkorea steht nicht in der veröffentlichten Lizenz — dieses Gerücht ist falsch.
04 · GLM-5.3-Deltas ohne Drittprüfung
Zhipu-Selbsttest, keine unabhängige Drittwiederholung. Dieselbe 743B-Basis wie GLM-5.2; nur Post-Training-RL. Terminal-Bench 3.0 etwa 6× (4,6 % → 28,3 %).
| Benchmark | GLM-5.2 | GLM-5.3 | Delta |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | +23,7 Punkte |
| DeepSWE | 46,2 % | 66,9 % | +20,7 Punkte |
| ALE CLI | 23,8 % | 28,5 % | +4,7 Punkte |
| CyberGym | 77,2 % | 84,5 % | +7,3 Punkte |
| AutomationBench | 26,2 % | 48,2 % | +22,0 Punkte |
Auf Terminal-Bench 3.0 bleibt GLM-5.3 hinter GPT-5.6 Sol (34,6 %) und Claude Fable 5 (33,7 %). Das ist ein starkes Open-Weight-Ergebnis, kein Frontier-Sieg.
05 · Kalender 16. Juli bis 17. August
| Datum | Ereignis |
|---|---|
| 16. Juli 2026 | Moonshot AI öffnet Kimi K3 (2,8T Parameter), US-Sicherheitsprüfung |
| 30. Juli 2026 | OpenAI senkt GPT-5.6 Luna um 80 % |
| 2.–3. August 2026 | Alibaba previewt, dann hostet Qwen3.8-Max als API |
| 6.–7. August 2026 | Luna wird kostenloser Default mit unbegrenztem Text |
| 10. August 2026 | Meta veröffentlicht Muse Glimmer (30B, Apache 2.0) und kündigt Open Weights für Muse Spark 1.2 an |
| 12. August 2026 | Alibaba legt Qwen3.8-2.4T-A95B auf Hugging Face / ModelScope; xAI liefert Grok 4.6 |
| 13. August 2026 | DeepSeek-V4-Pro GA plus Preiserhöhung ab 17. August; Google senkt Gemini 3.7 Flash |
| 14. August 2026 | Zhipu liefert GLM-5.3, dieselbe 743B-Basis wie GLM-5.2 |
| 17. August 2026, 00:00 Peking | Neue DeepSeek-Preise gelten |
06 · Drei Labore, drei Hebel
DeepSeek: Tageszeitpreis ist ein Kapazitätsproblem
Die flache Billigpreisung funktionierte, solange GPU-Kapazität mit der Nachfrage Schritt hielt. Sobald Nutzung exponentiell wuchs und Kapazität nicht, musste etwas explizit werden: Peak-Compute ist knapp, Last bitte selbst verschieben. Das ist Preissetzungsmacht, kein bloßes Margen-Einknicken.
Alibaba: Gewichte für Mindshare, Lizenz für die Decke
Der 2,4T-Checkpoint ist öffentlich, die Lizenz aber eine eigene Qwen3.8-Max License — nicht das permissive Apache 2.0 kleinerer Qwen-Modelle. Entwickler-Mindshare international, Preishebel bei den wenigen Firmen, die darauf ein konkurrierendes Inference-Geschäft bauen könnten. Das ist ein anderer Einsatz als Metas Muse Glimmer unter uneingeschränktem Apache 2.0.
Zhipu: keine neue Basis, größeres Post-Training
Dieselbe 743B-Grundlage, kein Retraining, etwa 6× auf Terminal-Bench 3.0 allein durch skaliertes Reinforcement Learning im Post-Training. Während Pretraining-Skalierung abnimmt, wird Post-Training-RL ein eigener Hebel mit niedrigerer Kostenschwelle als ein neues Foundation-Modell.
07 · Cross-Vendor-Preismatrix
Umrechnung etwa ¥7,15 / 1 USD.
| Modell | Input (pro 1M Token) | Output (pro 1M Token) | Open Weights? |
|---|---|---|---|
| DeepSeek V4-Pro (Peak) | ¥9,0 (~1,26 USD) | ¥27,0 (~3,78 USD) | Nein |
| DeepSeek V4-Pro (Off-Peak) | ¥4,5 (~0,63 USD) | ¥13,5 (~1,89 USD) | Nein |
| Qwen3.8-Max (internationale API) | 2,00 USD | 6,00 USD | Ja (eigene Lizenz) |
| OpenAI GPT-5.6 Luna | 0,20 USD | 1,20 USD | Nein |
| Claude Opus 5 (impliziert) | ~5,00 USD | ~25,00 USD | Nein |
Kurz: nein, DeepSeek ist nicht mehr das eindeutig günstigste Frontier-Modell. Off-Peak-V4-Pro bleibt klar unter Claude Opus 5; internationales Qwen3.8-Max und Luna unterbieten DeepSeek Off-Peak in mindestens einer Dimension. „Chinesisch = billigst“ galt 2025 und Anfang 2026 — es ist keine sichere Annahme mehr.
08 · Ungeprüfte Claims
- „1.100 %“ ist technisch korrekt, ohne Kontext irreführend. Nur Peak-Cache-Hit-Input. Output +350 %. Medien zitieren unterschiedliche Positionen, als wären sie die ganze Rechnung.
- Zhenwu M890 / Pangu AL128: Berichte chinesischer Finanzmedien, dass Qwen3.8-Max auf Alibabas eigenen Chips und „Pangu AL128“-Superknoten läuft, sind von Alibabas eigener Technikdokumentation und Drittbenchmarks nicht unabhängig bestätigt.
- GLM-5.3 und eine „ernste“ Cursor-Lücke: VentureBeat und Zhipu; technische Details fehlen. Vendor-Quelle, kein unabhängiges Audit.
- MOFCOM-Gegensanktionen: Berichte über mögliche chinesische Exportkontrollen für KI/Halbleiter sind unbestätigte Gerüchte, keine amtliche Ankündigung.
09 · Zwei Fronten, ein Monat
Chinesische Finanzmedien nennen das Tempo „一周三更“ — drei Modellupdates pro Woche: DeepSeek, Alibaba, Zhipu, dazu Moonshot Kimi K3 (16. Juli, 2,8T) und zuvor MiniMax H3. Die Rahmung lautet oft: chinesische Open-Weight-Releases erzwingen eine globale Neubepreisung.
US-Labore spielen am Consumer-Ende das Gegenteil: OpenAI senkte Luna am 30. Juli um 80 % und machte das Modell am 6.–7. August zum kostenlosen Default mit unbegrenztem Text; Google lieferte am 13. August ein vergünstigtes Gemini 3.7 Flash. China öffnet Flaggschiff-Gewichte und staffelt den knappen Peak; die USA rennen am Consumer-Ende Richtung frei und billig. Beides sind echte Strategien, unterschiedliche Trichterteile.
Eine geopolitische Lesart der Qwen-Zeitwahl — Mindshare sichern, bevor Regulierung enger wird — ist Interpretation, kein belegter Fakt. Kimi K3 zog im Juli bereits US-Sicherheitsprüfung auf sich; das Zeitfenster fällt auf.
10 · Fünf Schritte: isolierter Mac und DSGVO
Produktionsrouting nicht auf dem Laptop umbauen, der bereits Firmenschlüssel hält. Eval-Logs und API-Keys sind personenbezogene bzw. geschäftskritische Daten: auf einem Alltags-Mac landen sie im selben Keychain wie private Konten. Ein tagesweise gemieteter Apple-Silicon-Knoten hält die Verarbeitung isoliert — relevant für DSGVO-Datenminimierung und Nachweis der Trennung.
- Peak-Fenster kartieren. Batch- und cache-freundliche Jobs aus 09:00–12:00 und 14:00–18:00 Pekingzeit schieben. Prüfen, ob die letzten 30 Tage eher dem 1,8×-Heavy-User oder der 1.100-%-Headline gleichen.
- Lizenzgates prüfen. 50-Millionen-USD-Regel für MaaS / AI Work Assistant und Namenspflicht bei 100 Millionen MAU oder 20 Millionen USD Monatsumsatz. Interner Einsatz ist meist frei; Inference weiterverkaufen ist nicht „frei, weil der Checkpoint heruntergeladen wurde“.
- Eine Task-Suite fahren. V4-Pro, Qwen3.8-Max und GLM-5.3 auf derselben Coding-Agent-Suite. Cache-Hit-Rate, Output-Anteil und Kosten pro erledigter Aufgabe loggen — nicht nur die öffentliche Preisliste.
- Auf gemietetem Mac isolieren. Tagesknoten über Bare-Metal-macOS-Preise wählen. Schlüssel und Eval-Logs bleiben außerhalb des Alltags-Keychains; die Verarbeitung ist vom Firmenlaptop getrennt.
- Knoten zerstören. Kostenmodell und Off-Peak-Cron exportieren, Miete löschen, damit der Versuch nicht in Produktion wandert.
11 · FAQ
Ist DeepSeek nach der Preiserhöhung noch günstiger als GPT-5.6 oder Claude?
Off-Peak bleibt günstiger als Claude Opus 5, ist aber nicht mehr die eindeutig günstigste Option. GPT-5.6 Luna (0,20 / 1,20 USD pro Million Token) und internationales Qwen3.8-Max (2 / 6 USD) unterbieten DeepSeek Off-Peak in mindestens einer Dimension. DeepSeek bleibt relativ günstig für ein Frontier-Modell, nicht mehr das billigste.
Darf ich die offenen Gewichte von Qwen3.8-Max kostenlos in einem kommerziellen Produkt nutzen?
Ja für die meisten Fälle — private Projekte und interner Unternehmenseinsatz bleiben unberührt. Die Ausnahme gilt nur, wenn Sie ein MaaS- oder AI-Work-Assistant-Geschäft betreiben, das in 12 aufeinanderfolgenden Monaten über 50 Millionen USD verdient hat; dann braucht es eine separate kommerzielle Lizenz von Alibaba.
Ist Qwen3.8-Max für Nutzer in den USA, der EU oder dem Vereinigten Königreich gesperrt?
Nein. Das Gerücht ist falsch — die veröffentlichte Lizenz enthält keine geografische Beschränkung. Die Grenzen sind umsatzbasiert, nicht an Ihren Standort oder den Ihrer Nutzer gebunden. Auch das Südkorea-Gerücht ist falsch.
Was unterscheidet GLM-5.3 tatsächlich von GLM-5.2?
Auf Basismodell-Ebene nichts — dieselbe 743-Milliarden-Parameter-Grundlage. Die Gewinne (etwa 6× auf Terminal-Bench 3.0) kommen vollständig aus skaliertem Reinforcement Learning im Post-Training, ohne Retraining der Basis.
Wird Meta wirklich sein Flaggschiff öffnen — nicht nur Muse Glimmer?
Noch nicht. Muse Glimmer ist ein destilliertes 30B-Modell, nicht Metas echtes Flaggschiff. Offene Gewichte für das größere, geschlossene Muse Spark 1.2 wurden für „bald“ angekündigt; bis zum Redaktionsschluss sind sie nicht erschienen. Das ist eine Absichtserklärung, kein bestätigter Fakt.
12 · Messung auf gemietetem Mac
API-Keys auf dem privaten Laptop umzustellen oder einen einmaligen Vergleich auf einer Windows- oder Linux-Cloudbox zu fahren, reicht für ein Wegwerfskript. Für ein Kostenmodell, das Sie behalten wollen, ist das ein schlechter Fit: Firmgeheimnisse sitzen im selben Keychain wie Eval-Keys, ein Peak-Misschuss sprengt das Monatsbudget, generische Cloud-Images fehlen native macOS- und Apple-Silicon-Sidecar-Werkzeuge. Wer eine reproduzierbare Kostenaussage, Tagesabrechnung und echte Apple-Hardware will, nimmt einen isolierten Mac. Mieten vermeidet den Kauf für ein einwöchiges Preisexperiment und hält die Datenverarbeitung vom Alltagsgerät getrennt — für EU-Teams ein greifbarer DSGVO-Hebel. Siehe Bare-Metal-macOS-Preise und M4-Rechenknoten bestellen.
13 · Quellen
- Offizielle DeepSeek-Preisankündigung, abgeglichen mit Wall Street CN, IT Home, AIGC.cn und V2EX-Diskussion
- Offizielle Qwen-Repositories (Hugging Face / ModelScope) und South China Morning Post zu den Lizenzbedingungen
- Offizielle GLM-5.3-Technikseite von Zhipu (Z.ai), plus VentureBeat und StableLearn
- Offizieller Meta-AI-Research-Blog und VentureBeat zu Muse Glimmer
- Chinesische Finanzmedien (Yicai / 第一财经, Sohu Finance) zu Tempo und Rahmung des Open-Weight-Zyklus
Preise, Lizenzbedingungen und Benchmarks entsprechen öffentlich verfügbaren Angaben zum Veröffentlichungsstand. Vor Weiterverwendung aktuelle offizielle Tarife und Lizenztexte prüfen. Als ungeprüft markierte Punkte (Chip-Claims, Cursor-Lücke, Exportkontroll-Gerüchte) sind nicht unabhängig bestätigt.