API-Tarife Open Weights 2026-08-17

DeepSeek-Peak +1.100 %, Qwen 2,4T Open Weights, GLM-5.3: die Zahlen hinter dem August-Schwenk

Wer steckt fest? Teams, die Agenten über DeepSeek, Qwen oder GLM routen, sehen drei widersprüchliche Schlagzeilen: eine vierstellige Preiserhöhung, ein 2,4-Billionen-Parameter-Checkpoint und ein Coding-Sprung auf derselben Basis. Was Sie erhalten: die offizielle Tarifkarte, die Lizenzschwellen und warum „chinesisches Modell = günstigstes Modell“ nicht mehr trägt. Aufbau: drei Fehlannahmen, alle Positionszahlen zuerst, dann Kalender, drei Labor-Logiken, Preismatrix, ungeprüfte Claims, Fünf-Schritte-Mac mit DSGVO-Isolation, FAQ.

DeepSeek-Preiserhöhung, Alibaba Qwen3.8-Max Open Weights und Zhipu GLM-5.3 im August 2026

Zur Qwen-GA vom 3. August: Qwen3.8-Max Open-Source-Analyse. Zum Flash-Review: DeepSeek V4 Flash Benchmark und Preis. Zur US-Senkung: GPT-5.6 Luna-Preissenkung.

Leitdaten zuerst. Die Schlagzeile „1.100 %“ gilt nur für Peak-Cache-Hit-Input von V4-Pro — die Position, die zuvor am nächsten bei null lag. Output, der die meisten realen Rechnungen dominiert, stieg um 350 %. Eine unabhängige Kostenmodellierung für einen Heavy User mit rund 84 Millionen Token pro Monat, überwiegend Off-Peak und etwa der Hälfte Cache-Hits, landet bei etwa 1,8× der alten Rechnung. Wer Routing umstellt, sollte diese 1,8×-Last modellieren — nicht die vierstellige Headline.

01 · Drei Fehlannahmen in der Tarifkarte

  1. Die 1.100-%-Headline ist eine Position, keine Rechnung. Peak-Cache-Hit-Input stieg am stärksten, weil er am nächsten bei null startete. Output stieg um 350 %.
  2. Open Weights sind nicht Apache 2.0. Qwen3.8-Max ist herunterladbar, aber ein MaaS- oder AI-Work-Assistant-Geschäft über 50 Millionen USD in einem beliebigen 12-Monats-Fenster braucht eine separate kommerzielle Lizenz. Produkte über 100 Millionen MAU oder 20 Millionen USD Monatsumsatz müssen den Modellnamen anzeigen.
  3. „Chinesisches Modell = günstigstes Modell“ ist unsicher. Off-Peak-V4-Pro unterbietet weiter Claude Opus 5, aber internationales Qwen3.8-Max und GPT-5.6 Luna schlagen DeepSeek in mindestens einer Dimension.

02 · Peak-Tarife: alle sechs Positionen

Wirksam ab 17. August 2026, 00:00 Pekingzeit. Peak-Stunden: 9–12 und 14–18 Uhr Pekingzeit. Alle Beträge in Yuan pro 1 Million Token.

Position (pro 1M Token) Alt Neu Off-Peak Neu Peak Peak-Anstieg
V4-Flash Cache-Hit (Input)¥0,02¥0,05¥0,10~400 %
V4-Flash Cache-Miss (Input)¥1,0¥1,5¥3,0200 %
V4-Flash Output¥2,0¥4,5¥9,0350 %
V4-Pro Cache-Hit (Input)¥0,025¥0,15¥0,30~1.100 %
V4-Pro Cache-Miss (Input)¥3,0¥4,5¥9,0200 %
V4-Pro Output¥6,0¥13,5¥27,0350 %

Ein Detail, das internationale Berichte oft auslassen: zur Peak-Zeit liegt die offizielle DeepSeek-API nun über mehreren Resellern (GMI Cloud, Novita und andere listen V4-Pro unter dem neuen Peak-Satz). Die Annahme „offizielle API ist immer der günstigste DeepSeek-Weg“ ist gebrochen.

03 · Qwen-Spezifikation und Lizenzschwellen

Merkmal Wert
Parameter2,4T gesamt, 95B aktiv pro Token (MoE, 512 Experten, 10 geroutet + 1 shared)
Kontext262.144 Token nativ (offener Checkpoint), erweiterbar auf ~1,01M; gehostetes Max standardmäßig 1M
KadenzPreview 2. August → API 3. August → Open Weights 12. August
API international2 USD / M Input, 6 USD / M Output
LizenzNicht Apache 2.0 — eigene „Qwen3.8-Max License“
BedeutungErster Max-Tier-Open-Weight von Alibaba; Qwen3.5 / 3.6 / 3.7 Max blieben API-only

Zwei harte Gates: verdient ein MaaS- oder AI-Work-Assistant-Geschäft in 12 aufeinanderfolgenden Monaten über 50 Millionen USD, braucht es eine separate kommerzielle Lizenz. Liegt ein Produkt bei 100 Millionen MAU oder 20 Millionen USD Monatsumsatz, muss der Modellname angezeigt werden. Ein geografisches Verbot für USA, EU, UK oder Südkorea steht nicht in der veröffentlichten Lizenz — dieses Gerücht ist falsch.

04 · GLM-5.3-Deltas ohne Drittprüfung

Zhipu-Selbsttest, keine unabhängige Drittwiederholung. Dieselbe 743B-Basis wie GLM-5.2; nur Post-Training-RL. Terminal-Bench 3.0 etwa 6× (4,6 % → 28,3 %).

Benchmark GLM-5.2 GLM-5.3 Delta
Terminal-Bench 3.04,6 %28,3 %+23,7 Punkte
DeepSWE46,2 %66,9 %+20,7 Punkte
ALE CLI23,8 %28,5 %+4,7 Punkte
CyberGym77,2 %84,5 %+7,3 Punkte
AutomationBench26,2 %48,2 %+22,0 Punkte

Auf Terminal-Bench 3.0 bleibt GLM-5.3 hinter GPT-5.6 Sol (34,6 %) und Claude Fable 5 (33,7 %). Das ist ein starkes Open-Weight-Ergebnis, kein Frontier-Sieg.

05 · Kalender 16. Juli bis 17. August

Datum Ereignis
16. Juli 2026Moonshot AI öffnet Kimi K3 (2,8T Parameter), US-Sicherheitsprüfung
30. Juli 2026OpenAI senkt GPT-5.6 Luna um 80 %
2.–3. August 2026Alibaba previewt, dann hostet Qwen3.8-Max als API
6.–7. August 2026Luna wird kostenloser Default mit unbegrenztem Text
10. August 2026Meta veröffentlicht Muse Glimmer (30B, Apache 2.0) und kündigt Open Weights für Muse Spark 1.2 an
12. August 2026Alibaba legt Qwen3.8-2.4T-A95B auf Hugging Face / ModelScope; xAI liefert Grok 4.6
13. August 2026DeepSeek-V4-Pro GA plus Preiserhöhung ab 17. August; Google senkt Gemini 3.7 Flash
14. August 2026Zhipu liefert GLM-5.3, dieselbe 743B-Basis wie GLM-5.2
17. August 2026, 00:00 PekingNeue DeepSeek-Preise gelten

06 · Drei Labore, drei Hebel

DeepSeek: Tageszeitpreis ist ein Kapazitätsproblem

Die flache Billigpreisung funktionierte, solange GPU-Kapazität mit der Nachfrage Schritt hielt. Sobald Nutzung exponentiell wuchs und Kapazität nicht, musste etwas explizit werden: Peak-Compute ist knapp, Last bitte selbst verschieben. Das ist Preissetzungsmacht, kein bloßes Margen-Einknicken.

Alibaba: Gewichte für Mindshare, Lizenz für die Decke

Der 2,4T-Checkpoint ist öffentlich, die Lizenz aber eine eigene Qwen3.8-Max License — nicht das permissive Apache 2.0 kleinerer Qwen-Modelle. Entwickler-Mindshare international, Preishebel bei den wenigen Firmen, die darauf ein konkurrierendes Inference-Geschäft bauen könnten. Das ist ein anderer Einsatz als Metas Muse Glimmer unter uneingeschränktem Apache 2.0.

Zhipu: keine neue Basis, größeres Post-Training

Dieselbe 743B-Grundlage, kein Retraining, etwa 6× auf Terminal-Bench 3.0 allein durch skaliertes Reinforcement Learning im Post-Training. Während Pretraining-Skalierung abnimmt, wird Post-Training-RL ein eigener Hebel mit niedrigerer Kostenschwelle als ein neues Foundation-Modell.

07 · Cross-Vendor-Preismatrix

Umrechnung etwa ¥7,15 / 1 USD.

Modell Input (pro 1M Token) Output (pro 1M Token) Open Weights?
DeepSeek V4-Pro (Peak)¥9,0 (~1,26 USD)¥27,0 (~3,78 USD)Nein
DeepSeek V4-Pro (Off-Peak)¥4,5 (~0,63 USD)¥13,5 (~1,89 USD)Nein
Qwen3.8-Max (internationale API)2,00 USD6,00 USDJa (eigene Lizenz)
OpenAI GPT-5.6 Luna0,20 USD1,20 USDNein
Claude Opus 5 (impliziert)~5,00 USD~25,00 USDNein

Kurz: nein, DeepSeek ist nicht mehr das eindeutig günstigste Frontier-Modell. Off-Peak-V4-Pro bleibt klar unter Claude Opus 5; internationales Qwen3.8-Max und Luna unterbieten DeepSeek Off-Peak in mindestens einer Dimension. „Chinesisch = billigst“ galt 2025 und Anfang 2026 — es ist keine sichere Annahme mehr.

08 · Ungeprüfte Claims

  • „1.100 %“ ist technisch korrekt, ohne Kontext irreführend. Nur Peak-Cache-Hit-Input. Output +350 %. Medien zitieren unterschiedliche Positionen, als wären sie die ganze Rechnung.
  • Zhenwu M890 / Pangu AL128: Berichte chinesischer Finanzmedien, dass Qwen3.8-Max auf Alibabas eigenen Chips und „Pangu AL128“-Superknoten läuft, sind von Alibabas eigener Technikdokumentation und Drittbenchmarks nicht unabhängig bestätigt.
  • GLM-5.3 und eine „ernste“ Cursor-Lücke: VentureBeat und Zhipu; technische Details fehlen. Vendor-Quelle, kein unabhängiges Audit.
  • MOFCOM-Gegensanktionen: Berichte über mögliche chinesische Exportkontrollen für KI/Halbleiter sind unbestätigte Gerüchte, keine amtliche Ankündigung.

09 · Zwei Fronten, ein Monat

Chinesische Finanzmedien nennen das Tempo „一周三更“ — drei Modellupdates pro Woche: DeepSeek, Alibaba, Zhipu, dazu Moonshot Kimi K3 (16. Juli, 2,8T) und zuvor MiniMax H3. Die Rahmung lautet oft: chinesische Open-Weight-Releases erzwingen eine globale Neubepreisung.

US-Labore spielen am Consumer-Ende das Gegenteil: OpenAI senkte Luna am 30. Juli um 80 % und machte das Modell am 6.–7. August zum kostenlosen Default mit unbegrenztem Text; Google lieferte am 13. August ein vergünstigtes Gemini 3.7 Flash. China öffnet Flaggschiff-Gewichte und staffelt den knappen Peak; die USA rennen am Consumer-Ende Richtung frei und billig. Beides sind echte Strategien, unterschiedliche Trichterteile.

Eine geopolitische Lesart der Qwen-Zeitwahl — Mindshare sichern, bevor Regulierung enger wird — ist Interpretation, kein belegter Fakt. Kimi K3 zog im Juli bereits US-Sicherheitsprüfung auf sich; das Zeitfenster fällt auf.

10 · Fünf Schritte: isolierter Mac und DSGVO

Produktionsrouting nicht auf dem Laptop umbauen, der bereits Firmenschlüssel hält. Eval-Logs und API-Keys sind personenbezogene bzw. geschäftskritische Daten: auf einem Alltags-Mac landen sie im selben Keychain wie private Konten. Ein tagesweise gemieteter Apple-Silicon-Knoten hält die Verarbeitung isoliert — relevant für DSGVO-Datenminimierung und Nachweis der Trennung.

  1. Peak-Fenster kartieren. Batch- und cache-freundliche Jobs aus 09:00–12:00 und 14:00–18:00 Pekingzeit schieben. Prüfen, ob die letzten 30 Tage eher dem 1,8×-Heavy-User oder der 1.100-%-Headline gleichen.
  2. Lizenzgates prüfen. 50-Millionen-USD-Regel für MaaS / AI Work Assistant und Namenspflicht bei 100 Millionen MAU oder 20 Millionen USD Monatsumsatz. Interner Einsatz ist meist frei; Inference weiterverkaufen ist nicht „frei, weil der Checkpoint heruntergeladen wurde“.
  3. Eine Task-Suite fahren. V4-Pro, Qwen3.8-Max und GLM-5.3 auf derselben Coding-Agent-Suite. Cache-Hit-Rate, Output-Anteil und Kosten pro erledigter Aufgabe loggen — nicht nur die öffentliche Preisliste.
  4. Auf gemietetem Mac isolieren. Tagesknoten über Bare-Metal-macOS-Preise wählen. Schlüssel und Eval-Logs bleiben außerhalb des Alltags-Keychains; die Verarbeitung ist vom Firmenlaptop getrennt.
  5. Knoten zerstören. Kostenmodell und Off-Peak-Cron exportieren, Miete löschen, damit der Versuch nicht in Produktion wandert.
# Off-Peak-Batchfenster Asia/Shanghai # Peak: 09:00-12:00 und 14:00-18:00 export TZ=Asia/Shanghai mkdir -p ~/llm-cost/{logs,prompts,reports} crontab -l

11 · FAQ

Ist DeepSeek nach der Preiserhöhung noch günstiger als GPT-5.6 oder Claude?
Off-Peak bleibt günstiger als Claude Opus 5, ist aber nicht mehr die eindeutig günstigste Option. GPT-5.6 Luna (0,20 / 1,20 USD pro Million Token) und internationales Qwen3.8-Max (2 / 6 USD) unterbieten DeepSeek Off-Peak in mindestens einer Dimension. DeepSeek bleibt relativ günstig für ein Frontier-Modell, nicht mehr das billigste.

Darf ich die offenen Gewichte von Qwen3.8-Max kostenlos in einem kommerziellen Produkt nutzen?
Ja für die meisten Fälle — private Projekte und interner Unternehmenseinsatz bleiben unberührt. Die Ausnahme gilt nur, wenn Sie ein MaaS- oder AI-Work-Assistant-Geschäft betreiben, das in 12 aufeinanderfolgenden Monaten über 50 Millionen USD verdient hat; dann braucht es eine separate kommerzielle Lizenz von Alibaba.

Ist Qwen3.8-Max für Nutzer in den USA, der EU oder dem Vereinigten Königreich gesperrt?
Nein. Das Gerücht ist falsch — die veröffentlichte Lizenz enthält keine geografische Beschränkung. Die Grenzen sind umsatzbasiert, nicht an Ihren Standort oder den Ihrer Nutzer gebunden. Auch das Südkorea-Gerücht ist falsch.

Was unterscheidet GLM-5.3 tatsächlich von GLM-5.2?
Auf Basismodell-Ebene nichts — dieselbe 743-Milliarden-Parameter-Grundlage. Die Gewinne (etwa 6× auf Terminal-Bench 3.0) kommen vollständig aus skaliertem Reinforcement Learning im Post-Training, ohne Retraining der Basis.

Wird Meta wirklich sein Flaggschiff öffnen — nicht nur Muse Glimmer?
Noch nicht. Muse Glimmer ist ein destilliertes 30B-Modell, nicht Metas echtes Flaggschiff. Offene Gewichte für das größere, geschlossene Muse Spark 1.2 wurden für „bald“ angekündigt; bis zum Redaktionsschluss sind sie nicht erschienen. Das ist eine Absichtserklärung, kein bestätigter Fakt.

12 · Messung auf gemietetem Mac

API-Keys auf dem privaten Laptop umzustellen oder einen einmaligen Vergleich auf einer Windows- oder Linux-Cloudbox zu fahren, reicht für ein Wegwerfskript. Für ein Kostenmodell, das Sie behalten wollen, ist das ein schlechter Fit: Firmgeheimnisse sitzen im selben Keychain wie Eval-Keys, ein Peak-Misschuss sprengt das Monatsbudget, generische Cloud-Images fehlen native macOS- und Apple-Silicon-Sidecar-Werkzeuge. Wer eine reproduzierbare Kostenaussage, Tagesabrechnung und echte Apple-Hardware will, nimmt einen isolierten Mac. Mieten vermeidet den Kauf für ein einwöchiges Preisexperiment und hält die Datenverarbeitung vom Alltagsgerät getrennt — für EU-Teams ein greifbarer DSGVO-Hebel. Siehe Bare-Metal-macOS-Preise und M4-Rechenknoten bestellen.

13 · Quellen

  • Offizielle DeepSeek-Preisankündigung, abgeglichen mit Wall Street CN, IT Home, AIGC.cn und V2EX-Diskussion
  • Offizielle Qwen-Repositories (Hugging Face / ModelScope) und South China Morning Post zu den Lizenzbedingungen
  • Offizielle GLM-5.3-Technikseite von Zhipu (Z.ai), plus VentureBeat und StableLearn
  • Offizieller Meta-AI-Research-Blog und VentureBeat zu Muse Glimmer
  • Chinesische Finanzmedien (Yicai / 第一财经, Sohu Finance) zu Tempo und Rahmung des Open-Weight-Zyklus

Preise, Lizenzbedingungen und Benchmarks entsprechen öffentlich verfügbaren Angaben zum Veröffentlichungsstand. Vor Weiterverwendung aktuelle offizielle Tarife und Lizenztexte prüfen. Als ungeprüft markierte Punkte (Chip-Claims, Cursor-Lücke, Exportkontroll-Gerüchte) sind nicht unabhängig bestätigt.