OpenRouter Juli 2026:
Wer gewinnt den Token-Krieg — und warum die Rangliste täuscht
Zielgruppe: Platform-Engineers und Tech-Leads, die in Cursor oder OpenClaw noch Default-Modelle aus veralteten MMLU-Tabellen nutzen und der Finanzabteilung keinen belastbaren Routing-Report liefern können. Ergebnis: Datenstand 25.07.2026 — Mimo V2.5 an der Spitze (~1,4T Token/Tag), chinesische Anbieter ~46 %, Hantel-Markt (Volumen ≠ Qualität), August-Prognose. Struktur: Top-12-Tabelle, Anbieteranteile, App-Schicht, Preismatrix, 5-Schritte-Routing, FAQ×5.
Inhaltsverzeichnis
Weiterführend: OpenRouter API-Anleitung, Juni-2026-Ranking, Wöchentliche Token-Abrechnung.
01 · Kerndaten (Stand 25.07.2026)
- Tages-Spitze neu besetzt: Xiaomi Mimo V2.5 mit ca. 1,4 Billionen Token/Tag; DeepSeek V4 Flash (943,9B) und Tencent Hy3 (590B) folgen. Sieben der Top-12 stammen aus China.
- Anbieter-Verschiebung: China gesamt ca. 46 % (vor einem Jahr <2 %); US-Trio ca. 30–36 % (vor einem Jahr ~70 %).
- DeepSeek als stabiler Anker: Einzelanbieter-Anteil 16–18 % am konstantesten; der „Monats-Champion“ wechselt häufig (Feb. MiniMax M2.5, Apr. MiMo-V2-Pro, Jul. Mimo V2.5).
- Harte Kennzahl #1: DeepSeek V4 Flash Eingabe ca. $0,05–0,14/M vs. GPT-5.5 ca. $5/M — Faktor ~35× Preisdifferenz treibt die Migration, nicht Marketing.
Das OpenRouter-Ranking misst, wohin Entwickler tatsächlich API-Guthaben schicken — nicht, wer den höchsten MMLU-Score hat. Genau dieser Unterschied ist die Entscheidungsgrundlage für belastbares Routing.
02 · Drei Auswahlfehler trotz aktueller Rankings
- Token-Volumen mit Modellqualität verwechseln: Günstige Open-Weights hinter Hermes Agent oder Roleplay-Apps generieren Massen-Traffic, tauchen aber bei „Klassifikation/komplexe Inferenz“ nach Dollar-Anteil kaum auf.
- Nur den Tages-#1 betrachten: Am 24.07. war Claude Opus 4.8 noch Top-10; am 25.07. verdrängte Ling 3.0 Flash mehrere West-Modelle aus der Top-12. Tagesrang ≠ langfristige Strategie.
- App-Schicht ignorieren: Kilo Code (~13 %), OpenClaw (~9 %) und Hermes Agent (~45 %) bestimmen, welche Modelle in der Praxis aufgerufen werden — für Agent-Coding sollten Sie openrouter.ai/apps parallel lesen.
03 · Top-12 nach Tages-Token (25.07.2026)
| Rang | Modell | Anbieter | Token/Tag | 30-Tage-Summe |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4T | 31,2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9B | 23,6T |
| 3 | Hy3 | Tencent | 590B | 23,4T |
| 4 | Nemotron 3 Ultra 550B (kostenlos) | NVIDIA | 428,6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7B | 11,6T |
| 6 | GLM 5.2 | Z.ai | 316,7B | 13,3T |
| 7 | MiniMax M3 | MiniMax | 262,5B | 15,1T |
| 8 | Step 3.7 Flash | StepFun | 204,8B | 5,9T |
| 9 | Kimi K3 | Moonshot | 157,6B | 1,6T (neu) |
| 10 | Ling 3.0 Flash | InclusionAI | 128,3B | 417,3B |
| 11 | Gemini 3 Flash Preview | 106,3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5B | 3,6T |
Harte Kennzahl #2: Kimi K3 debütierte im Juli mit der höchsten Wachstumsrate; Open-Weights (~1,4 TB) am 27.07. — Community-Quantisierung typischerweise in 2–4 Wochen relevant für Self-Hosting-Teams.
04 · Anbieteranteile: China 46 % vs. USA 30–36 %
| Anbieter | Region | Token-Anteil (7-Tage, ca.) |
|---|---|---|
| DeepSeek | CN | 16–18 % |
| Xiaomi | CN | 8–18 % (Mimo V2.5-Sprung, höchste Volatilität) |
| Anthropic | US | 10–15 % |
| Tencent | CN | 8–13 % |
| US | 8–13 % | |
| Z.ai | CN | 4–7 % |
| OpenAI | US | 6–8 % |
| NVIDIA | US | ~5 % |
| MiniMax / Moonshot / Alibaba Qwen | CN | je 1–8 % |
Die Verschiebung folgt Preisarithmetik: Wenn Open-Weights-Modelle für 80 % der Agent-Workflows ausreichen und 35× günstiger sind, wandert Produktions-Traffic rational — unabhängig von Pressemitteilungen.
05 · Hantel-Markt: hohes Volumen ≠ hohe Qualität
Nach Dollar-Anteil pro Aufgabentyp (nicht Token-Menge) zeigt sich eine Hantel-Struktur:
- Allgemeiner Dialog 35,7 %, Agent-Workflows 30,4 %, Code 26,5 %, Datenverarbeitung 7,5 % — günstige Modelle bedienen fehlertolerante Massen-Tasks.
- Bei schwerer Inferenz/Klassifikation: Claude Sonnet 4.6 und Opus 4.7 je 13,5 %, GPT-5.5 11,6 %; Volumen-Champions fehlen hier fast vollständig.
Claude Opus 5 (24.07.): FrontierBench v0.1 43,3 % vs. GPT-5.6 Sol 37,5 %, Preis Opus-Tier $5/$25 pro M — Premium bleibt bei High-Stakes-Tasks wirtschaftlich.
Harte Kennzahl #3: OpenRouter × a16z „State of AI“: Roleplay-Szenarien machen über die Hälfte des Open-Source-Volumens aus — Enterprise-Berichte unterschätzen diesen Anteil systematisch.
06 · App-Schicht: Agent-Clients treiben das Volumen
| Rang | App | Typ | Anteil (ca.) |
|---|---|---|---|
| 1 | Hermes Agent | Persönlicher Agent / CLI | ~45 % |
| 2 | Kilo Code | Coding-Agent | ~13 % |
| 3 | OpenClaw | Universal-Agent | ~9 % |
| 4 | Claude Code | Coding-Agent | ~6 % |
| 5–10 | Descript / pi / Lemonade / ISEKAI ZERO / Janitor AI / Cline | Content / Agent / Roleplay | 1,7–4,5 % |
Cline → Roo Code → Kilo Code teilen eine Code-Linie; die jüngste Fork-Generation überholt den Vorgänger — First-Mover-Vorteil in der Agent-Ökologie ist fragil.
07 · Preismatrix (Entscheidungsgrundlage)
| Modell | Input/M | Output/M | Positionierung |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0,05–0,14 | ~$0,24–0,28 | Preis-Leistung, Agentic Coding |
| Nemotron 3 Ultra | $0,42 (Free-Tier) | $2,61 | US Open Weights, NVIDIA-Stack |
| GLM 5.2 | $0,45 | $3,31 | Open Source nahe Opus-Planungsqualität |
| Kimi K3 | ~$3 | ~$15 | 1,4 TB Open Weights, Frontier-Niveau |
| Claude Opus 5 | $5 (Fast $10) | $25 (Fast $50) | Closed Frontier, schwere Inferenz |
08 · August-Prognose (aus Juli-Trajektorie)
- China Open-Weights-Anteil steigt wahrscheinlich Richtung 50 %, sofern US-Anbieter nicht massiv senken.
- Monats-Champion wechselt weiter — Preiskampf zwischen Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax, Moonshot hält an.
- Anthropic könnte günstigere Tiers einführen; Opus 5 ist bereits die vierte Flaggschiff-Generation in zwei Monaten.
- Kimi K3 Community-Quantisierung beschleunigt Self-Hosting; kurzfristig profitieren vor allem Inference-Clouds (z. B. Fireworks AI).
- Sicherheit/Compliance: OpenAI-Sandbox-Escape-Ereignis erhöht Gewicht von Anbieter-Sicherheitsbilanz in EU-Beschaffung (DSGVO-Kontext).
09 · Empfehlungen nach Rolle
Einzelentwickler / kleine Teams
- OpenRouter als Pre-Production-Sandbox ist sinnvoll; Latenz aus DE ca. 180–250 ms, keine EU-Rechnung — für Produktion Compliance-Gateways prüfen.
- Coding: DeepSeek V4 Flash + GLM 5.2 testen; harte Schritte auf Claude Opus 5 / GPT-5.6 — Hybrid-Routing senkt Kosten messbar.
Enterprise Tech Lead
- Eigenes Eval-Set (Akzeptanzrate, Fehlerquote, P95 unter Last) vor Ranking-Entscheidungen — Token-Rang ist Input, nicht Output.
- Schicht-Routing: Smalltalk/Kreativ günstig, Klassifikation/High-Risk-Agent auf Closed Frontier.
- Anbieter-Sicherheitsprotokoll in Scorecard aufnehmen — Sandbox-Escape zeigt, dass Risiko real ist.
10 · Fünf Schritte: Schicht-Routing auf OpenRouter
- Isolierte Umgebung: Siehe API-Anleitung,
OPENROUTER_API_KEYnur auf Miet-Mac, nicht auf dem Daily Driver. - Vier Task-Klassen taggen: Smalltalk/Kreativ, Daily Code, Agent-Mehrschritt, komplexe Inferenz — je ein model_id-Tier.
- Fallback-Kette: Primär
deepseek/deepseek-v4-flash, Fallbackanthropic/claude-opus-5oderopenai/gpt-5.6-sol. - 20-Schritt-Agent-Benchmark: USD/Task, P95-Latenz, Tool-Call-Erfolg — Daten statt Ranking-Intuition.
- Wöchentlich gegen openrouter.ai/rankings prüfen: Routing-Tabelle aktualisieren, Benchmark archivieren, Test-Keys widerrufen.
# OpenRouter Fallback — Request-Body-Ausschnitt
{
"models": [
"deepseek/deepseek-v4-flash",
"z-ai/glm-5.2",
"anthropic/claude-opus-5"
],
"route": "fallback",
"messages": [{ "role": "user", "content": "Agent-Aufgabe..." }]
}11 · Warum Multi-Modell-Tests besser auf gemietetem Mac laufen
Auf dem Produktiv-Mac gleichzeitig Cursor, OpenClaw und Hermes Agent mit einem Dutzend OpenRouter-Model-IDs zu testen, erzeugt typische Probleme: verstreute Umgebungsvariablen, schwer widerrufbare Agent-Berechtigungen, Xcode-Indexierung unter Last und Thermalthrottling — Latenz-Messungen werden unzuverlässig.
Auf einem tageweise gemieteten, isolierten macOS konfigurieren Sie Keys, Fallback-Ketten und 20-Schritt-Benchmarks; nach validierter Routing-Tabelle und Kostenkurve migrieren Sie die geprüfte Konfiguration zurück. Der Daily Driver trägt kein API-Experiment-Risiko; die Instanz wird nach dem Test zerstört — kleinere Key-Leak-Fläche, DSGVO-freundlicher für Kundendaten.
Für stabile Builds, vollständige Apple-Ökosystem-Debug-Tools und planbare 7×24-Remote-Knoten ist Mac mini M4 Tagesmiete oft günstiger als alte Intel-Hardware oder Linux-VPS für Multi-Agent-Workloads — ohne Vorabinvestition in Hardware.
12 · FAQ×5
Misst OpenRouter Qualität oder Volumen?
Bezahltes Token-Volumen, keine Benchmarks. Günstige Modelle hinter High-Traffic-Apps können dominieren.
Wer führt im Juli 2026?
Stand 25.07.: Xiaomi Mimo V2.5 mit ca. 1,4T Token/Tag.
Wie hoch ist der China-Anteil?
Ca. 46 % aggregiert; US-Trio ca. 30–36 %.
Wie performt Kimi K3?
Neu ~157,6B/Tag, stärkstes Wachstum; Open Weights ab 27.07. beobachten.
Wie Daten vor Veröffentlichung prüfen?
openrouter.ai/rankings — Top-10 und „Datenstand“-Datum im Artikel aktualisieren.
Quellen: OpenRouter offizielles Ranking und öffentliche Spiegel, Stand 25.07.2026. Tageswerte schwanken — vor Zitaten Live-Daten prüfen.