OpenRouter июль 2026:
Токеномика против MMLU — кто реально владеет inference-трафиком
Для кого: platform-инженеры и lead'ы, которые в Cursor/OpenClaw до сих пор сидят на default model из MMLU 2025 и не могут объяснить billing-команде, почему дешёвый open weights бьёт Claude в рейтинге. Что внутри: срез на 25.07 — Mimo V2.5 (~1,4T token/день), китайские вендоры ~46%, гантельная структура volume≠quality, прогноз на август. Структура: таблицы Top-12 и vendor share, слой приложений, ценовая матрица, 5-шаговый fallback pipeline, FAQ×5.
Содержание
См. также: Руководство API OpenRouter, Рейтинг июнь 2026, Недельные token-данные.
01 · Ключевые цифры (срез 25.07.2026)
- Новый суточный лидер: Xiaomi Mimo V2.5 — ~1,4T token/день; DeepSeek V4 Flash (943,9B), Tencent Hy3 (590B). Семь из twelve — китайского происхождения.
- Vendor shift: Китай суммарно ~46% (год назад <2%); US-трио ~30–36% (было ~70%).
- DeepSeek как стабильный якорь: 16–18% vendor share — наименее волатильный; «чемпион месяца» меняется (фев. MiniMax M2.5, апр. MiMo-V2-Pro, июл. Mimo V2.5).
- Hard data #1: DeepSeek V4 Flash input ~$0,05–0,14/M vs GPT-5.5 ~$5/M — разрыв ~35× движет миграцию на уровне unit economics, не нарратива.
Рейтинг OpenRouter измеряет, куда разработчики реально шлют paid API traffic — не кто набрал больше на synthetic benchmark. Именно этот слой billing-реальности отсутствует в большинстве сравнительных таблиц.
02 · Три системные ошибки при чтении рейтинга
- Token volume ≡ model quality: дешёвые MoE/open weights за Hermes Agent или roleplay-клиентами генерируют массу throughput, но в срезе «classification / hard inference» по dollar share почти не видны.
- Фокус только на #1 дня: 24.07 Claude Opus 4.8 ещё в top-10; 25.07 Ling 3.0 Flash вытеснил западные модели из top-12. Дневной ранг — плохой proxy долгосрочной стратегии.
- Игнор application layer: Kilo Code (~13%), OpenClaw (~9%), Hermes Agent (~45%) определяют, какие model_id реально вызываются — для agent coding смотрите параллельно openrouter.ai/apps.
03 · Top-12 по суточному token volume (25.07.2026)
| # | Модель | Вендор | Token/день | 30 дней |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4T | 31,2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9B | 23,6T |
| 3 | Hy3 | Tencent | 590B | 23,4T |
| 4 | Nemotron 3 Ultra 550B (free) | NVIDIA | 428,6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7B | 11,6T |
| 6 | GLM 5.2 | Z.ai | 316,7B | 13,3T |
| 7 | MiniMax M3 | MiniMax | 262,5B | 15,1T |
| 8 | Step 3.7 Flash | StepFun | 204,8B | 5,9T |
| 9 | Kimi K3 | Moonshot | 157,6B | 1,6T (новый) |
| 10 | Ling 3.0 Flash | InclusionAI | 128,3B | 417,3B |
| 11 | Gemini 3 Flash Preview | 106,3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5B | 3,6T |
Hard data #2: Kimi K3 — максимальный рост в июле; open weights ~1,4TB от 27.07. На Apple Silicon community quant (GGUF/MLX) обычно появляется за 2–4 недели — релевантно для self-host pipeline на арендованном Mac с M4.
04 · Vendor share: Китай 46% vs США 30–36%
| Вендор | Регион | Доля token (7д, оценка) |
|---|---|---|
| DeepSeek | CN | 16–18% |
| Xiaomi | CN | 8–18% (скачок Mimo V2.5, max volatility) |
| Anthropic | US | 10–15% |
| Tencent | CN | 8–13% |
| US | 8–13% | |
| Z.ai | CN | 4–7% |
| OpenAI | US | 6–8% |
| NVIDIA | US | ~5% |
| MiniMax / Moonshot / Alibaba Qwen | CN | по 1–8% |
Сдвиг следует price arithmetic: когда open weights «достаточно хорош» для 80% agent loop'ов и стоит в 35 раз дешевле, production traffic мигрирует рационально — независимо от PR-циклов frontier lab'ов.
05 · Гантельный рынок: throughput ≠ reasoning ceiling
По dollar share по типу задачи (не raw token count):
- General chat 35,7%, agent workflows 30,4%, code 26,5%, data processing 7,5% — дешёвые модели забирают error-tolerant bulk inference.
- В hard inference/classification: Claude Sonnet 4.6 и Opus 4.7 по 13,5%, GPT-5.5 11,6%; volume-чемпионы здесь почти отсутствуют.
Claude Opus 5 (24.07): FrontierBench v0.1 43,3% vs GPT-5.6 Sol 37,5%, pricing Opus tier $5/$25 per M — closed frontier сохраняет pricing power на high-stakes agent decisions.
Hard data #3: OpenRouter × a16z State of AI: creative roleplay — более половины open-source volume; enterprise-отчёты систематически недооценивают этот сегмент.
06 · Application layer: кто генерирует inference load
| # | Приложение | Тип | Доля (оценка) |
|---|---|---|---|
| 1 | Hermes Agent | Personal agent / CLI | ~45% |
| 2 | Kilo Code | Coding agent | ~13% |
| 3 | OpenClaw | Universal agent | ~9% |
| 4 | Claude Code | Coding agent | ~6% |
| 5–10 | Descript / pi / Lemonade / ISEKAI ZERO / Janitor AI / Cline | Content / agent / roleplay | 1,7–4,5% |
Линия Cline → Roo Code → Kilo Code — три форка одной code lineage; «внук» обгоняет предка по traffic — first-mover advantage в agent-экосистеме хрупок.
07 · Ценовая матрица (decision matrix)
| Модель | Input/M | Output/M | Позиционирование |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0,05–0,14 | ~$0,24–0,28 | Price/perf king, agentic coding |
| Nemotron 3 Ultra | $0,42 (free tier) | $2,61 | US open weights, NVIDIA stack |
| GLM 5.2 | $0,45 | $3,31 | Open source ближе к Opus planning |
| Kimi K3 | ~$3 | ~$15 | 1,4TB weights, frontier-class |
| Claude Opus 5 | $5 (fast $10) | $25 (fast $50) | Closed frontier, hard inference |
08 · Прогноз на август (траектория июля)
- Китайский open weights share вероятно к 50% к концу года, если US-вендоры не режут цены агрессивно.
- «Чемпион месяца» продолжит меняться — price war между Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax, Moonshot.
- Anthropic может вывести более дешёвые tier'ы; Opus 5 — уже четвёртый flagship за два месяца.
- Community quant Kimi K3 ускорит self-hosting; краткосрочно выигрывают inference cloud'ы (Fireworks AI и аналоги).
- Security/compliance: OpenAI sandbox escape поднимает вес vendor security track record в enterprise procurement.
09 · Рекомендации по ролям
Инди / малые команды
- OpenRouter как pre-prod sandbox — ок; latency из EU ~180–250ms, нет локального invoicing — для prod оцените compliance gateway.
- Coding: тест DeepSeek V4 Flash + GLM 5.2; hard steps → Claude Opus 5 / GPT-5.6 — hybrid routing снижает burn rate.
Enterprise tech lead
- Собственный eval set (acceptance rate, error rate, P95 под реальной нагрузкой) до решений по рейтингу.
- Layered routing: chat/creative на дешёвом open, classification/high-risk agent на closed frontier.
- Vendor security history в scorecard — sandbox escape показал, что риск materialized.
10 · Пять шагов: слоистый роутинг OpenRouter
- Изолированная среда: см. API guide,
OPENROUTER_API_KEYтолько на арендованном Mac. - Четыре task class: smalltalk/creative, daily code, multi-step agent planning, hard inference — отдельный
model_idtier. - Fallback chain: primary
deepseek/deepseek-v4-flash, fallbackanthropic/claude-opus-5илиopenai/gpt-5.6-sol. - 20-step agent benchmark: USD/task, P95 latency, tool-call success — данные вместо ranking intuition.
- Weekly check openrouter.ai/rankings: обновить routing table, архивировать benchmark, revoke test keys.
# OpenRouter fallback — фрагмент request body
{
"models": [
"deepseek/deepseek-v4-flash",
"z-ai/glm-5.2",
"anthropic/claude-opus-5"
],
"route": "fallback",
"messages": [{ "role": "user", "content": "Agent task..." }]
}11 · Почему multi-model эксперименты лучше на арендованном Mac
Гонять Cursor, OpenClaw и Hermes Agent на production MacBook с дюжиной OpenRouter model_id — типичные проблемы: разбросанные env vars, agent permissions сложно отозвать, Xcode indexing под нагрузкой, thermal throttle на Apple Silicon — P95 latency measurements становятся noise, а key leak бьёт по всем проектам.
На изолированном macOS по суточной аренде вы настраиваете keys, fallback chains и 20-step benchmark; после валидации cost curve мигрируете audited config обратно. Production machine не несёт API experiment window; инстанс уничтожается — меньше attack surface.
Для стабильных build'ов, полного Apple ecosystem debug (Instruments, native toolchain) и предсказуемого 7×24 remote node аренда Mac mini M4 часто выгоднее старого Intel или Linux VPS для multi-agent workload — без capex на железо. На M4 unified memory bandwidth и Neural Engine дают предсказуемый latency profile при локальном quant inference, если вы тестируете community weights Kimi K3 параллельно с cloud routing.
12 · FAQ×5
Рейтинг — качество или объём?
Оплаченный token volume, не бенчмарки. Дешёвые модели за high-traffic apps могут доминировать.
Кто первый в июле 2026?
На 25.07: Xiaomi Mimo V2.5 ~1,4T token/день.
Доля китайских моделей?
~46%; US-трио ~30–36%.
Как Kimi K3?
Новый ~157,6B/день, max рост; open weights с 27.07.
Как верифицировать перед публикацией?
openrouter.ai/rankings — обновить top-10 и дату «данные на».
Источники: официальный рейтинг OpenRouter и публичные зеркала, срез 25.07.2026. Дневные значения плавают — проверяйте live data перед цитированием.