Техразбор Китай ~46% 2026-07-27 · данные на 25.07

OpenRouter июль 2026:
Токеномика против MMLU — кто реально владеет inference-трафиком

Для кого: platform-инженеры и lead'ы, которые в Cursor/OpenClaw до сих пор сидят на default model из MMLU 2025 и не могут объяснить billing-команде, почему дешёвый open weights бьёт Claude в рейтинге. Что внутри: срез на 25.07 — Mimo V2.5 (~1,4T token/день), китайские вендоры ~46%, гантельная структура volume≠quality, прогноз на август. Структура: таблицы Top-12 и vendor share, слой приложений, ценовая матрица, 5-шаговый fallback pipeline, FAQ×5.

Рейтинг OpenRouter июль 2026: доли вендоров и суточный объём токенов топ-моделей

См. также: Руководство API OpenRouter, Рейтинг июнь 2026, Недельные token-данные.

01 · Ключевые цифры (срез 25.07.2026)

  • Новый суточный лидер: Xiaomi Mimo V2.5 — ~1,4T token/день; DeepSeek V4 Flash (943,9B), Tencent Hy3 (590B). Семь из twelve — китайского происхождения.
  • Vendor shift: Китай суммарно ~46% (год назад <2%); US-трио ~30–36% (было ~70%).
  • DeepSeek как стабильный якорь: 16–18% vendor share — наименее волатильный; «чемпион месяца» меняется (фев. MiniMax M2.5, апр. MiMo-V2-Pro, июл. Mimo V2.5).
  • Hard data #1: DeepSeek V4 Flash input ~$0,05–0,14/M vs GPT-5.5 ~$5/M — разрыв ~35× движет миграцию на уровне unit economics, не нарратива.
Рейтинг OpenRouter измеряет, куда разработчики реально шлют paid API traffic — не кто набрал больше на synthetic benchmark. Именно этот слой billing-реальности отсутствует в большинстве сравнительных таблиц.

02 · Три системные ошибки при чтении рейтинга

  1. Token volume ≡ model quality: дешёвые MoE/open weights за Hermes Agent или roleplay-клиентами генерируют массу throughput, но в срезе «classification / hard inference» по dollar share почти не видны.
  2. Фокус только на #1 дня: 24.07 Claude Opus 4.8 ещё в top-10; 25.07 Ling 3.0 Flash вытеснил западные модели из top-12. Дневной ранг — плохой proxy долгосрочной стратегии.
  3. Игнор application layer: Kilo Code (~13%), OpenClaw (~9%), Hermes Agent (~45%) определяют, какие model_id реально вызываются — для agent coding смотрите параллельно openrouter.ai/apps.

03 · Top-12 по суточному token volume (25.07.2026)

#МодельВендорToken/день30 дней
1Mimo V2.5Xiaomi1,4T31,2T
2DeepSeek V4 FlashDeepSeek943,9B23,6T
3Hy3Tencent590B23,4T
4Nemotron 3 Ultra 550B (free)NVIDIA428,6B9T
5DeepSeek V4 ProDeepSeek413,7B11,6T
6GLM 5.2Z.ai316,7B13,3T
7MiniMax M3MiniMax262,5B15,1T
8Step 3.7 FlashStepFun204,8B5,9T
9Kimi K3Moonshot157,6B1,6T (новый)
10Ling 3.0 FlashInclusionAI128,3B417,3B
11Gemini 3 Flash PreviewGoogle106,3B4T
12Claude Sonnet 5Anthropic99,5B3,6T

Hard data #2: Kimi K3 — максимальный рост в июле; open weights ~1,4TB от 27.07. На Apple Silicon community quant (GGUF/MLX) обычно появляется за 2–4 недели — релевантно для self-host pipeline на арендованном Mac с M4.

04 · Vendor share: Китай 46% vs США 30–36%

ВендорРегионДоля token (7д, оценка)
DeepSeekCN16–18%
XiaomiCN8–18% (скачок Mimo V2.5, max volatility)
AnthropicUS10–15%
TencentCN8–13%
GoogleUS8–13%
Z.aiCN4–7%
OpenAIUS6–8%
NVIDIAUS~5%
MiniMax / Moonshot / Alibaba QwenCNпо 1–8%

Сдвиг следует price arithmetic: когда open weights «достаточно хорош» для 80% agent loop'ов и стоит в 35 раз дешевле, production traffic мигрирует рационально — независимо от PR-циклов frontier lab'ов.

05 · Гантельный рынок: throughput ≠ reasoning ceiling

По dollar share по типу задачи (не raw token count):

  • General chat 35,7%, agent workflows 30,4%, code 26,5%, data processing 7,5% — дешёвые модели забирают error-tolerant bulk inference.
  • В hard inference/classification: Claude Sonnet 4.6 и Opus 4.7 по 13,5%, GPT-5.5 11,6%; volume-чемпионы здесь почти отсутствуют.

Claude Opus 5 (24.07): FrontierBench v0.1 43,3% vs GPT-5.6 Sol 37,5%, pricing Opus tier $5/$25 per M — closed frontier сохраняет pricing power на high-stakes agent decisions.

Hard data #3: OpenRouter × a16z State of AI: creative roleplay — более половины open-source volume; enterprise-отчёты систематически недооценивают этот сегмент.

06 · Application layer: кто генерирует inference load

#ПриложениеТипДоля (оценка)
1Hermes AgentPersonal agent / CLI~45%
2Kilo CodeCoding agent~13%
3OpenClawUniversal agent~9%
4Claude CodeCoding agent~6%
5–10Descript / pi / Lemonade / ISEKAI ZERO / Janitor AI / ClineContent / agent / roleplay1,7–4,5%

Линия Cline → Roo Code → Kilo Code — три форка одной code lineage; «внук» обгоняет предка по traffic — first-mover advantage в agent-экосистеме хрупок.

07 · Ценовая матрица (decision matrix)

МодельInput/MOutput/MПозиционирование
DeepSeek V4 Flash~$0,05–0,14~$0,24–0,28Price/perf king, agentic coding
Nemotron 3 Ultra$0,42 (free tier)$2,61US open weights, NVIDIA stack
GLM 5.2$0,45$3,31Open source ближе к Opus planning
Kimi K3~$3~$151,4TB weights, frontier-class
Claude Opus 5$5 (fast $10)$25 (fast $50)Closed frontier, hard inference

08 · Прогноз на август (траектория июля)

  1. Китайский open weights share вероятно к 50% к концу года, если US-вендоры не режут цены агрессивно.
  2. «Чемпион месяца» продолжит меняться — price war между Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax, Moonshot.
  3. Anthropic может вывести более дешёвые tier'ы; Opus 5 — уже четвёртый flagship за два месяца.
  4. Community quant Kimi K3 ускорит self-hosting; краткосрочно выигрывают inference cloud'ы (Fireworks AI и аналоги).
  5. Security/compliance: OpenAI sandbox escape поднимает вес vendor security track record в enterprise procurement.

09 · Рекомендации по ролям

Инди / малые команды

  • OpenRouter как pre-prod sandbox — ок; latency из EU ~180–250ms, нет локального invoicing — для prod оцените compliance gateway.
  • Coding: тест DeepSeek V4 Flash + GLM 5.2; hard steps → Claude Opus 5 / GPT-5.6 — hybrid routing снижает burn rate.

Enterprise tech lead

  • Собственный eval set (acceptance rate, error rate, P95 под реальной нагрузкой) до решений по рейтингу.
  • Layered routing: chat/creative на дешёвом open, classification/high-risk agent на closed frontier.
  • Vendor security history в scorecard — sandbox escape показал, что риск materialized.

10 · Пять шагов: слоистый роутинг OpenRouter

  1. Изолированная среда: см. API guide, OPENROUTER_API_KEY только на арендованном Mac.
  2. Четыре task class: smalltalk/creative, daily code, multi-step agent planning, hard inference — отдельный model_id tier.
  3. Fallback chain: primary deepseek/deepseek-v4-flash, fallback anthropic/claude-opus-5 или openai/gpt-5.6-sol.
  4. 20-step agent benchmark: USD/task, P95 latency, tool-call success — данные вместо ranking intuition.
  5. Weekly check openrouter.ai/rankings: обновить routing table, архивировать benchmark, revoke test keys.
# OpenRouter fallback — фрагмент request body { "models": [ "deepseek/deepseek-v4-flash", "z-ai/glm-5.2", "anthropic/claude-opus-5" ], "route": "fallback", "messages": [{ "role": "user", "content": "Agent task..." }] }

11 · Почему multi-model эксперименты лучше на арендованном Mac

Гонять Cursor, OpenClaw и Hermes Agent на production MacBook с дюжиной OpenRouter model_id — типичные проблемы: разбросанные env vars, agent permissions сложно отозвать, Xcode indexing под нагрузкой, thermal throttle на Apple Silicon — P95 latency measurements становятся noise, а key leak бьёт по всем проектам.

На изолированном macOS по суточной аренде вы настраиваете keys, fallback chains и 20-step benchmark; после валидации cost curve мигрируете audited config обратно. Production machine не несёт API experiment window; инстанс уничтожается — меньше attack surface.

Для стабильных build'ов, полного Apple ecosystem debug (Instruments, native toolchain) и предсказуемого 7×24 remote node аренда Mac mini M4 часто выгоднее старого Intel или Linux VPS для multi-agent workload — без capex на железо. На M4 unified memory bandwidth и Neural Engine дают предсказуемый latency profile при локальном quant inference, если вы тестируете community weights Kimi K3 параллельно с cloud routing.

12 · FAQ×5

Рейтинг — качество или объём?

Оплаченный token volume, не бенчмарки. Дешёвые модели за high-traffic apps могут доминировать.

Кто первый в июле 2026?

На 25.07: Xiaomi Mimo V2.5 ~1,4T token/день.

Доля китайских моделей?

~46%; US-трио ~30–36%.

Как Kimi K3?

Новый ~157,6B/день, max рост; open weights с 27.07.

Как верифицировать перед публикацией?

openrouter.ai/rankings — обновить top-10 и дату «данные на».

Источники: официальный рейтинг OpenRouter и публичные зеркала, срез 25.07.2026. Дневные значения плавают — проверяйте live data перед цитированием.