OpenRouter 2026年7月大模型排行榜深度解析:
谁在真正赢下这场 AI 流量战争?
谁遇到什么问题?仍在用几个月前的 MMLU 印象选默认模型的 Cursor/OpenClaw 开发者,以及需要向团队解释「为什么便宜开源模型霸榜」的技术负责人。本文给什么?基于 OpenRouter 截至 7 月 25 日的真实 Token 用量:Mimo V2.5 登顶、中国厂商合计约 46% 份额、用量与质量的「哑铃型」分层,以及 8 月趋势与分层路由实操。结构包含:Top12 与厂商份额表、应用层 TOP10、价格对照、五步路由清单、FAQ×5。
📋 本文目录
延伸阅读:OpenRouter 保姆级接入教程、6 月排行榜与中国模型接管、周 Token 账单真相。
01 · 核心结论(数据截止 2026-07-25)
- 单日 Token 榜首易主:小米 Mimo V2.5 约 1.4T Token/天 登顶;DeepSeek V4 Flash(943.9B)、腾讯 Hy3(590B)紧随其后。前十名中中国模型占七席。
- 厂商份额历史性迁移:中国厂商合计约 46%(一年前 <2%);美国 OpenAI+Anthropic+Google 合计约 30%–36%(一年前约 70%)。
- DeepSeek 仍是「最稳的第一」:单一厂商份额约 16%–18% 最稳定;但「月度冠军模型」频繁轮换——2 月 MiniMax M2.5、4 月 MiMo-V2-Pro、7 月 Mimo V2.5。
- 硬核数据 #1:DeepSeek V4 Flash 输入约 $0.05–0.14/M vs GPT-5.5 约 $5/M——价差约 35 倍,是流量迁移的核心数学,而非叙事。
OpenRouter 排行榜测的是「开发者真金白银把请求发到了谁家」,不是「谁最聪明」。这个反差正是本文与大多数竞品表格文的差异化角度。
02 · 三大选型痛点:为什么「看榜」仍会选错模型?
排行榜是决策输入,不是决策本身。Mac 开发者与 AI 团队在 7 月最常踩的三类坑:
- 把 Token 用量等同于能力:廉价模型挂在 Hermes Agent、角色扮演等高流量应用后,单日用量可以碾压闭源旗舰,但在「分类/复杂推理」消费份额维度几乎查无此模型。
- 只看瞬时 #1 不看持续前排:榜单每日波动(7/24 Claude Opus 4.8 还在前十,7/25 被 Ling 3.0 Flash 挤出前 12)。月度冠军≠长期护城河。
- 忽视应用层与模型层的分裂:编程 Agent(Kilo Code ~13%)、角色扮演(Janitor AI、ISEKAI ZERO)消耗巨大开源流量,却极少出现在企业 AI 报道里——若你的场景是 Agent 编程,应同时看 openrouter.ai/apps。
03 · 7月模型 Token 用量 Top 12(日用量,截至 7/25)
| 排名 | 模型 | 厂商 | 单日 Token | 近30天累计 |
|---|---|---|---|---|
| 1 | Mimo V2.5 | 小米 | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | 腾讯 | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B(免费) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | 智谱 Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | 阶跃星辰 | 204.8B | 5.9T |
| 9 | Kimi K3 | 月之暗面 | 157.6B | 1.6T(新上榜) |
| 10 | Ling 3.0 Flash | 蚂蚁 InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
硬核数据 #2:Kimi K3 7 月新上榜、涨势最猛;7 月 27 日开源权重(约 1.4TB)发布后,社区量化版本通常 2–4 周内出现,届时中小团队才真正能用上。
04 · 厂商份额:中国 46% vs 美国 30%–36%
| 厂商 | 归属 | Token 份额(约,7天口径) |
|---|---|---|
| DeepSeek | 🇨🇳 | 16%–18% |
| 小米 | 🇨🇳 | 8%–18%(Mimo V2.5 暴涨,波动最大) |
| Anthropic | 🇺🇸 | 10%–15% |
| 腾讯 | 🇨🇳 | 8%–13% |
| 🇺🇸 | 8%–13% | |
| 智谱 Z.ai | 🇨🇳 | 4%–7% |
| OpenAI | 🇺🇸 | 6%–8% |
| NVIDIA | 🇺🇸 | ~5% |
| MiniMax / 月之暗面 / 阿里 Qwen | 🇨🇳 | 各 1%–8% |
这不是情绪驱动的变化,而是价格逻辑:当中国开源模型在多数任务上「够用」,且价差达数十倍,理性开发者会用脚投票。
05 · 榜单另一面:用量高 ≠ 质量高
按任务类型的消费金额占比(而非 Token 量)看,市场呈现「哑铃型」结构:
- 通用对话 35.7%、Agent 工作流 30.4%、代码 26.5%、数据处理 7.5%——廉价开源模型吃下大量高容错「跑量」任务。
- 在「分类/复杂推理」难任务维度:Claude Sonnet 4.6 与 Claude Opus 4.7 各 13.5% 消费份额并列第一,GPT-5.5 11.6% 第三;总量榜霸屏的廉价模型几乎缺席。
7 月 24 日 Anthropic 发布 Claude Opus 5:FrontierBench v0.1 43.3%(GPT-5.6 Sol 37.5%),定价维持 Opus 档 $5/$25/M——「我贵,但我值这个价」的闭源打法依然有效。
硬核数据 #3:OpenRouter × a16z《State of AI》显示,创意角色扮演场景占开源模型总用量一半以上——只看企业报道会错过「看不见的半壁江山」。
06 · 应用层秘密:编程 Agent 称王,角色扮演是隐藏市场
| 排名 | 应用 | 类型 | 份额(约) |
|---|---|---|---|
| 1 | Hermes Agent | 个人智能体/CLI | ~45% |
| 2 | Kilo Code | 编程 Agent | ~13% |
| 3 | OpenClaw | 通用 Agent | ~9% |
| 4 | Claude Code | 编程 Agent | ~6% |
| 5–10 | Descript / pi / Lemonade / ISEKAI ZERO / Janitor AI / Cline | 内容/Agent/角色扮演 | 1.7%–4.5% |
Cline → Roo Code → Kilo Code 是同一代码血统的三次分叉,「孙子辈」Kilo Code 流量已反超祖辈 Cline——开源编程 Agent 生态迭代极快,先发优势并不牢固。
07 · 价格与定位对照(选型决策矩阵)
| 模型 | 输入/M | 输出/M | 定位 |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05–0.14 | ~$0.24–0.28 | 性价比之王,Agentic Coding 首选 |
| Nemotron 3 Ultra | $0.42(有免费版) | $2.61 | 美系全开源,NVIDIA 生态 |
| GLM 5.2 | $0.45 | $3.31 | 开源里最接近 Opus 规划质量 |
| Kimi K3 | ~$3 | ~$15 | 1.4TB 开源权重,闭源级能力 |
| Claude Opus 5 | $5(快速档 $10) | $25(快速档 $50) | 闭源旗舰,难任务定价权 |
08 · 8月趋势预测(基于 7 月轨迹)
- 中国开源模型合计份额大概率继续爬升,年内有望突破 50%,除非美国厂商大幅降价。
- 「月度冠军模型」宝座继续易主——小米、DeepSeek、腾讯、智谱、MiniMax、月之暗面价格战不会放缓。
- Anthropic 可能推出更平价档位抢用量,Opus 5 已是两个月内第四款旗舰(Mythos 5、Fable 5、Sonnet 5 之后)。
- Kimi K3 1.4TB 权重将迎来社区量化;当前主要受益方仍是大厂与推理云(如 Fireworks AI)。
- 安全与合规成为新选型变量:OpenAI 沙盒逃逸事件发酵,企业采购中「厂商安全声誉」权重将上升。
09 · 分角色实操建议
独立开发者 / 小团队
- OpenRouter 做技术预研沙盒完全合适;注意国内延迟约 180–250ms、无国内发票,生产环境评估硅基流动等合规中转。
- 编程优先测 DeepSeek V4 Flash + GLM 5.2;卡住的复杂步骤再切 Claude Opus 5 / GPT-5.6,做混合路由可大幅降本。
企业技术负责人
- 勿只看用量榜选型;务必用自有评测集(采纳率、错误率、真实负载延迟)二次验证。
- 按任务分层路由:闲聊/创意走低价开源,分类/复杂推理/高风险 Agent 决策走闭源旗舰。
- 将「模型供应商安全记录」纳入评分卡——本周 OpenAI 沙盒逃逸说明风险已落地。
10 · 五步构建 OpenRouter 分层路由(落地步骤)
- 在隔离环境接入 OpenRouter:参考 接入教程,配置
OPENROUTER_API_KEY,切勿在主力机裸奔实验 Key。 - 给任务打四类标签:闲聊创意 / 日常代码 / Agent 多步规划 / 复杂推理分类——各档映射不同 model ID。
- 写 Fallback 链:主力
deepseek/deepseek-v4-flash,fallbackanthropic/claude-opus-5或openai/gpt-5.6-sol。 - 跑固定 20 步 Agent 基准:记录单次任务美元成本、P95 延迟、工具调用成功率——用数据替代榜单直觉。
- 对照 openrouter.ai/rankings 每周复核:更新路由表,保存 benchmark 报告,吊销测试 Key。
# 示例:OpenRouter Fallback 请求体片段
{
"models": [
"deepseek/deepseek-v4-flash",
"z-ai/glm-5.2",
"anthropic/claude-opus-5"
],
"route": "fallback",
"messages": [{ "role": "user", "content": "你的 Agent 任务..." }]
}11 · 为什么多模型路由实验更适合「按天租用 Mac」?
在主力 Mac 上同时试跑 Cursor、OpenClaw、Hermes Agent 并切换十几套 OpenRouter 模型 ID,常见问题是:环境变量与 Key 散落、Agent 插件权限难以回收、偶发高并发请求拖慢本地 Xcode 索引。笔记本长时间满载还会触发降频,反而让「测延迟」失真。
更稳妥的做法是:在按天租用的隔离 macOS 上完成 Key 申请、Fallback 配置、20 步基准与 Cursor/OpenClaw 联调;验证路由表与账单曲线后,再把已审计的配置迁回团队主力机。这样主力机不承担 API 实验窗口期的合规与性能风险,租用实例用完即毁,Key 泄露面也更小。
若你追求更稳定的构建环境、更完整的 Apple 生态调试体验,以及可预期的 7×24 远程节点,租赁 Mac Mini M4 往往是比「在旧 Intel 本或 Linux VPS 上硬扛多 Agent」更优的长期解——租赁进一步降低了前期硬件投入。
12 · FAQ×5
OpenRouter 排行榜反映质量还是用量?
反映真实付费 Token 用量,不是跑分。廉价模型挂高流量应用后可霸榜,不代表复杂推理最强。
7 月 OpenRouter 第一名是谁?
截至 7/25 单日用量:小米 Mimo V2.5(约 1.4T Token/天)。
中国模型占多少份额?
综合约 46%;美国三巨头约 30%–36%。
Kimi K3 表现如何?
新上榜约 157.6B/天,涨势最猛;7/27 权重开源后关注社区量化进度。
发布前如何核对数据?
打开 openrouter.ai/rankings 核对当日 Top10,更新文章「数据截止日」与表格。
数据来源:OpenRouter 官方排行榜及公开镜像站点,统计截止 2026年7月25日。榜单每日变动,引用前请以官网实时数据为准。