OpenRouter 2026年7月大模型排行榜深度解析:
誰在真正贏下這場 AI 流量戰爭?
誰遇到什麼問題?仍在用幾個月前 MMLU 印象選預設模型的 Cursor/OpenClaw 開發者,以及需要向團隊解釋「為何便宜開源模型霸榜」的技術負責人。本文給什麼?依 OpenRouter 截至 7 月 25 日的真實 Token 用量:Mimo V2.5 登頂、陸系廠商合計約 46% 份額、用量與品質的「槓鈴型」分層,以及 8 月趨勢與分層路由實作。結構包含:Top12 與廠商份額表、應用層 TOP10、價格對照、五步路由清單、FAQ×5。
📋 本文目錄
延伸閱讀:OpenRouter 保姆級接入教程、6 月排行榜與陸系模型接管、週 Token 帳單真相。
01 · 核心結論(資料截止 2026-07-25)
- 單日 Token 榜首易主:小米 Mimo V2.5 約 1.4T Token/天 登頂;DeepSeek V4 Flash(943.9B)、騰訊 Hy3(590B)緊隨其後。前十名中陸系模型占七席。
- 廠商份額歷史性遷移:陸系廠商合計約 46%(一年前 <2%);美國 OpenAI+Anthropic+Google 合計約 30%–36%(一年前約 70%)。
- DeepSeek 仍是「最穩的第一」:單一廠商份額約 16%–18% 最穩定;但「月度冠軍模型」頻繁輪換——2 月 MiniMax M2.5、4 月 MiMo-V2-Pro、7 月 Mimo V2.5。
- 硬核資料 #1:DeepSeek V4 Flash 輸入約 $0.05–0.14/M vs GPT-5.5 約 $5/M——價差約 35 倍,是流量遷移的核心數學,而非敘事。
OpenRouter 排行榜測的是「開發者真金白銀把請求發到了誰家」,不是「誰最聰明」。這個反差正是本文與多數競品表格文的差異化角度。
02 · 三大選型痛點:為何「看榜」仍會選錯模型?
排行榜是決策輸入,不是決策本身。Mac 開發者與 AI 團隊在 7 月最常踩的三類坑:
- 把 Token 用量等同於能力:廉價模型掛在 Hermes Agent、角色扮演等高流量應用後,單日用量可以碾壓閉源旗艦,但在「分類/複雜推理」消費份額維度幾乎查無此模型。
- 只看瞬時 #1 不看持續前排:榜單每日波動(7/24 Claude Opus 4.8 還在前十,7/25 被 Ling 3.0 Flash 擠出前 12)。月度冠軍≠長期護城河。
- 忽視應用層與模型層的分裂:程式 Agent(Kilo Code ~13%)、角色扮演(Janitor AI、ISEKAI ZERO)消耗巨大開源流量,卻極少出現在企業 AI 報導裡——若你的場景是 Agent 程式開發,應同時看 openrouter.ai/apps。
03 · 7月模型 Token 用量 Top 12(日用量,截至 7/25)
| 排名 | 模型 | 廠商 | 單日 Token | 近30天累計 |
|---|---|---|---|---|
| 1 | Mimo V2.5 | 小米 | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | 騰訊 | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B(免費) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | 智譜 Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | 階躍星辰 | 204.8B | 5.9T |
| 9 | Kimi K3 | 月之暗面 | 157.6B | 1.6T(新上榜) |
| 10 | Ling 3.0 Flash | 螞蟻 InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
硬核資料 #2:Kimi K3 7 月新上榜、漲勢最猛;7 月 27 日開源權重(約 1.4TB)發布後,社區量化版本通常 2–4 週內出現,屆時中小團隊才真正能用上本機或邊緣伺服器部署。
04 · 廠商份額:陸系 46% vs 美國 30%–36%
| 廠商 | 歸屬 | Token 份額(約,7天口徑) |
|---|---|---|
| DeepSeek | 🇨🇳 | 16%–18% |
| 小米 | 🇨🇳 | 8%–18%(Mimo V2.5 暴漲,波動最大) |
| Anthropic | 🇺🇸 | 10%–15% |
| 騰訊 | 🇨🇳 | 8%–13% |
| 🇺🇸 | 8%–13% | |
| 智譜 Z.ai | 🇨🇳 | 4%–7% |
| OpenAI | 🇺🇸 | 6%–8% |
| NVIDIA | 🇺🇸 | ~5% |
| MiniMax / 月之暗面 / 阿里 Qwen | 🇨🇳 | 各 1%–8% |
這不是情緒驅動的變化,而是價格邏輯:當陸系開源模型在多數任務上「夠用」,且價差達數十倍,理性開發者會用腳投票。台灣團隊若走跨境 API,還需額外評估延遲(常見 180–250ms)與頻寬穩定性。
05 · 榜單另一面:用量高 ≠ 品質高
按任務類型的消費金額占比(而非 Token 量)看,市場呈現「槓鈴型」結構:
- 通用對話 35.7%、Agent 工作流 30.4%、程式碼 26.5%、資料處理 7.5%——廉價開源模型吃下大量高容錯「跑量」任務。
- 在「分類/複雜推理」難任務維度:Claude Sonnet 4.6 與 Claude Opus 4.7 各 13.5% 消費份額並列第一,GPT-5.5 11.6% 第三;總量榜霸屏的廉價模型幾乎缺席。
7 月 24 日 Anthropic 發布 Claude Opus 5:FrontierBench v0.1 43.3%(GPT-5.6 Sol 37.5%),定價維持 Opus 檔 $5/$25/M——「我貴,但我值這個價」的閉源打法依然有效。
硬核資料 #3:OpenRouter × a16z《State of AI》顯示,創意角色扮演場景占開源模型總用量一半以上——只看企業報導會錯過「看不見的半壁江山」。
06 · 應用層秘密:程式 Agent 稱王,角色扮演是隱藏市場
| 排名 | 應用 | 類型 | 份額(約) |
|---|---|---|---|
| 1 | Hermes Agent | 個人智慧體/CLI | ~45% |
| 2 | Kilo Code | 程式 Agent | ~13% |
| 3 | OpenClaw | 通用 Agent | ~9% |
| 4 | Claude Code | 程式 Agent | ~6% |
| 5–10 | Descript / pi / Lemonade / ISEKAI ZERO / Janitor AI / Cline | 內容/Agent/角色扮演 | 1.7%–4.5% |
Cline → Roo Code → Kilo Code 是同一代碼血統的三次分叉,「孫子輩」Kilo Code 流量已反超祖輩 Cline——開源程式 Agent 生態迭代極快,先發優勢並不牢固。
07 · 價格與定位對照(選型決策矩陣)
| 模型 | 輸入/M | 輸出/M | 定位 |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05–0.14 | ~$0.24–0.28 | 性價比之王,Agentic Coding 首選 |
| Nemotron 3 Ultra | $0.42(有免費版) | $2.61 | 美系全開源,NVIDIA 生態 |
| GLM 5.2 | $0.45 | $3.31 | 開源裡最接近 Opus 規劃品質 |
| Kimi K3 | ~$3 | ~$15 | 1.4TB 開源權重,閉源級能力 |
| Claude Opus 5 | $5(快速檔 $10) | $25(快速檔 $50) | 閉源旗艦,難任務定價權 |
08 · 8月趨勢預測(基於 7 月軌跡)
- 陸系開源模型合計份額大概率繼續爬升,年內有望突破 50%,除非美國廠商大幅降價。
- 「月度冠軍模型」寶座繼續易主——小米、DeepSeek、騰訊、智譜、MiniMax、月之暗面價格戰不會放緩。
- Anthropic 可能推出更平價檔位搶用量,Opus 5 已是兩個月內第四款旗艦(Mythos 5、Fable 5、Sonnet 5 之後)。
- Kimi K3 1.4TB 權重將迎來社區量化;當前主要受益方仍是大廠與推理雲(如 Fireworks AI)。
- 安全與合規成為新選型變數:OpenAI 沙盒逃逸事件發酵,企業採購中「廠商安全聲譽」權重將上升。
09 · 分角色實作建議
獨立開發者 / 小團隊
- OpenRouter 做技術預研沙盒完全合適;注意跨境延遲約 180–250ms、無台灣本地發票,生產環境評估合規中轉。
- 程式優先測 DeepSeek V4 Flash + GLM 5.2;卡住的複雜步驟再切 Claude Opus 5 / GPT-5.6,做混合路由可大幅降本。
企業技術負責人
- 勿只看用量榜選型;務必用自有評測集(採納率、錯誤率、真實負載延遲)二次驗證。
- 按任務分層路由:閒聊/創意走低價開源,分類/複雜推理/高風險 Agent 決策走閉源旗艦。
- 將「模型供應商安全紀錄」納入評分卡——本週 OpenAI 沙盒逃逸說明風險已落地。
10 · 五步建構 OpenRouter 分層路由(落地步驟)
- 在隔離環境接入 OpenRouter:參考 接入教程,配置
OPENROUTER_API_KEY,切勿在主力機裸奔實驗 Key。 - 給任務打四類標籤:閒聊創意 / 日常程式 / Agent 多步規劃 / 複雜推理分類——各檔映射不同 model ID。
- 寫 Fallback 鏈:主力
deepseek/deepseek-v4-flash,fallbackanthropic/claude-opus-5或openai/gpt-5.6-sol。 - 跑固定 20 步 Agent 基準:記錄單次任務美元成本、P95 延遲、工具呼叫成功率——用資料替代榜單直覺。
- 對照 openrouter.ai/rankings 每週複核:更新路由表,儲存 benchmark 報告,吊銷測試 Key。
# 範例:OpenRouter Fallback 請求體片段
{
"models": [
"deepseek/deepseek-v4-flash",
"z-ai/glm-5.2",
"anthropic/claude-opus-5"
],
"route": "fallback",
"messages": [{ "role": "user", "content": "你的 Agent 任務..." }]
}11 · 為何多模型路由實驗更適合「按天租用 Mac」?
在主力 Mac 上同時試跑 Cursor、OpenClaw、Hermes Agent 並切換十幾套 OpenRouter 模型 ID,常見問題是:環境變數與 Key 散落、Agent 外掛權限難以回收、偶發高併發請求拖慢本地 Xcode 索引。筆電長時間滿載還會觸發降頻,反而讓「測延遲」失真;記憶體與頻寬被 Agent 佔滿時,本機模擬器也難以代表真實除錯體驗。
更穩妥的做法是:在按天租用的隔離 macOS 上完成 Key 申請、Fallback 配置、20 步基準與 Cursor/OpenClaw 聯調;驗證路由表與帳單曲線後,再把已審計的設定遷回團隊主力機。這樣主力機不承擔 API 實驗窗口期的合規與效能風險,租用實例用完即毀,Key 洩漏面也更小。
若你追求更穩定的建置環境、更完整的 Apple 生態除錯體驗,以及可預期的 7×24 遠端節點,租賃 Mac Mini M4 往往是比「在舊 Intel 本或 Linux 虛擬伺服器上硬扛多 Agent」更優的長期解——租賃進一步降低了前期硬體投入。
12 · FAQ×5
OpenRouter 排行榜反映品質還是用量?
反映真實付費 Token 用量,不是跑分。廉價模型掛高流量應用後可霸榜,不代表複雜推理最強。
7 月 OpenRouter 第一名是誰?
截至 7/25 單日用量:小米 Mimo V2.5(約 1.4T Token/天)。
陸系模型占多少份額?
綜合約 46%;美國三大廠商約 30%–36%。
Kimi K3 表現如何?
新上榜約 157.6B/天,漲勢最猛;7/27 權重開源後關注社區量化進度。
發布前如何核對資料?
打開 openrouter.ai/rankings 核對當日 Top10,更新文章「資料截止日」與表格。
資料來源:OpenRouter 官方排行榜及公開鏡像站點,統計截止 2026年7月25日。榜單每日變動,引用前請以官網即時資料為準。