阿里 Qwen3.8-Max 正式發布:2.4 兆參數衝進 Arena 全球前五,下週開源
誰遇到什麼問題?評估國產旗艦大模型的開發者與 AI Agent 團隊,面對 Qwen3.8-Max、Kimi K3、DeepSeek V4 密集發布,難以判斷跑分可信度與開源時間表。本文給什麼?基於 8 月 3 日 GA 發布的完整時間軸、核心數據表與競品橫向對照,並拆解「Open-Source 標籤先於權重上線」爭議。結構包含:三大痛點、跑分對照表、架構拆解、開源爭議、五步 Mac 隔離試跑、FAQ×5。
📋 本文目錄
Kimi K3 開源全景見 Kimi K3 全面開源權重解讀;中國大陸版 Apple Intelligence 與千問合作見 蘋果 AI 中國大陸備案解讀。
2026 年 8 月 3 日,阿里巴巴正式發布新一代旗艦大模型千問 Qwen3.8-Max,總參數 2.4 兆、激活 950 億,同步上線 Agent 產品「千問辦公」。在 Arena 文本競技場前 8 名中,Qwen3.8-Max 是唯一擠進去的非 Anthropic 模型——但所有跑分均為阿里自測,第三方權威平台尚未收錄正式評測。
01 · 三大決策痛點:為什麼「看跑分」遠遠不夠
- 官網已標「Open-Source」,權重卻還沒上線:qwen.ai 在 GA 當天即打上開源標籤,但截至發稿 Hugging Face 與 ModelScope 均無對應儲存庫、授權條款或確切日期,只有「下週」模糊承諾——行銷節奏領先於可驗證產物。
- 所有跑分均來自阿里自建測試框架:PaperBench、QwenSWEBench、RecreationBench 等多為內部基準,Artificial Analysis、Arena.ai 等中立平台截至發稿未對正式版給出獨立複現;Arena 上 1496 分標註為「Preliminary/初步」。
- 預覽階段透明度不足留下信任債:7 月 19 日預覽版未公開激活參數量、未提供跑分表,服務條款還禁止自動化生產環境呼叫——GA 才補充披露 950 億激活參數,多家獨立評測機構曾建議「先在自己業務場景測試,不要遷移生產系統」。
02 · 時間軸:從預覽版到正式發布,兩週內節奏很快
- 7 月 16 日:月之暗面發布 Kimi K3,2.8 兆參數(896 專家中激活 16 個),主打獨立評測與透明技術報告。
- 7 月 19 日:Qwen3.8-Max 以預覽版開放,接入 Token Plan/Qoder/QoderWork,價格為預計正式價的 10%,但未公布激活參數與跑分表。
- 7 月 27 日:Kimi K3 按承諾開源權重,上線 Hugging Face,同步開源注意力核心、MoE 通訊函式庫等基礎設施。
- 7 月 31 日:DeepSeek 發布 V4-Flash 正式版,參數規模不變,智慧體與程式碼類基準大幅超過 V4-Pro 預覽版。
- 8 月 3 日:Qwen3.8-Max 正式 GA,發布完整跑分表,「千問辦公」同步上線。阿里港股當日上漲約 7%,美股上漲約 4.5%。
- 預計 8 月 10 日前後:Qwen3.8-Max 及精簡版 Qwen3.8-27B 權重計畫登陸 Hugging Face 與 ModelScope,確切日期與開源協定條款尚未公布。
03 · 核心數據一覽
| 項目 | Qwen3.8-Max |
|---|---|
| 發布日期 | 2026 年 8 月 3 日(GA) |
| 總參數/激活參數 | 2.4 兆/950 億 |
| 架構 | 基於 Qwen3.5 的稀疏 MoE + 混合注意力 |
| 上下文視窗 | 100 萬 token(思考模式約 98.3 萬,輸出上限 13.1 萬) |
| API 定價 | 輸入 $2/百萬 token,輸出 $6/百萬 token |
| 中國大陸定價 | 輸入 12 元/百萬 token,輸出 36 元/百萬 token,快取命中低至 1.5 元 |
| Arena 文本競技場(8/1 快照) | 第 5 名,1496 分(Preliminary) |
| Arena 視覺競技場 | 第 2 名,僅次於 Claude Fable 5 |
| PaperBench(阿里自測) | 93.0(較上代 +28.2) |
| SWE-bench Pro(阿里自測) | 67.7(落後 Fable 5 的 80.0) |
| 權重開源狀態 | 承諾「下週」,截至發稿未上線 |
硬核數據 #1:API 定價輸入 $2/百萬 token、輸出 $6/百萬 token,明顯低於 Claude Opus 5($5/$25)與 Claude Fable 5($10/$50)。
硬核數據 #2:Arena 文本競技場第 5 名、1496 分,前 8 名中唯一非 Anthropic 模型,但排名標註為「初步」。
硬核數據 #3:發布當日阿里港股上漲約 7%、美股上漲約 4.5%,資本市場將其解讀為阿里重掌 AI 敘事主導權。
04 · 深度拆解:2.4 兆參數背後,阿里想解決什麼問題
4.1 為什麼是 MoE + 混合注意力,而不是單純堆參數?
稀疏 MoE 把總參數做到 2.4 兆的同時,實際激活量控制在 950 億——推論成本更接近千億級模型,而非真正呼叫 2.4 兆參數。這是用架構效率換取價格競爭力,而不是單純靠參數規模取勝。
4.2 reasoning_effort 三檔設計
模型提供 low/medium/xhigh 三檔推論強度(預設 xhigh),開發者可按任務複雜度調節速度與深度,支援透過 enable_thinking 參數或 Anthropic 相容介面的 reasoning.effort 欄位呼叫。
4.3 長程自主任務與生態卡位
阿里案例包括 16 天無人工介入的自主編碼專案、超過 500 步的晶片設計最佳化,以及自建 RecreationBench 黑盒還原真實應用。API 同時相容 OpenAI 與 Anthropic 協定,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具鏈。
05 · 橫向對照:Qwen3.8-Max、Kimi K3、DeepSeek V4、Claude
| 模型 | 總參數/激活 | 定價(入/出,每百萬 token) | 權重開源 | 獨立第三方評測 |
|---|---|---|---|---|
| Qwen3.8-Max | 2.4T/950 億 | $2/$6 | 未開源(承諾中) | 暫無 |
| Kimi K3 | 2.8T/約 500 億 | $3/$15 | 已開源(7/27) | AA Index ≈ 57.11 |
| DeepSeek V4-Flash | 未變(較 V4-Pro) | 未公開完整表 | 已開源 | 9 項智慧體/程式碼基準超 V4-Pro |
| Claude Opus 5 | 未公開 | $5/$25 | 閉源 | Arena 前列 |
| Claude Fable 5 | 未公開 | $10/$50 | 閉源 | Arena 文本第 1 |
唯一一次可比的獨立盲測(269 個檔案的真實專案架構設計任務):Kimi K3 得 83 分,Qwen3.8-Max 預覽版得 80 分——差距很小,屬於「互有勝負」而非「全面碾壓」。
06 · 爭議點:「開源」標籤掛得比權重早
- 官網已標 Open-Source,權重還沒有發布:Hugging Face 與 ModelScope 上均無對應儲存庫、授權條款或確切上線時間。
- 所有跑分均來自阿里自建測試框架:包括 QwenSWEBench、QwenQoderBench、CoWorkBench、RecreationBench 等內部基準。
- 跑分表腳註暗指競品數據存疑:腳註寫著「Fable 5 的結果可能涉及 fallback」,但阿里自己的測試方法論同樣未公開到可供第三方複現的程度。
- 預覽階段透明度問題:7 月 19 日預覽版禁止自動化生產環境呼叫,未公開 model card 與安全評估報告。
這些不代表 Qwen3.8-Max 效能不行——從目前唯一的獨立盲測看,它確實與 Kimi K3 同一檔位——但「躋身全球第一梯隊」這類結論,目前主要還是阿里的一面之詞,需等開源權重落地、第三方跑分上線後才能真正驗證。
07 · 影響與背景:中國大模型的「參數競賽」進入新階段
- 2026 年是兆級參數模型的「擴產年」:DeepSeek V4-Pro(1.6T)→ Qwen3.8-Max(2.4T)→ Kimi K3(2.8T),但 DeepSeek V4-Flash 證明不靠堆參數也能大幅提升智慧體能力——參數競賽敘事正被「架構效率競賽」取代。
- 阿里罕見地「回歸開源」:此前幾代千問 Max 級模型走閉源路線,這次是首次承諾開源 Max 級權重,與 Kimi K3、DeepSeek 構成國產頭部「集體轉向開放權重」格局。
- 千問已嵌入 Apple Intelligence 中國大陸版:經壓縮到 4GB 以內的 Qwen 模型可在 iPhone 15 及以上機型本地執行,商業化半徑延伸為數億部 iPhone 的系統級 AI 能力。
- 中美 AI 敘事對照:Qwen3.8-Max 發布前後,OpenAI 與 Anthropic 披露 Agent 越獄入侵真實企業系統事件,白宮 8 月 4 日召集巨頭商討自願性網路安全測試框架——一邊加速開源搶占生態,一邊收緊 Agent 審查。
08 · 五步 Mac 隔離試跑(Agent 工具鏈驗收)
- 在 QwenCloud 註冊 API Key,用 OpenAI 或 Anthropic 相容 SDK 跑通基線任務(長文件摘要/修 bug/多檔案重構各 1 個),記錄 xhigh 與 low 檔延遲差異
- 在隔離環境設定
ANTHROPIC_BASE_URL或 OpenAI 相容端點,接入 Claude Code/OpenClaw/Qoder CLI,避免 API Key 寫入主力機全域 shell - 對照 Kimi K3 與 DeepSeek V4-Flash 跑同一組 269 檔案級架構任務,記錄盲審打分與 $/task 帳單
- 關注 Hugging Face/ModelScope 上 Qwen3.8-Max 與 Qwen3.8-27B 儲存庫上線時間與 LICENSE 條款,權重落地後再評估本地 Ollama 部署可行性
- 結合 Kimi K3 開源解讀與本文對照表,輸出團隊選型文件並設定 8 月 10 日前後的複測節點
09 · 常見問題 FAQ
Q1:Qwen3.8-Max 現在能直接用嗎?開源了沒有?
A:API 已可透過 QwenCloud 呼叫,相容 OpenAI 和 Anthropic 兩種介面協定。但權重尚未開源,預計 8 月 10 日前後登陸 Hugging Face 與 ModelScope,確切日期以官方公告為準。
Q2:Qwen3.8-Max 和 Kimi K3 到底誰更強?
A:目前沒有權威的統一評測。唯一獨立盲測顯示兩者打分非常接近(Kimi K3 83 分、Qwen3.8-Max 預覽版 80 分)。Kimi K3 優勢是已開源並有第三方評測;Qwen3.8-Max 優勢是 API 定價更低、多模態更全面。
Q3:2.4 兆參數是不是代表一般開發者根本用不起?
A:實際激活 950 億,透過 API 呼叫成本接近千億級模型。本地私有化部署完整版需多節點資料中心,更現實的選擇是等待 Qwen3.8-27B 精簡版開源。
Q4:阿里公布的跑分能信嗎?
A:可以作為參考,但不能當作定論。所有數據目前均來自阿里自建測試框架,建議關注後續獨立評測或在自己的業務場景做 A/B 測試。
Q5:這次發布對一般使用者有什麼實際影響?
A:蘋果中國大陸版 Apple Intelligence 的生成式 AI 能力基於經壓縮後的 Qwen 模型本地執行,中國大陸 iPhone 使用者未來會在系統層面直接用到千問系列能力。
10 · 租用 Mac 彈性驗證:在主力機外完成 Qwen3.8-Max Agent 試跑
Qwen3.8-Max API 雖已透過 OpenAI/Anthropic 雙協定降低遷移成本,但在主力開發機上直接切換 Agent 工具鏈仍有風險:API Key 污染全域環境、長上下文實驗不可逆占用本地快取、與 Claude Code/OpenClaw 並存的設定衝突難以回滾。Windows 或 Linux 使用者雖可呼叫雲端 API,但無法完整驗證與 macOS 原生 Xcode、Keychain 並存的 Agent 工作流程。
雖然你可以直接在筆電上接入 Qwen3.8-Max API 完成短期驗證,但主力機更適合穩定交付;若在 Windows 或老舊 Intel Mac 上遠端試水,常見風險包括延遲誤判、無法完整驗證憑證鏈與本地 Ollama 並存場景。若你追求按天計費、隔離環境、真實 Apple Silicon 硬體且不願為「試模型」專門買機器,MacDate 按天彈性租用讓你在權重落地前低成本完成 Agent 工具鏈對照實驗。計費見 裸機 macOS 定價。
短期用雲端 API 完成選型驗證完全合理;若你需要可複現的 Agent 環境、完整 Apple 生態相容與更低的 Key 外洩風險,直接租用 Mac mini M4 通常是更優解,而按天租賃能進一步降低前期投入與選型失誤成本。
11 · 資料來源
- 阿里雲官方部落格與新聞稿(Qwen3.8-Max 發布公告、定價頁面)
- Alibaba Cloud Community、Alibaba Press Room 英文公告
- Arena.ai 文本/視覺競技場公開排行榜(2026 年 8 月 1 日快照)
- 中國大陸媒體報導:網界、大模型之家、ITBear、新浪財經等
- 獨立評測/分析:Apidog、Yotta Labs、eesel AI、Context Studios、MarkTechPost、TechNode、SiliconANGLE
- Apple Intelligence 中國大陸版相關:TechCrunch、Memeburn、Digital Market Reports
發布前請務必核實最新的官方公告、開源時間及具體跑分數據,部分數字可能隨官方後續更新而變化。