阿里 Qwen3.8-Max 发布:2.4 万亿参数冲进 Arena 全球前五,下周开源
谁遇到什么问题?评估国产旗舰大模型的开发者与 AI Agent 团队,面对 Qwen3.8-Max、Kimi K3、DeepSeek V4 密集发布,难以判断跑分可信度与开源时间表。本文给什么?基于 8 月 3 日 GA 发布的完整时间线、核心数据表与竞品横向对比,并拆解「Open-Source 标签先于权重上线」争议。结构包含:三大痛点、跑分对比表、架构拆解、开源争议、五步 Mac 隔离试跑、FAQ×5。
📋 本文目录
Kimi K3 开源全景见 Kimi K3 全面开源解读;国行 Apple Intelligence 与千问合作见 苹果 AI 国行备案解读。
2026 年 8 月 3 日,阿里巴巴正式发布新一代旗舰大模型千问 Qwen3.8-Max,总参数 2.4 万亿、激活 950 亿,同步上线 Agent 产品「千问办公」。在 Arena 文本竞技场前 8 名中,Qwen3.8-Max 是唯一挤进去的非 Anthropic 模型——但所有跑分均为阿里自测,第三方权威平台尚未收录正式评测。
01 · 三大决策痛点:为什么「看跑分」远远不够
- 官网已标「Open-Source」,权重却还没上线:qwen.ai 在 GA 当天即打上开源标签,但截至发稿 Hugging Face 与 ModelScope 均无对应仓库、许可证条款或确切日期,只有「下周」模糊承诺——营销节奏领先于可验证产物。
- 所有跑分均来自阿里自建测试框架:PaperBench、QwenSWEBench、RecreationBench 等多为内部基准,Artificial Analysis、Arena.ai 等中立平台截至发稿未对正式版给出独立复现;Arena 上 1496 分标注为「Preliminary/初步」。
- 预览阶段透明度不足留下信任债:7 月 19 日预览版未公开激活参数量、未提供跑分表,服务条款还禁止自动化生产环境调用——GA 才补充披露 950 亿激活参数,多家独立评测机构曾建议「先在自己业务场景测试,不要迁移生产系统」。
02 · 时间线:从预览版到正式发布,两周内节奏很快
- 7 月 16 日:月之暗面发布 Kimi K3,2.8 万亿参数(896 专家中激活 16 个),主打独立评测与透明技术报告。
- 7 月 19 日:Qwen3.8-Max 以预览版开放,接入 Token Plan / Qoder / QoderWork,价格为预计正式价的 10%,但未公布激活参数与跑分表。
- 7 月 27 日:Kimi K3 按承诺开源权重,上线 Hugging Face,同步开源注意力内核、MoE 通信库等基础设施。
- 7 月 31 日:DeepSeek 发布 V4-Flash 正式版,参数规模不变,智能体与代码类基准大幅超过 V4-Pro 预览版。
- 8 月 3 日:Qwen3.8-Max 正式 GA,发布完整跑分表,「千问办公」同步上线。阿里港股当日上涨约 7%,美股上涨约 4.5%。
- 预计 8 月 10 日前后:Qwen3.8-Max 及精简版 Qwen3.8-27B 权重计划登陆 Hugging Face 与 ModelScope,具体日期与开源协议条款尚未公布。
03 · 核心数据一览
| 项目 | Qwen3.8-Max |
|---|---|
| 发布日期 | 2026 年 8 月 3 日(GA) |
| 总参数 / 激活参数 | 2.4 万亿 / 950 亿 |
| 架构 | 基于 Qwen3.5 的稀疏 MoE + 混合注意力 |
| 上下文窗口 | 100 万 token(思考模式约 98.3 万,输出上限 13.1 万) |
| API 定价 | 输入 $2/百万 token,输出 $6/百万 token |
| 国内定价 | 输入 12 元/百万 token,输出 36 元/百万 token,缓存命中低至 1.5 元 |
| Arena 文本竞技场(8/1 快照) | 第 5 名,1496 分(Preliminary) |
| Arena 视觉竞技场 | 第 2 名,仅次于 Claude Fable 5 |
| PaperBench(阿里自测) | 93.0(较上代 +28.2) |
| SWE-bench Pro(阿里自测) | 67.7(落后 Fable 5 的 80.0) |
| 权重开源状态 | 承诺「下周」,截至发稿未上线 |
硬核数据 #1:API 定价输入 $2/百万 token、输出 $6/百万 token,明显低于 Claude Opus 5($5/$25)与 Claude Fable 5($10/$50)。
硬核数据 #2:Arena 文本竞技场第 5 名、1496 分,前 8 名中唯一非 Anthropic 模型,但排名标注为「初步」。
硬核数据 #3:发布当日阿里港股上涨约 7%、美股上涨约 4.5%,资本市场将其解读为阿里重掌 AI 叙事主动权。
04 · 深度拆解:2.4 万亿参数背后,阿里想解决什么问题
4.1 为什么是 MoE + 混合注意力,而不是单纯堆参数?
稀疏 MoE 把总参数做到 2.4 万亿的同时,实际激活量控制在 950 亿——推理成本更接近千亿级模型,而非真正调用 2.4 万亿参数。这是用架构效率换取价格竞争力,而不是单纯靠参数规模取胜。
4.2 reasoning_effort 三档设计
模型提供 low / medium / xhigh 三档推理强度(默认 xhigh),开发者可按任务复杂度调节速度与深度,支持通过 enable_thinking 参数或 Anthropic 兼容接口的 reasoning.effort 字段调用。
4.3 长程自主任务与生态卡位
阿里案例包括 16 天无人工介入的自主编码项目、超过 500 步的芯片设计优化,以及自建 RecreationBench 黑盒还原真实应用。API 同时兼容 OpenAI 与 Anthropic 协议,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链。
05 · 横向对比:Qwen3.8-Max、Kimi K3、DeepSeek V4、Claude
| 模型 | 总参数/激活 | 定价(入/出,每百万 token) | 权重开源 | 独立第三方评测 |
|---|---|---|---|---|
| Qwen3.8-Max | 2.4T / 950 亿 | $2 / $6 | 未开源(承诺中) | 暂无 |
| Kimi K3 | 2.8T / 约 500 亿 | $3 / $15 | 已开源(7/27) | AA Index ≈ 57.11 |
| DeepSeek V4-Flash | 未变(较 V4-Pro) | 未公开完整表 | 已开源 | 9 项智能体/代码基准超 V4-Pro |
| Claude Opus 5 | 未公开 | $5 / $25 | 闭源 | Arena 前列 |
| Claude Fable 5 | 未公开 | $10 / $50 | 闭源 | Arena 文本第 1 |
唯一一次可比的独立盲测(269 个文件的真实项目架构设计任务):Kimi K3 得 83 分,Qwen3.8-Max 预览版得 80 分——差距很小,属于「互有胜负」而非「全面碾压」。
06 · 争议点:「开源」标签挂得比权重早
- 官网已标 Open-Source,权重还没有发布:Hugging Face 与 ModelScope 上均无对应仓库、许可证或确切上线时间。
- 所有跑分均来自阿里自建测试框架:包括 QwenSWEBench、QwenQoderBench、CoWorkBench、RecreationBench 等内部基准。
- 跑分表脚注暗指竞品数据存疑:脚注写着「Fable 5 的结果可能涉及 fallback」,但阿里自己的测试方法论同样未公开到可供第三方复现的程度。
- 预览阶段透明度问题:7 月 19 日预览版禁止自动化生产环境调用,未公开 model card 与安全评估报告。
这些不代表 Qwen3.8-Max 性能不行——从目前唯一的独立盲测看,它确实与 Kimi K3 同一档位——但「跻身全球第一梯队」这类结论,目前主要还是阿里的一面之词,需等开源权重落地、第三方跑分上线后才能真正验证。
07 · 影响与背景:中国大模型的「参数竞赛」进入新阶段
- 2026 年是万亿参数模型的「扩产年」:DeepSeek V4-Pro(1.6T)→ Qwen3.8-Max(2.4T)→ Kimi K3(2.8T),但 DeepSeek V4-Flash 证明不靠堆参数也能大幅提升智能体能力——参数竞赛叙事正被「架构效率竞赛」取代。
- 阿里罕见地「回归开源」:此前几代千问 Max 级模型走闭源路线,这次是首次承诺开源 Max 级权重,与 Kimi K3、DeepSeek 构成国产头部「集体转向开放权重」格局。
- 千问已嵌入 Apple Intelligence 国行:经压缩到 4GB 以内的 Qwen 模型可在 iPhone 15 及以上机型本地运行,商业化半径延伸为数亿部 iPhone 的系统级 AI 能力。
- 中美 AI 叙事对照:Qwen3.8-Max 发布前后,OpenAI 与 Anthropic 披露 Agent 越狱入侵真实企业系统事件,白宫 8 月 4 日召集巨头商讨自愿性网络安全测试框架——一边加速开源抢占生态,一边收紧 Agent 审查。
08 · 五步 Mac 隔离试跑(Agent 工具链验收)
- 在 QwenCloud 注册 API Key,用 OpenAI 或 Anthropic 兼容 SDK 跑通基线任务(长文档摘要 / 修 bug / 多文件重构各 1 个),记录 xhigh 与 low 档 latency 差异
- 在隔离环境配置
ANTHROPIC_BASE_URL或 OpenAI 兼容端点,接入 Claude Code / OpenClaw / Qoder CLI,避免 API Key 写入主力机全局 shell - 对照 Kimi K3 与 DeepSeek V4-Flash 跑同一组 269 文件级架构任务,记录盲审打分与 $/task 账单
- 关注 Hugging Face / ModelScope 上 Qwen3.8-Max 与 Qwen3.8-27B 仓库上线时间与 LICENSE 条款,权重落地后再评估本地 Ollama 部署可行性
- 结合 Kimi K3 开源解读与本文对比表,输出团队选型文档并设定 8 月 10 日前后的复测节点
09 · 常见问题 FAQ
Q1:Qwen3.8-Max 现在能直接用吗?开源了没有?
A:API 已可通过 QwenCloud 调用,兼容 OpenAI 和 Anthropic 两种接口协议。但权重尚未开源,预计 8 月 10 日前后登陆 Hugging Face 与 ModelScope,具体日期以官方公告为准。
Q2:Qwen3.8-Max 和 Kimi K3 到底谁更强?
A:目前没有权威的统一评测。唯一独立盲测显示两者打分非常接近(Kimi K3 83 分、Qwen3.8-Max 预览版 80 分)。Kimi K3 优势是已开源并有第三方评测;Qwen3.8-Max 优势是 API 价格更低、多模态更全面。
Q3:2.4 万亿参数是不是意味着普通开发者根本用不起?
A:实际激活 950 亿,通过 API 调用成本接近千亿级模型。本地私有化部署完整版需多节点数据中心,更现实的选择是等待 Qwen3.8-27B 精简版开源。
Q4:阿里公布的跑分能信吗?
A:可以作为参考,但不能当作定论。所有数据目前均来自阿里自建测试框架,建议关注后续独立评测或在自己的业务场景做 A/B 测试。
Q5:这次发布对普通用户有什么实际影响?
A:苹果国行 Apple Intelligence 的生成式 AI 能力基于经压缩后的 Qwen 模型本地运行,国内 iPhone 用户未来会在系统层面直接用到千问系列能力。
10 · 租用 Mac 弹性验证:在主力机外完成 Qwen3.8-Max Agent 试跑
Qwen3.8-Max API 虽已通过 OpenAI / Anthropic 双协议降低迁移成本,但在主力开发机上直接切换 Agent 工具链仍有风险:API Key 污染全局环境、长上下文实验不可逆占用本地缓存、与 Claude Code / OpenClaw 并存的配置冲突难以回滚。Windows 或 Linux 用户虽可调用云端 API,但无法完整验证与 macOS 原生 Xcode、Keychain 并存的 Agent 工作流。
虽然你可以直接在笔记本上接入 Qwen3.8-Max API 完成短期验证,但主力机更适合稳定交付;若在 Windows 或老旧 Intel Mac 上远程试水,常见风险包括延迟误判、无法完整验证证书链与本地 Ollama 并存场景。若你追求按天计费、隔离环境、真实 Apple Silicon 硬件且不愿为「试模型」专门买机器,MacDate 按天弹性租用让你在权重落地前低成本完成 Agent 工具链对照实验。计费见 M 系列 Mac 算力租赁定价。
短期用云端 API 完成选型验证完全合理;若你需要可复现的 Agent 环境、完整 Apple 生态兼容与更低的 Key 泄露风险,直接租用 Mac mini M4 通常是更优解,而按天租赁能进一步降低前期投入与选型失误成本。
11 · 数据来源
- 阿里云官方博客与新闻稿(Qwen3.8-Max 发布公告、定价页面)
- Alibaba Cloud Community、Alibaba Press Room 英文公告
- Arena.ai 文本/视觉竞技场公开排行榜(2026 年 8 月 1 日快照)
- 国内媒体报道:网界、大模型之家、ITBear、新浪财经等
- 独立评测/分析:Apidog、Yotta Labs、eesel AI、Context Studios、MarkTechPost、TechNode、SiliconANGLE
- Apple Intelligence 国行相关:TechCrunch、Memeburn、Digital Market Reports
发布前请务必核实最新的官方公告、开源时间及具体跑分数据,部分数字可能随官方后续更新而变化。