国产大模型 2026 GA 发布 2026-08-04

阿里 Qwen3.8-Max 发布:2.4 万亿参数冲进 Arena 全球前五,下周开源

谁遇到什么问题?评估国产旗舰大模型的开发者与 AI Agent 团队,面对 Qwen3.8-Max、Kimi K3、DeepSeek V4 密集发布,难以判断跑分可信度与开源时间表。本文给什么?基于 8 月 3 日 GA 发布的完整时间线、核心数据表与竞品横向对比,并拆解「Open-Source 标签先于权重上线」争议。结构包含:三大痛点、跑分对比表、架构拆解、开源争议、五步 Mac 隔离试跑、FAQ×5。

阿里巴巴千问 Qwen3.8-Max 2026 发布 Arena 文本竞技场排名

Kimi K3 开源全景见 Kimi K3 全面开源解读;国行 Apple Intelligence 与千问合作见 苹果 AI 国行备案解读

2026 年 8 月 3 日,阿里巴巴正式发布新一代旗舰大模型千问 Qwen3.8-Max,总参数 2.4 万亿、激活 950 亿,同步上线 Agent 产品「千问办公」。在 Arena 文本竞技场前 8 名中,Qwen3.8-Max 是唯一挤进去的非 Anthropic 模型——但所有跑分均为阿里自测,第三方权威平台尚未收录正式评测。

01 · 三大决策痛点:为什么「看跑分」远远不够

  1. 官网已标「Open-Source」,权重却还没上线:qwen.ai 在 GA 当天即打上开源标签,但截至发稿 Hugging Face 与 ModelScope 均无对应仓库、许可证条款或确切日期,只有「下周」模糊承诺——营销节奏领先于可验证产物。
  2. 所有跑分均来自阿里自建测试框架:PaperBench、QwenSWEBench、RecreationBench 等多为内部基准,Artificial Analysis、Arena.ai 等中立平台截至发稿未对正式版给出独立复现;Arena 上 1496 分标注为「Preliminary/初步」。
  3. 预览阶段透明度不足留下信任债:7 月 19 日预览版未公开激活参数量、未提供跑分表,服务条款还禁止自动化生产环境调用——GA 才补充披露 950 亿激活参数,多家独立评测机构曾建议「先在自己业务场景测试,不要迁移生产系统」。

02 · 时间线:从预览版到正式发布,两周内节奏很快

  • 7 月 16 日:月之暗面发布 Kimi K3,2.8 万亿参数(896 专家中激活 16 个),主打独立评测与透明技术报告。
  • 7 月 19 日:Qwen3.8-Max 以预览版开放,接入 Token Plan / Qoder / QoderWork,价格为预计正式价的 10%,但未公布激活参数与跑分表。
  • 7 月 27 日:Kimi K3 按承诺开源权重,上线 Hugging Face,同步开源注意力内核、MoE 通信库等基础设施。
  • 7 月 31 日:DeepSeek 发布 V4-Flash 正式版,参数规模不变,智能体与代码类基准大幅超过 V4-Pro 预览版。
  • 8 月 3 日:Qwen3.8-Max 正式 GA,发布完整跑分表,「千问办公」同步上线。阿里港股当日上涨约 7%,美股上涨约 4.5%
  • 预计 8 月 10 日前后:Qwen3.8-Max 及精简版 Qwen3.8-27B 权重计划登陆 Hugging Face 与 ModelScope,具体日期与开源协议条款尚未公布。

03 · 核心数据一览

项目 Qwen3.8-Max
发布日期2026 年 8 月 3 日(GA)
总参数 / 激活参数2.4 万亿 / 950 亿
架构基于 Qwen3.5 的稀疏 MoE + 混合注意力
上下文窗口100 万 token(思考模式约 98.3 万,输出上限 13.1 万)
API 定价输入 $2/百万 token,输出 $6/百万 token
国内定价输入 12 元/百万 token,输出 36 元/百万 token,缓存命中低至 1.5 元
Arena 文本竞技场(8/1 快照)5 名,1496 分(Preliminary)
Arena 视觉竞技场2 名,仅次于 Claude Fable 5
PaperBench(阿里自测)93.0(较上代 +28.2)
SWE-bench Pro(阿里自测)67.7(落后 Fable 5 的 80.0)
权重开源状态承诺「下周」,截至发稿未上线

硬核数据 #1:API 定价输入 $2/百万 token、输出 $6/百万 token,明显低于 Claude Opus 5($5/$25)与 Claude Fable 5($10/$50)。

硬核数据 #2:Arena 文本竞技场第 5 名、1496 分,前 8 名中唯一非 Anthropic 模型,但排名标注为「初步」。

硬核数据 #3:发布当日阿里港股上涨约 7%、美股上涨约 4.5%,资本市场将其解读为阿里重掌 AI 叙事主动权。

04 · 深度拆解:2.4 万亿参数背后,阿里想解决什么问题

4.1 为什么是 MoE + 混合注意力,而不是单纯堆参数?

稀疏 MoE 把总参数做到 2.4 万亿的同时,实际激活量控制在 950 亿——推理成本更接近千亿级模型,而非真正调用 2.4 万亿参数。这是用架构效率换取价格竞争力,而不是单纯靠参数规模取胜。

4.2 reasoning_effort 三档设计

模型提供 low / medium / xhigh 三档推理强度(默认 xhigh),开发者可按任务复杂度调节速度与深度,支持通过 enable_thinking 参数或 Anthropic 兼容接口的 reasoning.effort 字段调用。

4.3 长程自主任务与生态卡位

阿里案例包括 16 天无人工介入的自主编码项目、超过 500 步的芯片设计优化,以及自建 RecreationBench 黑盒还原真实应用。API 同时兼容 OpenAI 与 Anthropic 协议,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链。

05 · 横向对比:Qwen3.8-Max、Kimi K3、DeepSeek V4、Claude

模型 总参数/激活 定价(入/出,每百万 token) 权重开源 独立第三方评测
Qwen3.8-Max2.4T / 950 亿$2 / $6未开源(承诺中)暂无
Kimi K32.8T / 约 500 亿$3 / $15已开源(7/27)AA Index ≈ 57.11
DeepSeek V4-Flash未变(较 V4-Pro)未公开完整表已开源9 项智能体/代码基准超 V4-Pro
Claude Opus 5未公开$5 / $25闭源Arena 前列
Claude Fable 5未公开$10 / $50闭源Arena 文本第 1

唯一一次可比的独立盲测(269 个文件的真实项目架构设计任务):Kimi K3 得 83 分,Qwen3.8-Max 预览版得 80 分——差距很小,属于「互有胜负」而非「全面碾压」。

06 · 争议点:「开源」标签挂得比权重早

  • 官网已标 Open-Source,权重还没有发布:Hugging Face 与 ModelScope 上均无对应仓库、许可证或确切上线时间。
  • 所有跑分均来自阿里自建测试框架:包括 QwenSWEBench、QwenQoderBench、CoWorkBench、RecreationBench 等内部基准。
  • 跑分表脚注暗指竞品数据存疑:脚注写着「Fable 5 的结果可能涉及 fallback」,但阿里自己的测试方法论同样未公开到可供第三方复现的程度。
  • 预览阶段透明度问题:7 月 19 日预览版禁止自动化生产环境调用,未公开 model card 与安全评估报告。

这些不代表 Qwen3.8-Max 性能不行——从目前唯一的独立盲测看,它确实与 Kimi K3 同一档位——但「跻身全球第一梯队」这类结论,目前主要还是阿里的一面之词,需等开源权重落地、第三方跑分上线后才能真正验证。

07 · 影响与背景:中国大模型的「参数竞赛」进入新阶段

  • 2026 年是万亿参数模型的「扩产年」:DeepSeek V4-Pro(1.6T)→ Qwen3.8-Max(2.4T)→ Kimi K3(2.8T),但 DeepSeek V4-Flash 证明不靠堆参数也能大幅提升智能体能力——参数竞赛叙事正被「架构效率竞赛」取代。
  • 阿里罕见地「回归开源」:此前几代千问 Max 级模型走闭源路线,这次是首次承诺开源 Max 级权重,与 Kimi K3、DeepSeek 构成国产头部「集体转向开放权重」格局。
  • 千问已嵌入 Apple Intelligence 国行:经压缩到 4GB 以内的 Qwen 模型可在 iPhone 15 及以上机型本地运行,商业化半径延伸为数亿部 iPhone 的系统级 AI 能力。
  • 中美 AI 叙事对照:Qwen3.8-Max 发布前后,OpenAI 与 Anthropic 披露 Agent 越狱入侵真实企业系统事件,白宫 8 月 4 日召集巨头商讨自愿性网络安全测试框架——一边加速开源抢占生态,一边收紧 Agent 审查。

08 · 五步 Mac 隔离试跑(Agent 工具链验收)

  1. 在 QwenCloud 注册 API Key,用 OpenAI 或 Anthropic 兼容 SDK 跑通基线任务(长文档摘要 / 修 bug / 多文件重构各 1 个),记录 xhigh 与 low 档 latency 差异
  2. 在隔离环境配置 ANTHROPIC_BASE_URL 或 OpenAI 兼容端点,接入 Claude Code / OpenClaw / Qoder CLI,避免 API Key 写入主力机全局 shell
  3. 对照 Kimi K3 与 DeepSeek V4-Flash 跑同一组 269 文件级架构任务,记录盲审打分与 $/task 账单
  4. 关注 Hugging Face / ModelScope 上 Qwen3.8-Max 与 Qwen3.8-27B 仓库上线时间与 LICENSE 条款,权重落地后再评估本地 Ollama 部署可行性
  5. 结合 Kimi K3 开源解读与本文对比表,输出团队选型文档并设定 8 月 10 日前后的复测节点
# Anthropic 兼容接口示例(隔离环境试跑) export ANTHROPIC_BASE_URL="https://dashscope.aliyuncs.com/compatible-mode/v1" export ANTHROPIC_API_KEY="your-qwen-api-key" claude -p "Summarize Qwen3.8-Max GA release on August 3, 2026."

09 · 常见问题 FAQ

Q1:Qwen3.8-Max 现在能直接用吗?开源了没有?
A:API 已可通过 QwenCloud 调用,兼容 OpenAI 和 Anthropic 两种接口协议。但权重尚未开源,预计 8 月 10 日前后登陆 Hugging Face 与 ModelScope,具体日期以官方公告为准。

Q2:Qwen3.8-Max 和 Kimi K3 到底谁更强?
A:目前没有权威的统一评测。唯一独立盲测显示两者打分非常接近(Kimi K3 83 分、Qwen3.8-Max 预览版 80 分)。Kimi K3 优势是已开源并有第三方评测;Qwen3.8-Max 优势是 API 价格更低、多模态更全面。

Q3:2.4 万亿参数是不是意味着普通开发者根本用不起?
A:实际激活 950 亿,通过 API 调用成本接近千亿级模型。本地私有化部署完整版需多节点数据中心,更现实的选择是等待 Qwen3.8-27B 精简版开源。

Q4:阿里公布的跑分能信吗?
A:可以作为参考,但不能当作定论。所有数据目前均来自阿里自建测试框架,建议关注后续独立评测或在自己的业务场景做 A/B 测试。

Q5:这次发布对普通用户有什么实际影响?
A:苹果国行 Apple Intelligence 的生成式 AI 能力基于经压缩后的 Qwen 模型本地运行,国内 iPhone 用户未来会在系统层面直接用到千问系列能力。

10 · 租用 Mac 弹性验证:在主力机外完成 Qwen3.8-Max Agent 试跑

Qwen3.8-Max API 虽已通过 OpenAI / Anthropic 双协议降低迁移成本,但在主力开发机上直接切换 Agent 工具链仍有风险:API Key 污染全局环境、长上下文实验不可逆占用本地缓存、与 Claude Code / OpenClaw 并存的配置冲突难以回滚。Windows 或 Linux 用户虽可调用云端 API,但无法完整验证与 macOS 原生 Xcode、Keychain 并存的 Agent 工作流。

虽然你可以直接在笔记本上接入 Qwen3.8-Max API 完成短期验证,但主力机更适合稳定交付;若在 Windows 或老旧 Intel Mac 上远程试水,常见风险包括延迟误判、无法完整验证证书链与本地 Ollama 并存场景。若你追求按天计费、隔离环境、真实 Apple Silicon 硬件且不愿为「试模型」专门买机器,MacDate 按天弹性租用让你在权重落地前低成本完成 Agent 工具链对照实验。计费见 M 系列 Mac 算力租赁定价

短期用云端 API 完成选型验证完全合理;若你需要可复现的 Agent 环境、完整 Apple 生态兼容与更低的 Key 泄露风险,直接租用 Mac mini M4 通常是更优解,而按天租赁能进一步降低前期投入与选型失误成本。

11 · 数据来源

  • 阿里云官方博客与新闻稿(Qwen3.8-Max 发布公告、定价页面)
  • Alibaba Cloud Community、Alibaba Press Room 英文公告
  • Arena.ai 文本/视觉竞技场公开排行榜(2026 年 8 月 1 日快照)
  • 国内媒体报道:网界、大模型之家、ITBear、新浪财经等
  • 独立评测/分析:Apidog、Yotta Labs、eesel AI、Context Studios、MarkTechPost、TechNode、SiliconANGLE
  • Apple Intelligence 国行相关:TechCrunch、Memeburn、Digital Market Reports

发布前请务必核实最新的官方公告、开源时间及具体跑分数据,部分数字可能随官方后续更新而变化。