Китайский LLM GA 3 августа 2026 2026-08-04

Qwen3.8-Max GA: 2,4T sparse MoE в Arena топ-5 — open weight vs маркетинг

Кому и зачем: Mac-разработчикам и ML-инженерам, которые выбирают между Qwen3.8-Max, Kimi K3 и DeepSeek V4-Flash после августовского GA — нужно отделить sparse MoE-спеки от маркетингового «Open-Source» badge и понять, когда веса реально появятся на HF. Что внутри: таймлайн 19.07–3.08, таблица спецификаций, матрица конкурентов, разбор hybrid attention + reasoning_effort, спор о преждевременном open-source лейбле. Структура: боли×3, сравнительные таблицы, 5 шагов изолированной валидации, FAQ×5, CTA аренды Mac.

Релиз Alibaba Qwen3.8-Max GA август 2026: sparse MoE 2,4T, Arena текстовый рейтинг и open weight roadmap

Kimi K3 open weight — технический разбор 27.07; Qwen в китайском Apple Intelligence — таймлайн CAC и Baidu.

3 августа 2026 Alibaba вывела в GA флагман Qwen3.8-Max: 2,4 трлн total params, 950 млрд active per forward pass, контекст 1M токенов, параллельно запустив агентный продукт «千问办公». В Arena Text (снимок 1.08) модель заняла 5-е место (1496 pts, статус Preliminary) — единственная не-Anthropic в топ-8. Все цифры бенчмарков на момент публикации — из внутренних фреймворков Alibaba; независимый GA-прогон Artificial Analysis ещё не вышел.

01 · Три узких места: почему «смотреть на Arena» недостаточно

  1. Badge «Open-Source» опережает артефакт. qwen.ai пометил модель open-source в день GA, но на Hugging Face и ModelScope нет repo, LICENSE и checksum весов — только обещание «на следующей неделе» (~10.08). Для compliance-команд это не open weight, а roadmap.
  2. Бенчмарки = Alibaba test harness. PaperBench 93,0, QwenSWEBench, RecreationBench — proprietary pipelines. Arena #5 помечен Preliminary; AA Index, METR и независимые SWE-прогоны GA-версии отсутствуют. Сравнивать с Kimi K3 (AA ≈57, публичные веса) на «официальной таблице» — apples-to-oranges.
  3. Preview оставил trust debt. 19.07 preview: 10 % от финальной цены, но без active param count, без scorecard, ToS запрещал automated production calls. GA раскрыл 950B active — но model card и safety eval по-прежнему тоньше, чем у Moonshot K3 technical report.

02 · Хронология: две недели плотного релизного давления

  • 16.07 — Moonshot публикует Kimi K3: 2,8T MoE, 896 experts / 16 active, прозрачный tech report.
  • 19.07 — Qwen3.8-Max preview в Token Plan / Qoder / QoderWork; цена 10 % от GA, спеки урезаны.
  • 27.07 — K3 weights на Hugging Face + MoonEP / FlashKDA / AgentEnv infra.
  • 31.07 — DeepSeek V4-Flash GA: параметры без изменений vs V4-Pro, но agent/code бенчмарки выше preview.
  • 3.08 — Qwen3.8-Max GA, полная scorecard, «千问办公». Alibaba HK +7 %, ADR +4,5 %.
  • ~10.08 (ожидание) — Qwen3.8-Max + Qwen3.8-27B на HF/ModelScope; LICENSE TBD.

03 · Таблица спецификаций Qwen3.8-Max

Параметр Qwen3.8-Max
Дата GA3 августа 2026
Total / active params2,4T / 950B (sparse MoE)
АрхитектураQwen3.5-derived sparse MoE + hybrid attention
Контекст1M tokens (thinking mode ~983K in, max out ~131K)
API pricinginput $2/M, output $6/M
CN pricing¥12/¥36 per M; cache hit от ¥1,5/M
Arena Text (1.08)#5, 1496 pts (Preliminary)
Arena Vision#2 (после Claude Fable 5)
PaperBench (self)93,0 (+28,2 vs prior)
SWE-bench Pro (self)67,7 (Fable 5: 80,0)
Weights statusClosed; HF ~10.08

Hard data #1: API $2/$6 per M — ниже Claude Opus 5 ($5/$25) и Fable 5 ($10/$50); price/performance hook для agent routing.

Hard data #2: Arena Text #5 / 1496 pts — единственная non-Anthropic в топ-8, но статус Preliminary до независимого blind pool.

Hard data #3: GA-day market reaction — Alibaba HK +7 %, US ADR +4,5 %; капитал читает это как возврат AI-нарратива, не как верифицированный SOTA.

04 · MoE + hybrid attention: что происходит на уровне forward pass

4.1 Sparse MoE вместо dense 2,4T

2,4T total — marketing surface; на inference активируется ~950B. Router выбирает expert subset per token → FLOPs и memory bandwidth ближе к ~1T-class dense, не к полному 2,4T matmul. Это архитектурный price lever: дешевле Anthropic при сопоставимом (по их таблице) quality tier.

4.2 reasoning_effort: low / medium / xhigh

Три уровня compute budget на запрос. Default — xhigh. Вызов через enable_thinking (OpenAI-compat) или reasoning.effort (Anthropic-compat). Для latency-sensitive agent loops — профилируйте low vs xhigh на representative task set; delta latency может быть 3–8× на длинных chain-of-thought.

4.3 Agent ecosystem и long-horizon tasks

Alibaba демонстрирует 16-дневный автономный coding run, 500+ step chip design optimization, RecreationBench (black-box app recreation). API dual-stack: OpenAI + Anthropic protocols → drop-in для Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw без fork SDK.

05 · Матрица решений: Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude

Модель Total / active API ($/M in/out) Weights Независимый eval
Qwen3.8-Max2,4T / 950B$2 / $6Pending (~10.08)Нет GA AA
Kimi K32,8T / ~500B$3 / $15Open (27.07)AA Index ≈57
DeepSeek V4-Flash= V4-Pro basepeak-valley TBDOpen9 agent benches > V4-Pro
Claude Opus 5NDA$5 / $25ClosedArena top tier
Claude Fable 5NDA$10 / $50ClosedArena Text #1

Единственный публичный blind test (269 файлов, архитектурный дизайн): K3 — 83, Qwen3.8-Max preview — 80. Разрыв в пределах шума; выбор сводится к цене API, multimodal (Qwen #2 Vision Arena) и требованию auditable weights (пока только K3).

06 · Спор: Open-Source badge без checksum весов

  • Маркетинг vs OSI definition. Сайт уже несёт «Open-Source», HF пуст — для security review это closed model с forward commitment.
  • Proprietary benches. QwenSWEBench, QwenQoderBench, CoWorkBench, RecreationBench — нет public reproduction kit.
  • Footnote про Fable 5. Alibaba отмечает «возможный fallback» у конкурента, не публикуя собственную методологию до уровня reproducible harness.
  • Preview ToS. Запрет automated production на preview создал gap: ранние adopters тестировали вручную, не в CI — сравнение «до/после GA» статистически слабое.

Вывод не «модель слабая» — blind test показывает паритет с K3 — а «SOTA-нарратив пока односторонний». Вердикт после HF drop + AA/METR прогона.

07 · Контекст: триллионный класс 2026 и Apple Intelligence

  • Параметрная эскалация: DeepSeek V4-Pro 1,6T → Qwen3.8-Max 2,4T → Kimi K3 2,8T; но V4-Flash доказал, что agent gains возможны без роста param count — сдвиг к efficiency race.
  • Alibaba «возврат к open weight»: предыдущие Max-линейки были closed; впервые Max-tier обещан на HF — ответ на K3/DeepSeek open-weight давление.
  • Apple Intelligence CN: сжатая Qwen (<4 ГБ) на iPhone 15+ — отдельный on-device path; см. разбор CAC.
  • US-China agent security: параллельно OpenAI/Anthropic раскрывают agent jailbreak в enterprise; White House 4.08 — voluntary cyber testing framework. Open weights ускоряют экосистему, tightening — compliance surface.

08 · 5 шагов изолированной валидации (Mac-разработчик)

  1. QwenCloud API key → OpenAI или Anthropic SDK: по одному тесту (long doc summary, bugfix, multi-file refactor); логировать xhigh vs low latency и $/task
  2. Изолированный env: ANTHROPIC_BASE_URL или OpenAI-compat endpoint; Claude Code / OpenClaw / Qoder CLI — key не в глобальный .zshrc daily driver
  3. A/B против Kimi K3 и DeepSeek V4-Flash на том же 269-file architecture task set; фиксировать blind score и invoice
  4. Мониторить HF/ModelScope: Qwen3.8-Max + Qwen3.8-27B repo, LICENSE, shard checksum — только после drop оценивать local Ollama path
  5. Свести decision doc с датой re-test ~10.08; критерии go/no-go: independent AA score, LICENSE compatibility, $/task на production representative load
# Anthropic-compat endpoint (изолированный узел) export ANTHROPIC_BASE_URL="https://dashscope.aliyuncs.com/compatible-mode/v1" export ANTHROPIC_API_KEY="your-qwen-api-key" claude -p "Summarize Qwen3.8-Max GA: 2.4T MoE, 950B active, Arena #5."

09 · FAQ

В: Qwen3.8-Max уже open source?
О: Нет. API live (OpenAI + Anthropic stacks), веса на HF/ModelScope отсутствуют. Ожидание ~10.08 вместе с Qwen3.8-27B.

В: Сильнее Kimi K3?
О: Blind test 83 vs 80 — паритет. K3: auditable weights + AA; Qwen: дешевле API, сильнее multimodal Arena.

В: Self-host 2,4T на Mac?
О: Нет. 950B active per pass; full deploy = multi-node GPU. Ждите 27B или API.

В: Доверять бенчмаркам Alibaba?
О: Ориентир — да; вердикт — после AA/METR и вашего A/B на production tasks.

В: Связь с Apple Intelligence?
О: On-device сжатая Qwen в CN iOS — другой inference path, не облачный Qwen3.8-Max API.

10 · Аренда изолированного Mac: Qwen3.8-Max Agent без Keychain contamination

Dual-protocol API снижает migration cost, но на daily driver Mac остаются риски: Qwen key в Keychain рядом с production Anthropic credentials, million-token runs засоряют локальный cache, конфликт ANTHROPIC_BASE_URL с Claude Code hard to rollback. Windows/Linux вызывают API, но не воспроизводят macOS-native agent pipeline (Xcode, codesign, TCC) в одном узле.

Краткий API smoke на ноутбуке — норм; для reproducible agent acceptance нужен destroy-after-test bare-metal Apple Silicon: изолированный routing Qwen vs K3 vs DeepSeek, SSH-only access, key revoke + node wipe по завершении. Посуточная аренда привязывает OPEX к окну до HF drop ~10.08. Тарифы: тарифы bare-metal macOS, также руководство по ценам Mac mini M4.

Облачный API для разового сравнения — рационально; если нужен чистый macOS agent sandbox, полный Apple ecosystem и нулевой follow-up cleanup на production machine — аренда M4 bare-metal обычно дешевле ошибки миграции, чем CapEx на «машину для экспериментов».

11 · Источники

  • Alibaba Cloud blog, press room, QwenCloud pricing (GA 3.08.2026)
  • Arena.ai Text/Vision leaderboards (snapshot 1.08.2026)
  • Independent analysis: Apidog, Yotta Labs, eesel AI, Context Studios, MarkTechPost, TechNode, SiliconANGLE
  • Контекст K3/V4: Kimi K3 разбор, DeepSeek V4 GA
  • Apple Intelligence CN: TechCrunch, Memeburn, Digital Market Reports

Данные на 4 августа 2026. Перед production — проверить HF repo, LICENSE и независимые бенчмарки после ~10.08.