Qwen3.8-Max GA: 2,4T sparse MoE в Arena топ-5 — open weight vs маркетинг
Кому и зачем: Mac-разработчикам и ML-инженерам, которые выбирают между Qwen3.8-Max, Kimi K3 и DeepSeek V4-Flash после августовского GA — нужно отделить sparse MoE-спеки от маркетингового «Open-Source» badge и понять, когда веса реально появятся на HF. Что внутри: таймлайн 19.07–3.08, таблица спецификаций, матрица конкурентов, разбор hybrid attention + reasoning_effort, спор о преждевременном open-source лейбле. Структура: боли×3, сравнительные таблицы, 5 шагов изолированной валидации, FAQ×5, CTA аренды Mac.
Содержание
Kimi K3 open weight — технический разбор 27.07; Qwen в китайском Apple Intelligence — таймлайн CAC и Baidu.
3 августа 2026 Alibaba вывела в GA флагман Qwen3.8-Max: 2,4 трлн total params, 950 млрд active per forward pass, контекст 1M токенов, параллельно запустив агентный продукт «千问办公». В Arena Text (снимок 1.08) модель заняла 5-е место (1496 pts, статус Preliminary) — единственная не-Anthropic в топ-8. Все цифры бенчмарков на момент публикации — из внутренних фреймворков Alibaba; независимый GA-прогон Artificial Analysis ещё не вышел.
01 · Три узких места: почему «смотреть на Arena» недостаточно
- Badge «Open-Source» опережает артефакт. qwen.ai пометил модель open-source в день GA, но на Hugging Face и ModelScope нет repo, LICENSE и checksum весов — только обещание «на следующей неделе» (~10.08). Для compliance-команд это не open weight, а roadmap.
- Бенчмарки = Alibaba test harness. PaperBench 93,0, QwenSWEBench, RecreationBench — proprietary pipelines. Arena #5 помечен Preliminary; AA Index, METR и независимые SWE-прогоны GA-версии отсутствуют. Сравнивать с Kimi K3 (AA ≈57, публичные веса) на «официальной таблице» — apples-to-oranges.
- Preview оставил trust debt. 19.07 preview: 10 % от финальной цены, но без active param count, без scorecard, ToS запрещал automated production calls. GA раскрыл 950B active — но model card и safety eval по-прежнему тоньше, чем у Moonshot K3 technical report.
02 · Хронология: две недели плотного релизного давления
- 16.07 — Moonshot публикует Kimi K3: 2,8T MoE, 896 experts / 16 active, прозрачный tech report.
- 19.07 — Qwen3.8-Max preview в Token Plan / Qoder / QoderWork; цена 10 % от GA, спеки урезаны.
- 27.07 — K3 weights на Hugging Face + MoonEP / FlashKDA / AgentEnv infra.
- 31.07 — DeepSeek V4-Flash GA: параметры без изменений vs V4-Pro, но agent/code бенчмарки выше preview.
- 3.08 — Qwen3.8-Max GA, полная scorecard, «千问办公». Alibaba HK +7 %, ADR +4,5 %.
- ~10.08 (ожидание) — Qwen3.8-Max + Qwen3.8-27B на HF/ModelScope; LICENSE TBD.
03 · Таблица спецификаций Qwen3.8-Max
| Параметр | Qwen3.8-Max |
|---|---|
| Дата GA | 3 августа 2026 |
| Total / active params | 2,4T / 950B (sparse MoE) |
| Архитектура | Qwen3.5-derived sparse MoE + hybrid attention |
| Контекст | 1M tokens (thinking mode ~983K in, max out ~131K) |
| API pricing | input $2/M, output $6/M |
| CN pricing | ¥12/¥36 per M; cache hit от ¥1,5/M |
| Arena Text (1.08) | #5, 1496 pts (Preliminary) |
| Arena Vision | #2 (после Claude Fable 5) |
| PaperBench (self) | 93,0 (+28,2 vs prior) |
| SWE-bench Pro (self) | 67,7 (Fable 5: 80,0) |
| Weights status | Closed; HF ~10.08 |
Hard data #1: API $2/$6 per M — ниже Claude Opus 5 ($5/$25) и Fable 5 ($10/$50); price/performance hook для agent routing.
Hard data #2: Arena Text #5 / 1496 pts — единственная non-Anthropic в топ-8, но статус Preliminary до независимого blind pool.
Hard data #3: GA-day market reaction — Alibaba HK +7 %, US ADR +4,5 %; капитал читает это как возврат AI-нарратива, не как верифицированный SOTA.
04 · MoE + hybrid attention: что происходит на уровне forward pass
4.1 Sparse MoE вместо dense 2,4T
2,4T total — marketing surface; на inference активируется ~950B. Router выбирает expert subset per token → FLOPs и memory bandwidth ближе к ~1T-class dense, не к полному 2,4T matmul. Это архитектурный price lever: дешевле Anthropic при сопоставимом (по их таблице) quality tier.
4.2 reasoning_effort: low / medium / xhigh
Три уровня compute budget на запрос. Default — xhigh. Вызов через enable_thinking (OpenAI-compat) или reasoning.effort (Anthropic-compat). Для latency-sensitive agent loops — профилируйте low vs xhigh на representative task set; delta latency может быть 3–8× на длинных chain-of-thought.
4.3 Agent ecosystem и long-horizon tasks
Alibaba демонстрирует 16-дневный автономный coding run, 500+ step chip design optimization, RecreationBench (black-box app recreation). API dual-stack: OpenAI + Anthropic protocols → drop-in для Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw без fork SDK.
05 · Матрица решений: Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude
| Модель | Total / active | API ($/M in/out) | Weights | Независимый eval |
|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 950B | $2 / $6 | Pending (~10.08) | Нет GA AA |
| Kimi K3 | 2,8T / ~500B | $3 / $15 | Open (27.07) | AA Index ≈57 |
| DeepSeek V4-Flash | = V4-Pro base | peak-valley TBD | Open | 9 agent benches > V4-Pro |
| Claude Opus 5 | NDA | $5 / $25 | Closed | Arena top tier |
| Claude Fable 5 | NDA | $10 / $50 | Closed | Arena Text #1 |
Единственный публичный blind test (269 файлов, архитектурный дизайн): K3 — 83, Qwen3.8-Max preview — 80. Разрыв в пределах шума; выбор сводится к цене API, multimodal (Qwen #2 Vision Arena) и требованию auditable weights (пока только K3).
06 · Спор: Open-Source badge без checksum весов
- Маркетинг vs OSI definition. Сайт уже несёт «Open-Source», HF пуст — для security review это closed model с forward commitment.
- Proprietary benches. QwenSWEBench, QwenQoderBench, CoWorkBench, RecreationBench — нет public reproduction kit.
- Footnote про Fable 5. Alibaba отмечает «возможный fallback» у конкурента, не публикуя собственную методологию до уровня reproducible harness.
- Preview ToS. Запрет automated production на preview создал gap: ранние adopters тестировали вручную, не в CI — сравнение «до/после GA» статистически слабое.
Вывод не «модель слабая» — blind test показывает паритет с K3 — а «SOTA-нарратив пока односторонний». Вердикт после HF drop + AA/METR прогона.
07 · Контекст: триллионный класс 2026 и Apple Intelligence
- Параметрная эскалация: DeepSeek V4-Pro 1,6T → Qwen3.8-Max 2,4T → Kimi K3 2,8T; но V4-Flash доказал, что agent gains возможны без роста param count — сдвиг к efficiency race.
- Alibaba «возврат к open weight»: предыдущие Max-линейки были closed; впервые Max-tier обещан на HF — ответ на K3/DeepSeek open-weight давление.
- Apple Intelligence CN: сжатая Qwen (<4 ГБ) на iPhone 15+ — отдельный on-device path; см. разбор CAC.
- US-China agent security: параллельно OpenAI/Anthropic раскрывают agent jailbreak в enterprise; White House 4.08 — voluntary cyber testing framework. Open weights ускоряют экосистему, tightening — compliance surface.
08 · 5 шагов изолированной валидации (Mac-разработчик)
- QwenCloud API key → OpenAI или Anthropic SDK: по одному тесту (long doc summary, bugfix, multi-file refactor); логировать xhigh vs low latency и $/task
- Изолированный env:
ANTHROPIC_BASE_URLили OpenAI-compat endpoint; Claude Code / OpenClaw / Qoder CLI — key не в глобальный.zshrcdaily driver - A/B против Kimi K3 и DeepSeek V4-Flash на том же 269-file architecture task set; фиксировать blind score и invoice
- Мониторить HF/ModelScope: Qwen3.8-Max + Qwen3.8-27B repo, LICENSE, shard checksum — только после drop оценивать local Ollama path
- Свести decision doc с датой re-test ~10.08; критерии go/no-go: independent AA score, LICENSE compatibility, $/task на production representative load
09 · FAQ
В: Qwen3.8-Max уже open source?
О: Нет. API live (OpenAI + Anthropic stacks), веса на HF/ModelScope отсутствуют. Ожидание ~10.08 вместе с Qwen3.8-27B.
В: Сильнее Kimi K3?
О: Blind test 83 vs 80 — паритет. K3: auditable weights + AA; Qwen: дешевле API, сильнее multimodal Arena.
В: Self-host 2,4T на Mac?
О: Нет. 950B active per pass; full deploy = multi-node GPU. Ждите 27B или API.
В: Доверять бенчмаркам Alibaba?
О: Ориентир — да; вердикт — после AA/METR и вашего A/B на production tasks.
В: Связь с Apple Intelligence?
О: On-device сжатая Qwen в CN iOS — другой inference path, не облачный Qwen3.8-Max API.
10 · Аренда изолированного Mac: Qwen3.8-Max Agent без Keychain contamination
Dual-protocol API снижает migration cost, но на daily driver Mac остаются риски: Qwen key в Keychain рядом с production Anthropic credentials, million-token runs засоряют локальный cache, конфликт ANTHROPIC_BASE_URL с Claude Code hard to rollback. Windows/Linux вызывают API, но не воспроизводят macOS-native agent pipeline (Xcode, codesign, TCC) в одном узле.
Краткий API smoke на ноутбуке — норм; для reproducible agent acceptance нужен destroy-after-test bare-metal Apple Silicon: изолированный routing Qwen vs K3 vs DeepSeek, SSH-only access, key revoke + node wipe по завершении. Посуточная аренда привязывает OPEX к окну до HF drop ~10.08. Тарифы: тарифы bare-metal macOS, также руководство по ценам Mac mini M4.
Облачный API для разового сравнения — рационально; если нужен чистый macOS agent sandbox, полный Apple ecosystem и нулевой follow-up cleanup на production machine — аренда M4 bare-metal обычно дешевле ошибки миграции, чем CapEx на «машину для экспериментов».
11 · Источники
- Alibaba Cloud blog, press room, QwenCloud pricing (GA 3.08.2026)
- Arena.ai Text/Vision leaderboards (snapshot 1.08.2026)
- Independent analysis: Apidog, Yotta Labs, eesel AI, Context Studios, MarkTechPost, TechNode, SiliconANGLE
- Контекст K3/V4: Kimi K3 разбор, DeepSeek V4 GA
- Apple Intelligence CN: TechCrunch, Memeburn, Digital Market Reports
Данные на 4 августа 2026. Перед production — проверить HF repo, LICENSE и независимые бенчмарки после ~10.08.