DeepSeek rate-card +1100%, Qwen3.8-Max 2.4T weights, GLM-5.3 RL: разбор августовского сдвига
Кому больно? Командам с routing через DeepSeek / Qwen / GLM: четырезначный hike, 2.4T checkpoint и coding jump на том же base. Что внутри: официальная rate card, license gates и почему heuristic «китайская модель = самая дешёвая» сломана. Карта: delta по шести line items, MoE topology, vendor benches, timeline как release cadence, три стратегии, $/M matrix, unverified, isolated Mac runbook, FAQ×5.
Содержание
Разбор GA 3 августа: Qwen3.8-Max open source. Flash: DeepSeek V4 Flash benchmark и цена. US-side cut: GPT-5.6 Luna −80%.
01 · Rate-card delta: что реально выросло
Если смотреть только на headline +1100%, вы оптимизируете не тот line item. +1100% — peak cache-hit input у V4-Pro, позиция, которая стартовала ближе всего к нулю (¥0,025 → ¥0,30). Output, который доминирует в большинстве реальных invoice, вырос на 350%. Независимая модель для heavy user ~84M tokens/мес, mostly off-peak, половина cache hits → ≈1,8× старого счёта. Effective 17 августа 2026, 00:00 Beijing; peak windows 09:00–12:00 и 14:00–18:00 Beijing.
| Line item (за 1M tokens) | Old | New off-peak | New peak | Peak Δ |
|---|---|---|---|---|
| V4-Flash cache hit (in) | ¥0,02 | ¥0,05 | ¥0,10 | ~400% |
| V4-Flash cache miss (in) | ¥1,0 | ¥1,5 | ¥3,0 | 200% |
| V4-Flash output | ¥2,0 | ¥4,5 | ¥9,0 | 350% |
| V4-Pro cache hit (in) | ¥0,025 | ¥0,15 | ¥0,30 | ~1100% |
| V4-Pro cache miss (in) | ¥3,0 | ¥4,5 | ¥9,0 | 200% |
| V4-Pro output | ¥6,0 | ¥13,5 | ¥27,0 | 350% |
Side effect, который international coverage почти не ловит: на peak official DeepSeek API теперь дороже части reseller'ов (GMI Cloud, Novita и другие держат V4-Pro ниже нового peak). Heuristic «official API = cheapest DeepSeek path» сломан.
02 · Три failure modes в биллинге
- Headline ≠ invoice. Peak cache-hit input вырос сильнее всех, потому что стартовал у нуля. Output +350%. Если ваш mix — длинные completion'ы, вы живёте в 350%, не в 1100%.
- Downloadable ≠ Apache 2.0. Qwen3.8-Max качается, но MaaS / AI Work Assistant с >$50M за любые 12 месяцев требует отдельную commercial license. 100M MAU или $20M monthly revenue — обязательный display имени модели.
- «CN model = cheapest» — stale heuristic. Off-peak V4-Pro всё ещё ниже Claude Opus 5; intl Qwen3.8-Max и GPT-5.6 Luna бьют DeepSeek хотя бы по одной оси.
03 · Qwen3.8-2.4T-A95B: MoE topology и license gates
| Spec | Value |
|---|---|
| Parameters | 2.4T total, 95B active / token (MoE, 512 experts, 10 routed + 1 shared) |
| Context | 262144 native (open checkpoint), extend ~1.01M; hosted Max default 1M |
| Cadence | Preview 2 авг → hosted API 3 авг → open weights 12 авг |
| API intl | $2 / M in, $6 / M out |
| License | Не Apache 2.0 — custom Qwen3.8-Max License |
| Почему важно | Первый Max-tier open weights; Qwen3.5 / 3.6 / 3.7 Max оставались API-only |
Gates жёсткие и не географические. MaaS или AI Work Assistant с >$50M за 12 месяцев → отдельная commercial license. 100M MAU или $20M monthly revenue → display model name. Слух про geo-ban US/EU/UK/KR — FALSE: в опубликованном LICENSE нет territorial clause. Читайте файл, не тред.
04 · GLM-5.3: post-training RL, тот же 743B base
Самый интересный факт — метод, не score. Same 743B foundation как GLM-5.2, no retraining, ~6× Terminal-Bench 3.0 (4.6% → 28.3%) чисто за счёт scaled RL environments в post-training. Pretraining scaling даёт diminishing returns; post-training RL становится отдельным рычагом с более низким cost floor, чем новый foundation. Vendor self-test, third-party rerun не опубликован.
| Benchmark | GLM-5.2 | GLM-5.3 | Δ |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 pts |
| DeepSWE | 46.2% | 66.9% | +20.7 pts |
| ALE CLI | 23.8% | 28.5% | +4.7 pts |
| CyberGym | 77.2% | 84.5% | +7.3 pts |
| AutomationBench | 26.2% | 48.2% | +22.0 pts |
На TB3 GLM-5.3 всё ещё ниже GPT-5.6 Sol (34.6%) и Claude Fable 5 (33.7%). Top open-weight result, не frontier win.
05 · Timeline как release cadence
| Дата | Событие |
|---|---|
| 16 июля 2026 | Moonshot open-weights Kimi K3 (2.8T), US security scrutiny |
| 30 июля 2026 | OpenAI GPT-5.6 Luna −80% |
| 2–3 августа 2026 | Alibaba preview, затем hosted API Qwen3.8-Max |
| 6–7 августа 2026 | Luna = free default + unlimited text |
| 10 августа 2026 | Meta Muse Glimmer 30B Apache 2.0, tease open weights Muse Spark 1.2 |
| 12 августа 2026 | Qwen3.8-2.4T-A95B на HF / ModelScope; xAI Grok 4.6 |
| 13 августа 2026 | DeepSeek-V4-Pro GA + hike с 17.08; Google Gemini 3.7 Flash discounted |
| 14 августа 2026 | Zhipu GLM-5.3, тот же 743B base что GLM-5.2 |
| 17 августа 2026, 00:00 Beijing | Новая pricing DeepSeek live |
06 · Три стратегии: capacity / mindshare / RL scale
DeepSeek: time-of-day = capacity signal
Плоский always-cheap тариф работал как CAC-инструмент, пока GPU capacity держала demand. Когда usage вырос экспоненциально, а capacity нет, дефицит пришлось сделать явным. Peak compute scarce — shift load yourself. Это pricing power, не «сдались по марже».
Alibaba: weights → mindshare, custom license → ceiling
Полный 2.4T checkpoint публичен, лицензия — custom Qwen3.8-Max License, не permissive Apache 2.0 младших Qwen. International mindshare (где «made-in-China» всё ещё тормозит enterprise) плюс рычаг над теми, кто способен поднять competing inference business. Другая ставка, чем Meta Muse Glimmer под unrestricted Apache 2.0.
Zhipu: no new base, bigger post-train bet
743B без retraining, ~6× TB3 за счёт RL scale. Для mid-tier lab без OpenAI-scale pretrain budget это более низкий barrier to entry: крутить environments дешевле, чем заново лить foundation.
07 · Cross-vendor $/M matrix
FX ≈ ¥7.15 / $1.
| Model | Input / 1M | Output / 1M | Open weights? |
|---|---|---|---|
| DeepSeek V4-Pro (peak) | ¥9,0 (~$1.26) | ¥27,0 (~$3.78) | No |
| DeepSeek V4-Pro (off-peak) | ¥4,5 (~$0.63) | ¥13,5 (~$1.89) | No |
| Qwen3.8-Max (intl API) | $2.00 | $6.00 | Yes (custom license) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | No |
| Claude Opus 5 (implied) | ~$5.00 | ~$25.00 | No |
Короткий ответ: нет. Off-peak V4-Pro всё ещё заметно ниже Claude Opus 5, но это уже не outright cheapest — intl Qwen3.8-Max и Luna undercut DeepSeek off-peak хотя бы по одной оси. «Chinese = cheapest» держалось большую часть 2025 и начала 2026; как assumption больше не safe.
08 · Unverified: Zhenwu, Cursor, MOFCOM
- «1100%» technically accurate, без контекста misleading. Только peak cache-hit input. Output +350%. Разные издания цитируют разные line items как всю историю.
- Zhenwu M890 / Pangu AL128: китайские финансовые СМИ пишут, что Qwen3.8-Max крутится на in-house чипах Alibaba и supernodes «Pangu AL128». Независимо не подтверждено ни технической документацией Alibaba, ни third-party benches. Vendor-adjacent, unverified.
- GLM-5.3 «серьёзная» Cursor vuln: VentureBeat + Zhipu; technical details не раскрыты. Vendor-sourced, не independently audited.
- MOFCOM retaliatory export controls: слухи про ответные ограничения КНР на AI / semiconductors — unconfirmed media, не official announcement.
09 · Two-front war: open-weight vs free consumer
За примерно месяц топ-лабы КНР шли в темпе, который местная финпресса называет «一周三更» — три апдейта модели в неделю: DeepSeek, Alibaba, Zhipu, плюс Moonshot Kimi K3 (16 июля, 2.8T) и MiniMax H3 до них. Рамка покрытия: китайские open-weight релизы «форсят глобальный repricing».
US labs играют противоположный consumer play: OpenAI режет Luna на 80% 30 июля, затем 6–7 августа делает её free default с unlimited text; Google 13 августа отдаёт discounted Gemini 3.7 Flash. Китай открывает flagship weights и вводит tiered, более высокий peak на compute-constrained вершине; США бегут к free/cheap на consumer конце. Обе стратегии реальные, разные части воронки.
Есть и geopolitical reading, который стоит назвать аккуратно. Kimi K3 в июле уже получил US security scrutiny; выбор Alibaba открыть 2.4T Max в этом окне читают как lock-in international mindshare до возможного regulatory tightening. Это informed interpretation, не confirmed fact.
10 · Isolated Mac runbook, 5 шагов
Production routing не переключают на ноутбуке, где уже лежат company keys. Нужен disposable Apple Silicon node:
- Замапить peak windows. Batch и cache-friendly jobs вынести за 09:00–12:00 и 14:00–18:00 Beijing. Оценить, похожи ли последние 30 дней на 1.8× heavy-user case или на headline 1100%.
- Пройти license gates. $50M MaaS / AI Work Assistant и 100M MAU / $20M monthly-revenue attribution. Internal use обычно ок; resell inference ≠ «free because checkpoint downloaded».
- Прогнать один task set. V4-Pro, Qwen3.8-Max, GLM-5.3 на одном coding-agent suite. Логировать cache-hit rate, output share, $/completed task — не только public rate card.
- Изолировать на арендованном Mac. Суточный node из тарифов bare-metal macOS. Keys и eval logs вне daily-driver Keychain.
- Уничтожить node. Экспорт cost model и off-peak cron, wipe аренды, чтобы эксперимент не уехал в production.
11 · FAQ
DeepSeek после повышения всё ещё дешевле GPT-5.6 или Claude?
Off-peak дешевле Claude Opus 5, но это уже не single cheapest option. GPT-5.6 Luna ($0.20 / $1.20 за миллион токенов) и intl Qwen3.8-Max ($2 / $6) undercut DeepSeek off-peak хотя бы по одной оси. DeepSeek остаётся относительно дешёвым frontier-классом, не outright cheapest.
Можно ли бесплатно использовать open weights Qwen3.8-Max в коммерческом продукте?
Да для большинства кейсов — личные проекты и internal enterprise. Catch только если вы ведёте MaaS или AI Work Assistant с >$50M за любые 12 месяцев подряд; этот tier требует отдельную commercial license от Alibaba.
Qwen3.8-Max запрещён для пользователей США, ЕС или Великобритании?
Нет. Слух ложный — в опубликованной лицензии нет geographic restriction. Ограничения revenue-based, не привязаны к локации вас или пользователей. KR-бан тоже FALSE.
Чем GLM-5.3 реально отличается от GLM-5.2?
На base-model уровне — ничем: тот же 743B foundation. Gains (~6× на Terminal-Bench 3.0) целиком из scaled RL в post-training, без retraining базы.
Meta реально откроет флагман, а не только Muse Glimmer?
Пока нет. Muse Glimmer — distilled 30B, не настоящий flagship. Open weights для большего closed Muse Spark 1.2 обещаны «soon»; на момент публикации релиза нет. Stated intention, не confirmed fact.
12 · Зачем ephemeral Mac для cost model
Можно переключить API keys на личном ноуте или прогнать one-off bake-off на Windows/Linux cloud box. Это ок для throwaway script. Плохой fit для cost model, который вы хотите оставить: company secrets сидят в том же Keychain, что eval keys; peak-hour misfire сжигает monthly budget; generic cloud images не дают native macOS / Apple Silicon sidecar tooling. Если нужна воспроизводимая cost-вывод, суточный биллинг и настоящее Apple железо, isolated Mac — чище как lab. Аренда избавляет от покупки машины ради недельного pricing experiment. См. тарифы bare-metal macOS и заказать вычислительные узлы M4.
13 · Источники
- Официальный pricing announcement DeepSeek, сверка с Wall Street CN, IT Home, AIGC.cn и обсуждением V2EX
- Официальные репозитории Qwen (Hugging Face / ModelScope) и South China Morning Post по license terms
- Официальная техническая страница GLM-5.3 Zhipu (Z.ai), плюс VentureBeat и StableLearn
- Официальный блог Meta AI Research и покрытие VentureBeat по Muse Glimmer
- Китайские финансовые издания (Yicai / 第一财经, Sohu Finance) о темпе и framing open-weight цикла
Цены, лицензии и бенчмарки — по публичным данным на дату публикации. Перед перепечаткой сверяйте актуальные official pricing и LICENSE. Пункты, помеченные unverified (chip claims, Cursor vuln, export-control rumors), независимо не подтверждены.