Rate card Open weights 2026-08-17

DeepSeek rate-card +1100%, Qwen3.8-Max 2.4T weights, GLM-5.3 RL: разбор августовского сдвига

Кому больно? Командам с routing через DeepSeek / Qwen / GLM: четырезначный hike, 2.4T checkpoint и coding jump на том же base. Что внутри: официальная rate card, license gates и почему heuristic «китайская модель = самая дешёвая» сломана. Карта: delta по шести line items, MoE topology, vendor benches, timeline как release cadence, три стратегии, $/M matrix, unverified, isolated Mac runbook, FAQ×5.

Подорожание DeepSeek API, open weights Qwen3.8-Max и post-training GLM-5.3, август 2026

Разбор GA 3 августа: Qwen3.8-Max open source. Flash: DeepSeek V4 Flash benchmark и цена. US-side cut: GPT-5.6 Luna −80%.

01 · Rate-card delta: что реально выросло

Если смотреть только на headline +1100%, вы оптимизируете не тот line item. +1100% — peak cache-hit input у V4-Pro, позиция, которая стартовала ближе всего к нулю (¥0,025 → ¥0,30). Output, который доминирует в большинстве реальных invoice, вырос на 350%. Независимая модель для heavy user ~84M tokens/мес, mostly off-peak, половина cache hits → ≈1,8× старого счёта. Effective 17 августа 2026, 00:00 Beijing; peak windows 09:00–12:00 и 14:00–18:00 Beijing.

Line item (за 1M tokens) Old New off-peak New peak Peak Δ
V4-Flash cache hit (in)¥0,02¥0,05¥0,10~400%
V4-Flash cache miss (in)¥1,0¥1,5¥3,0200%
V4-Flash output¥2,0¥4,5¥9,0350%
V4-Pro cache hit (in)¥0,025¥0,15¥0,30~1100%
V4-Pro cache miss (in)¥3,0¥4,5¥9,0200%
V4-Pro output¥6,0¥13,5¥27,0350%

Side effect, который international coverage почти не ловит: на peak official DeepSeek API теперь дороже части reseller'ов (GMI Cloud, Novita и другие держат V4-Pro ниже нового peak). Heuristic «official API = cheapest DeepSeek path» сломан.

02 · Три failure modes в биллинге

  1. Headline ≠ invoice. Peak cache-hit input вырос сильнее всех, потому что стартовал у нуля. Output +350%. Если ваш mix — длинные completion'ы, вы живёте в 350%, не в 1100%.
  2. Downloadable ≠ Apache 2.0. Qwen3.8-Max качается, но MaaS / AI Work Assistant с >$50M за любые 12 месяцев требует отдельную commercial license. 100M MAU или $20M monthly revenue — обязательный display имени модели.
  3. «CN model = cheapest» — stale heuristic. Off-peak V4-Pro всё ещё ниже Claude Opus 5; intl Qwen3.8-Max и GPT-5.6 Luna бьют DeepSeek хотя бы по одной оси.

03 · Qwen3.8-2.4T-A95B: MoE topology и license gates

Spec Value
Parameters2.4T total, 95B active / token (MoE, 512 experts, 10 routed + 1 shared)
Context262144 native (open checkpoint), extend ~1.01M; hosted Max default 1M
CadencePreview 2 авг → hosted API 3 авг → open weights 12 авг
API intl$2 / M in, $6 / M out
LicenseНе Apache 2.0 — custom Qwen3.8-Max License
Почему важноПервый Max-tier open weights; Qwen3.5 / 3.6 / 3.7 Max оставались API-only

Gates жёсткие и не географические. MaaS или AI Work Assistant с >$50M за 12 месяцев → отдельная commercial license. 100M MAU или $20M monthly revenue → display model name. Слух про geo-ban US/EU/UK/KR — FALSE: в опубликованном LICENSE нет territorial clause. Читайте файл, не тред.

04 · GLM-5.3: post-training RL, тот же 743B base

Самый интересный факт — метод, не score. Same 743B foundation как GLM-5.2, no retraining, ~6× Terminal-Bench 3.0 (4.6% → 28.3%) чисто за счёт scaled RL environments в post-training. Pretraining scaling даёт diminishing returns; post-training RL становится отдельным рычагом с более низким cost floor, чем новый foundation. Vendor self-test, third-party rerun не опубликован.

Benchmark GLM-5.2 GLM-5.3 Δ
Terminal-Bench 3.04.6%28.3%+23.7 pts
DeepSWE46.2%66.9%+20.7 pts
ALE CLI23.8%28.5%+4.7 pts
CyberGym77.2%84.5%+7.3 pts
AutomationBench26.2%48.2%+22.0 pts

На TB3 GLM-5.3 всё ещё ниже GPT-5.6 Sol (34.6%) и Claude Fable 5 (33.7%). Top open-weight result, не frontier win.

05 · Timeline как release cadence

Дата Событие
16 июля 2026Moonshot open-weights Kimi K3 (2.8T), US security scrutiny
30 июля 2026OpenAI GPT-5.6 Luna −80%
2–3 августа 2026Alibaba preview, затем hosted API Qwen3.8-Max
6–7 августа 2026Luna = free default + unlimited text
10 августа 2026Meta Muse Glimmer 30B Apache 2.0, tease open weights Muse Spark 1.2
12 августа 2026Qwen3.8-2.4T-A95B на HF / ModelScope; xAI Grok 4.6
13 августа 2026DeepSeek-V4-Pro GA + hike с 17.08; Google Gemini 3.7 Flash discounted
14 августа 2026Zhipu GLM-5.3, тот же 743B base что GLM-5.2
17 августа 2026, 00:00 BeijingНовая pricing DeepSeek live

06 · Три стратегии: capacity / mindshare / RL scale

DeepSeek: time-of-day = capacity signal

Плоский always-cheap тариф работал как CAC-инструмент, пока GPU capacity держала demand. Когда usage вырос экспоненциально, а capacity нет, дефицит пришлось сделать явным. Peak compute scarce — shift load yourself. Это pricing power, не «сдались по марже».

Alibaba: weights → mindshare, custom license → ceiling

Полный 2.4T checkpoint публичен, лицензия — custom Qwen3.8-Max License, не permissive Apache 2.0 младших Qwen. International mindshare (где «made-in-China» всё ещё тормозит enterprise) плюс рычаг над теми, кто способен поднять competing inference business. Другая ставка, чем Meta Muse Glimmer под unrestricted Apache 2.0.

Zhipu: no new base, bigger post-train bet

743B без retraining, ~6× TB3 за счёт RL scale. Для mid-tier lab без OpenAI-scale pretrain budget это более низкий barrier to entry: крутить environments дешевле, чем заново лить foundation.

07 · Cross-vendor $/M matrix

FX ≈ ¥7.15 / $1.

Model Input / 1M Output / 1M Open weights?
DeepSeek V4-Pro (peak)¥9,0 (~$1.26)¥27,0 (~$3.78)No
DeepSeek V4-Pro (off-peak)¥4,5 (~$0.63)¥13,5 (~$1.89)No
Qwen3.8-Max (intl API)$2.00$6.00Yes (custom license)
OpenAI GPT-5.6 Luna$0.20$1.20No
Claude Opus 5 (implied)~$5.00~$25.00No

Короткий ответ: нет. Off-peak V4-Pro всё ещё заметно ниже Claude Opus 5, но это уже не outright cheapest — intl Qwen3.8-Max и Luna undercut DeepSeek off-peak хотя бы по одной оси. «Chinese = cheapest» держалось большую часть 2025 и начала 2026; как assumption больше не safe.

08 · Unverified: Zhenwu, Cursor, MOFCOM

  • «1100%» technically accurate, без контекста misleading. Только peak cache-hit input. Output +350%. Разные издания цитируют разные line items как всю историю.
  • Zhenwu M890 / Pangu AL128: китайские финансовые СМИ пишут, что Qwen3.8-Max крутится на in-house чипах Alibaba и supernodes «Pangu AL128». Независимо не подтверждено ни технической документацией Alibaba, ни third-party benches. Vendor-adjacent, unverified.
  • GLM-5.3 «серьёзная» Cursor vuln: VentureBeat + Zhipu; technical details не раскрыты. Vendor-sourced, не independently audited.
  • MOFCOM retaliatory export controls: слухи про ответные ограничения КНР на AI / semiconductors — unconfirmed media, не official announcement.

09 · Two-front war: open-weight vs free consumer

За примерно месяц топ-лабы КНР шли в темпе, который местная финпресса называет «一周三更» — три апдейта модели в неделю: DeepSeek, Alibaba, Zhipu, плюс Moonshot Kimi K3 (16 июля, 2.8T) и MiniMax H3 до них. Рамка покрытия: китайские open-weight релизы «форсят глобальный repricing».

US labs играют противоположный consumer play: OpenAI режет Luna на 80% 30 июля, затем 6–7 августа делает её free default с unlimited text; Google 13 августа отдаёт discounted Gemini 3.7 Flash. Китай открывает flagship weights и вводит tiered, более высокий peak на compute-constrained вершине; США бегут к free/cheap на consumer конце. Обе стратегии реальные, разные части воронки.

Есть и geopolitical reading, который стоит назвать аккуратно. Kimi K3 в июле уже получил US security scrutiny; выбор Alibaba открыть 2.4T Max в этом окне читают как lock-in international mindshare до возможного regulatory tightening. Это informed interpretation, не confirmed fact.

10 · Isolated Mac runbook, 5 шагов

Production routing не переключают на ноутбуке, где уже лежат company keys. Нужен disposable Apple Silicon node:

  1. Замапить peak windows. Batch и cache-friendly jobs вынести за 09:00–12:00 и 14:00–18:00 Beijing. Оценить, похожи ли последние 30 дней на 1.8× heavy-user case или на headline 1100%.
  2. Пройти license gates. $50M MaaS / AI Work Assistant и 100M MAU / $20M monthly-revenue attribution. Internal use обычно ок; resell inference ≠ «free because checkpoint downloaded».
  3. Прогнать один task set. V4-Pro, Qwen3.8-Max, GLM-5.3 на одном coding-agent suite. Логировать cache-hit rate, output share, $/completed task — не только public rate card.
  4. Изолировать на арендованном Mac. Суточный node из тарифов bare-metal macOS. Keys и eval logs вне daily-driver Keychain.
  5. Уничтожить node. Экспорт cost model и off-peak cron, wipe аренды, чтобы эксперимент не уехал в production.
# Off-peak batch window Asia/Shanghai # Peak: 09:00-12:00 and 14:00-18:00 export TZ=Asia/Shanghai mkdir -p ~/llm-cost/{logs,prompts,reports} crontab -l

11 · FAQ

DeepSeek после повышения всё ещё дешевле GPT-5.6 или Claude?
Off-peak дешевле Claude Opus 5, но это уже не single cheapest option. GPT-5.6 Luna ($0.20 / $1.20 за миллион токенов) и intl Qwen3.8-Max ($2 / $6) undercut DeepSeek off-peak хотя бы по одной оси. DeepSeek остаётся относительно дешёвым frontier-классом, не outright cheapest.

Можно ли бесплатно использовать open weights Qwen3.8-Max в коммерческом продукте?
Да для большинства кейсов — личные проекты и internal enterprise. Catch только если вы ведёте MaaS или AI Work Assistant с >$50M за любые 12 месяцев подряд; этот tier требует отдельную commercial license от Alibaba.

Qwen3.8-Max запрещён для пользователей США, ЕС или Великобритании?
Нет. Слух ложный — в опубликованной лицензии нет geographic restriction. Ограничения revenue-based, не привязаны к локации вас или пользователей. KR-бан тоже FALSE.

Чем GLM-5.3 реально отличается от GLM-5.2?
На base-model уровне — ничем: тот же 743B foundation. Gains (~6× на Terminal-Bench 3.0) целиком из scaled RL в post-training, без retraining базы.

Meta реально откроет флагман, а не только Muse Glimmer?
Пока нет. Muse Glimmer — distilled 30B, не настоящий flagship. Open weights для большего closed Muse Spark 1.2 обещаны «soon»; на момент публикации релиза нет. Stated intention, не confirmed fact.

12 · Зачем ephemeral Mac для cost model

Можно переключить API keys на личном ноуте или прогнать one-off bake-off на Windows/Linux cloud box. Это ок для throwaway script. Плохой fit для cost model, который вы хотите оставить: company secrets сидят в том же Keychain, что eval keys; peak-hour misfire сжигает monthly budget; generic cloud images не дают native macOS / Apple Silicon sidecar tooling. Если нужна воспроизводимая cost-вывод, суточный биллинг и настоящее Apple железо, isolated Mac — чище как lab. Аренда избавляет от покупки машины ради недельного pricing experiment. См. тарифы bare-metal macOS и заказать вычислительные узлы M4.

13 · Источники

  • Официальный pricing announcement DeepSeek, сверка с Wall Street CN, IT Home, AIGC.cn и обсуждением V2EX
  • Официальные репозитории Qwen (Hugging Face / ModelScope) и South China Morning Post по license terms
  • Официальная техническая страница GLM-5.3 Zhipu (Z.ai), плюс VentureBeat и StableLearn
  • Официальный блог Meta AI Research и покрытие VentureBeat по Muse Glimmer
  • Китайские финансовые издания (Yicai / 第一财经, Sohu Finance) о темпе и framing open-weight цикла

Цены, лицензии и бенчмарки — по публичным данным на дату публикации. Перед перепечаткой сверяйте актуальные official pricing и LICENSE. Пункты, помеченные unverified (chip claims, Cursor vuln, export-control rumors), независимо не подтверждены.