DeepSeek V4 GA релиз: MoE 1,6T, peak-valley биллинг и инженерный разбор против GPT-5.6
Кому и какая боль? Разработчикам на Mac с deepseek-chat/reasoner в проде: GA 20.07., hard cutoff API 24.07., непонятные peak-тарифы и выбор Pro/Flash. Что внутри: таймлайн, разбор CSA/HCA/mHC на уровне KV-cache и FLOPs, таблицы бенчмарков, ценовая матрица, 6 шагов миграции. Структура: боли×3, спеки, сравнение GPT-5.6/Fable 5, FAQ×6.
Оглавление
Контекст: обзор GPT-5.6 Sol; локальный inference: V4-Flash на Mac; чип DeepSeek: custom inference chip.
20 июля 2026 DeepSeek V4 выходит из preview в GA. Для инженера это не маркетинговый ивент: фиксируются production-tuned веса, вводится дифференцированный биллинг peak-valley и жёсткий дедлайн миграции API. Ниже — разбор на уровне параметров MoE, механизмов внимания и измеримых метрик inference, без отрыва от практики деплоя.
01 · Три боли: GA ≠ бесплатная замена model ID
- Hard cutoff 24.07.
deepseek-chatиdeepseek-reasonerотключаются 24.07.2026 23:59 (Пекин). Hardcoded ID в CI/CD → 404 после выходных, без grace period. - Слепая зона peak-valley. Будни 09:00–12:00 и 14:00–18:00 (Пекин) — тарифы ×2. Agent batch без cron-scheduling может удвоить месячный счёт относительно «плоской» preview-эры.
- Неверный split Pro/Flash.
reasoner→ Flash think или V4-Pro; Think Max требует ≥384K контекста. Полный переход на Pro бьёт по cost; чистый Flash — по SWE-bench quality.
02 · Таймлайн
| Дата | Событие |
|---|---|
| 24.04.2026 | Preview V4 + MIT: V4-Pro 1,6T, V4-Flash 284B |
| Май 2026 | Production tuning, API GA |
| Июнь 2026 | V4-Pro output −75% → $0,87/M навсегда |
| 29.06.2026 | Email API-пользователям: GA mid-July, peak-valley схема |
| 19.07.2026 | Grey GA для избранных разработчиков |
| 20.07.2026 | GA release (дата публикации) |
| 24.07.2026 | deepseek-chat / deepseek-reasoner offline навсегда |
03 · Архитектура: инженерный разбор
3.1 Спецификации V4-Pro vs V4-Flash
| Параметр | V4-Pro | V4-Flash |
|---|---|---|
| Всего параметров | 1,6T | 284B |
| Active params/token | 49B | 13B |
| Transformer layers | 61 | 43 |
| Context window | 1 000 000 tokens | 1 000 000 tokens |
| Max output | 384K tokens | 384K tokens |
| Precision | FP4 (experts) + FP8 | FP4 + FP8 mixed |
| Pretrain data | 33T+ tokens | 32T+ tokens |
| License | MIT | MIT |
3.2 CSA + HCA: отказ от MLA
DeepSeek V4 заменяет Multi-head Latent Attention (V2/V3) гибридом:
Compressed Sparse Attention (CSA)
- Softmax-gated pooling сжимает KV-последовательность 4×
- FP4 Lightning Indexer: top-k sparse select (Pro: top-1024, Flash: top-512)
- Sliding window последних 128 tokens сохраняется локально
Heavily Compressed Attention (HCA)
- Сжатие 128× → global dense attention для long-range deps
- Flash: первые 2 слоя HCA, далее CSA/HCA чередуются; Pro — аналогичная схема
Хардкор #1: при 1M контекста inference FLOPs = 27% от V3.2; KV-cache RAM = 10% (Flash: 7%).
3.3 Manifold-Constrained Hyper-Connections (mHC)
Стандартный residual x = x + f(x) деградирует на 61 слоях. mHC вводит 4-канальный residual stream с mixing matrix на Birkhoff polytope (doubly stochastic) — градиенты стабильны без потери expressivity.
3.4 Muon optimizer
Training на Muon вместо AdamW: Newton-Schulz orthogonalization градиентов → более предсказуемый step size, быстрее convergence на deep MoE.
3.5 Режимы inference
| Режим | Механизм | Use case |
|---|---|---|
| Non-think | Прямой decode, min latency | Q&A, intent routing |
| Think High | Explicit CoT (<redacted_thinking>) | Code debug, medium tasks |
| Think Max | Max reasoning budget, ≥384K ctx | Math, multi-agent chains |
Рекомендуемые sampling params: temperature=1.0, top_p=1.0 (все режимы).
04 · Бенчмарки (срез 20.07.2026)
| Benchmark | V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6% ★ OSS max | 96,0% | n/a | ~69% |
| SWE-bench Pro | 55,4% | 80,3% | 78,1% | 69,2% |
| LiveCodeBench Pass@1 | 93,5% | 88,1% | 87,4% | 83,2% |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9% | 88,0% | 85,1% | 82,7% |
Хардкор #2 (Artificial Analysis): Fable 5 $3,48/task (score 50); V4-Pro $0,03/task (score 38). Cost ratio ×116, quality gap ~31%.
05 · Сравнение с GPT-5.6 Sol и Claude Fable 5
| Измерение | V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open source | ✅ MIT | ❌ | ❌ |
| Self-host | ✅ | ❌ | ❌ |
| Context | 1M tokens | не опубликован | 1M tokens |
| Output (off-peak) | $0,87/M | ~$15/M | $50/M |
| Output (peak) | $1,74/M | — | — |
| Data privacy | ✅ on-prem | ❌ | ❌ |
5.1 Матрица сценариев
| Сценарий | Модель | Почему |
|---|---|---|
| Бюджет / high-QPS / on-prem | V4-Pro / V4-Flash | $0,87/M или $0,28/M output, MIT |
| Максимум code quality | Claude Fable 5 | SWE-bench Pro 80,3% |
| Алгоритмы + math | GPT-5.6 Sol/Ultra | Terminal-Bench 85,1% |
| Массовые логи/документы | V4-Flash | Cache-hit input $0,0028/M |
06 · Peak-valley биллинг
| Модель | Позиция | Off-peak | Peak |
|---|---|---|---|
| V4-Pro | Input (cache-hit) | $0,0035/M | ×2 |
| Input (cache-miss) | $0,435/M | $0,87/M | |
| Output | $0,87/M | $1,74/M | |
| V4-Flash | Input (cache-hit) | $0,0028/M | ×2 |
| Input (cache-miss) | $0,14/M | $0,28/M | |
| Output | $0,28/M | $0,56/M |
Peak window (Пекин): будни 09:00–12:00 и 14:00–18:00.
Хардкор #3: даже в peak V4-Pro output ($1,74/M) в 8,6× дешевле Opus 4.8 ($15/M).
07 · Миграция API до 24.07.2026 ⚠️
Warning: deepseek-chat и deepseek-reasoner offline 24.07.2026 15:59 UTC (23:59 Пекин). Миграция обязательна.
7.1 Mapping table
| Старый ID | Новый ID | Примечание |
|---|---|---|
deepseek-chat | deepseek-v4-flash (non-think) | Lightweight tasks |
deepseek-reasoner | deepseek-v4-flash (think) или deepseek-v4-pro | Pro для stronger reasoning |
7.2 Чеклист миграции (6 шагов)
- Global grep
deepseek-chat/deepseek-reasoner(CI/CD, env vars, secrets manager) - Заменить model ID по mapping table
- Enable think mode:
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}} - Think Max: verify context ≥384K tokens
- Staging regression: latency p95 + output quality diff
- Prod switch до 24.07., monitor peak-valley bill week 1
7.3 Anthropic SDK compat
08 · Итог
DeepSeek V4 GA — ключевой milestone open-source LLM в 2026. Ценность не в победе над Fable 5/GPT-5.6, а в frontier-class performance за 1/10–1/100 стоимости с MIT, 1M context и on-prem deploy. Peak-valley усложняет cost model, но остаётся конкурентоспособным даже в peak hours.
09 · FAQ
Q: GA vs preview?
A: Улучшенные agents/math/code, peak-valley pricing, та же архитектура.
Q: Когда offline deepseek-chat?
A: 24.07.2026 23:59 Пекин.
Q: Peak hours?
A: Будни 09:00–12:00 и 14:00–18:00 Пекин, тарифы ×2.
Q: V4-Pro vs Fable 5?
A: Fable лидирует SWE-bench; V4-Pro — OSS max при 1/116 cost.
Q: Pro или Flash?
A: Pro — quality; Flash — volume/routing.
Q: Mac deploy?
A: См. локальный inference guide.
10 · Изолированная аренда Mac: acceptance V4 без pollution основной машины
Глобальная замена deepseek-chat на основном MacBook рискует: stale model ID в .zshrc, think-mode эксперименты в local cache, невозможность изолированно проверить multi-model routing (Claude/GPT). Изолированный Apple Silicon node даёт reproducible regression с deepseek-v4-flash и deepseek-v4-pro, peak-valley cost diff, destroy-after-acceptance.
API тестируется с любой ОС, но macOS toolchain validation (Keychain, Xcode sidecar, native CLIs) — только на bare-metal Mac. Хотя миграцию можно начать с laptop, изолированный Mac даёт чище acceptance и меньше credential leak — посуточная аренда снижает CapEx. Тарифы: вычисления серии M.
11 · Источники
- DeepSeek API docs: api-docs.deepseek.com
- arXiv: 2606.19348
- Hugging Face: deepseek-ai
- Artificial Analysis: artificialanalysis.ai
Данные на 20.07.2026. Бенчмарки и цены могут измениться — ориентир: официальная документация.