Open-source LLM DeepSeek V4 GA 2026-07-20

DeepSeek V4 GA релиз: MoE 1,6T, peak-valley биллинг и инженерный разбор против GPT-5.6

Кому и какая боль? Разработчикам на Mac с deepseek-chat/reasoner в проде: GA 20.07., hard cutoff API 24.07., непонятные peak-тарифы и выбор Pro/Flash. Что внутри: таймлайн, разбор CSA/HCA/mHC на уровне KV-cache и FLOPs, таблицы бенчмарков, ценовая матрица, 6 шагов миграции. Структура: боли×3, спеки, сравнение GPT-5.6/Fable 5, FAQ×6.

DeepSeek V4 GA релиз peak-valley цены MoE архитектура бенчмарки сравнение GPT-5.6 июль 2026

Контекст: обзор GPT-5.6 Sol; локальный inference: V4-Flash на Mac; чип DeepSeek: custom inference chip.

20 июля 2026 DeepSeek V4 выходит из preview в GA. Для инженера это не маркетинговый ивент: фиксируются production-tuned веса, вводится дифференцированный биллинг peak-valley и жёсткий дедлайн миграции API. Ниже — разбор на уровне параметров MoE, механизмов внимания и измеримых метрик inference, без отрыва от практики деплоя.

01 · Три боли: GA ≠ бесплатная замена model ID

  1. Hard cutoff 24.07. deepseek-chat и deepseek-reasoner отключаются 24.07.2026 23:59 (Пекин). Hardcoded ID в CI/CD → 404 после выходных, без grace period.
  2. Слепая зона peak-valley. Будни 09:00–12:00 и 14:00–18:00 (Пекин) — тарифы ×2. Agent batch без cron-scheduling может удвоить месячный счёт относительно «плоской» preview-эры.
  3. Неверный split Pro/Flash. reasoner → Flash think или V4-Pro; Think Max требует ≥384K контекста. Полный переход на Pro бьёт по cost; чистый Flash — по SWE-bench quality.

02 · Таймлайн

Дата Событие
24.04.2026Preview V4 + MIT: V4-Pro 1,6T, V4-Flash 284B
Май 2026Production tuning, API GA
Июнь 2026V4-Pro output −75% → $0,87/M навсегда
29.06.2026Email API-пользователям: GA mid-July, peak-valley схема
19.07.2026Grey GA для избранных разработчиков
20.07.2026GA release (дата публикации)
24.07.2026deepseek-chat / deepseek-reasoner offline навсегда

03 · Архитектура: инженерный разбор

3.1 Спецификации V4-Pro vs V4-Flash

Параметр V4-Pro V4-Flash
Всего параметров1,6T284B
Active params/token49B13B
Transformer layers6143
Context window1 000 000 tokens1 000 000 tokens
Max output384K tokens384K tokens
PrecisionFP4 (experts) + FP8FP4 + FP8 mixed
Pretrain data33T+ tokens32T+ tokens
LicenseMITMIT

3.2 CSA + HCA: отказ от MLA

DeepSeek V4 заменяет Multi-head Latent Attention (V2/V3) гибридом:

Compressed Sparse Attention (CSA)

  • Softmax-gated pooling сжимает KV-последовательность
  • FP4 Lightning Indexer: top-k sparse select (Pro: top-1024, Flash: top-512)
  • Sliding window последних 128 tokens сохраняется локально

Heavily Compressed Attention (HCA)

  • Сжатие 128× → global dense attention для long-range deps
  • Flash: первые 2 слоя HCA, далее CSA/HCA чередуются; Pro — аналогичная схема

Хардкор #1: при 1M контекста inference FLOPs = 27% от V3.2; KV-cache RAM = 10% (Flash: 7%).

3.3 Manifold-Constrained Hyper-Connections (mHC)

Стандартный residual x = x + f(x) деградирует на 61 слоях. mHC вводит 4-канальный residual stream с mixing matrix на Birkhoff polytope (doubly stochastic) — градиенты стабильны без потери expressivity.

3.4 Muon optimizer

Training на Muon вместо AdamW: Newton-Schulz orthogonalization градиентов → более предсказуемый step size, быстрее convergence на deep MoE.

3.5 Режимы inference

Режим Механизм Use case
Non-thinkПрямой decode, min latencyQ&A, intent routing
Think HighExplicit CoT (<redacted_thinking>)Code debug, medium tasks
Think MaxMax reasoning budget, ≥384K ctxMath, multi-agent chains

Рекомендуемые sampling params: temperature=1.0, top_p=1.0 (все режимы).

04 · Бенчмарки (срез 20.07.2026)

Benchmark V4-Pro Claude Fable 5 GPT-5.6 Ultra Opus 4.8
SWE-bench Verified80,6% ★ OSS max96,0%n/a~69%
SWE-bench Pro55,4%80,3%78,1%69,2%
LiveCodeBench Pass@193,5%88,1%87,4%83,2%
Codeforces Elo3 206
Terminal-Bench 2.183,9%88,0%85,1%82,7%

Хардкор #2 (Artificial Analysis): Fable 5 $3,48/task (score 50); V4-Pro $0,03/task (score 38). Cost ratio ×116, quality gap ~31%.

05 · Сравнение с GPT-5.6 Sol и Claude Fable 5

Измерение V4-Pro GPT-5.6 Sol Claude Fable 5
Open source✅ MIT
Self-host
Context1M tokensне опубликован1M tokens
Output (off-peak)$0,87/M~$15/M$50/M
Output (peak)$1,74/M
Data privacy✅ on-prem

5.1 Матрица сценариев

Сценарий Модель Почему
Бюджет / high-QPS / on-premV4-Pro / V4-Flash$0,87/M или $0,28/M output, MIT
Максимум code qualityClaude Fable 5SWE-bench Pro 80,3%
Алгоритмы + mathGPT-5.6 Sol/UltraTerminal-Bench 85,1%
Массовые логи/документыV4-FlashCache-hit input $0,0028/M

06 · Peak-valley биллинг

Модель Позиция Off-peak Peak
V4-ProInput (cache-hit)$0,0035/M×2
Input (cache-miss)$0,435/M$0,87/M
Output$0,87/M$1,74/M
V4-FlashInput (cache-hit)$0,0028/M×2
Input (cache-miss)$0,14/M$0,28/M
Output$0,28/M$0,56/M

Peak window (Пекин): будни 09:00–12:00 и 14:00–18:00.

Хардкор #3: даже в peak V4-Pro output ($1,74/M) в 8,6× дешевле Opus 4.8 ($15/M).

07 · Миграция API до 24.07.2026 ⚠️

Warning: deepseek-chat и deepseek-reasoner offline 24.07.2026 15:59 UTC (23:59 Пекин). Миграция обязательна.

7.1 Mapping table

Старый ID Новый ID Примечание
deepseek-chatdeepseek-v4-flash (non-think)Lightweight tasks
deepseek-reasonerdeepseek-v4-flash (think) или deepseek-v4-proPro для stronger reasoning

7.2 Чеклист миграции (6 шагов)

  1. Global grep deepseek-chat / deepseek-reasoner (CI/CD, env vars, secrets manager)
  2. Заменить model ID по mapping table
  3. Enable think mode: extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
  4. Think Max: verify context ≥384K tokens
  5. Staging regression: latency p95 + output quality diff
  6. Prod switch до 24.07., monitor peak-valley bill week 1
# ❌ Legacy (invalid after 24.07.) client.chat.completions.create(model="deepseek-chat", messages=[...]) # ✅ GA client.chat.completions.create( model="deepseek-v4-pro", messages=[...], # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}} )

7.3 Anthropic SDK compat

client = anthropic.Anthropic( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com" ) message = client.messages.create( model="deepseek-v4-pro", max_tokens=4096, messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}] )

08 · Итог

DeepSeek V4 GA — ключевой milestone open-source LLM в 2026. Ценность не в победе над Fable 5/GPT-5.6, а в frontier-class performance за 1/10–1/100 стоимости с MIT, 1M context и on-prem deploy. Peak-valley усложняет cost model, но остаётся конкурентоспособным даже в peak hours.

09 · FAQ

Q: GA vs preview?
A: Улучшенные agents/math/code, peak-valley pricing, та же архитектура.

Q: Когда offline deepseek-chat?
A: 24.07.2026 23:59 Пекин.

Q: Peak hours?
A: Будни 09:00–12:00 и 14:00–18:00 Пекин, тарифы ×2.

Q: V4-Pro vs Fable 5?
A: Fable лидирует SWE-bench; V4-Pro — OSS max при 1/116 cost.

Q: Pro или Flash?
A: Pro — quality; Flash — volume/routing.

Q: Mac deploy?
A: См. локальный inference guide.

10 · Изолированная аренда Mac: acceptance V4 без pollution основной машины

Глобальная замена deepseek-chat на основном MacBook рискует: stale model ID в .zshrc, think-mode эксперименты в local cache, невозможность изолированно проверить multi-model routing (Claude/GPT). Изолированный Apple Silicon node даёт reproducible regression с deepseek-v4-flash и deepseek-v4-pro, peak-valley cost diff, destroy-after-acceptance.

API тестируется с любой ОС, но macOS toolchain validation (Keychain, Xcode sidecar, native CLIs) — только на bare-metal Mac. Хотя миграцию можно начать с laptop, изолированный Mac даёт чище acceptance и меньше credential leak — посуточная аренда снижает CapEx. Тарифы: вычисления серии M.

11 · Источники

Данные на 20.07.2026. Бенчмарки и цены могут измениться — ориентир: официальная документация.