Open Weight 27 июля 2026 2026-07-28

Kimi K3 open weight: 2,8T MoE, 1M контекст — технический разбор релиза 27 июля

Кому и зачем: Mac-разработчикам и ML-инженерам после публикации весов 27 июля — нужно отделить open weight от open source, разобрать кастомную лицензию и оценить порог 64+ GPU. Что внутри: KDA/AttnRes на уровне механизмов, MoonEP/FlashKDA/AgentEnv, бенчмарки, API-тарифы, 5 шагов валидации. Структура: таблицы спецификаций, FAQ×5, аренда изолированного Mac.

Релиз Kimi K3 open weight 27 июля 2026: MoE 2,8T, MoonEP, FlashKDA и AgentEnv

См. также: обзор 17.07, ожидание до 27.07, скандал дистилляции Opus 5.

TL;DR

27 июля 2026 (~23:00 CST) Moonshot AI опубликовала полные веса Kimi K3 (~1,56 ТБ на Hugging Face), технический отчёт, а также открыла MoonEP и AgentEnv (FlashKDA был открыт ранее). K3 — sparse MoE на 2,8T параметров с ~104B активируемых на токен, контекст 1M токенов, SWE-bench Verified 93,4%. Официальная терминология: open weight, не open source; лицензия кастомная с порогами $20M MAAS и 100M MAU — не Modified MIT как у K2.

Через 11 дней после API-релиза 16 июля Moonshot выкатила первую полностью открытую модель класса 3T. За 30 минут K3 занял #1 в трендах Hugging Face. Для Mac-разработчика вывод жёсткий: 1,56 ТБ весов и 64+ GPU — не ваш стек; API остаётся единственным production-путём, а веса — для аудита архитектуры и исследований.

01 · Три узких места решения

  1. Семантика open weight vs open source: Moonshot никогда не пишет «open source». OSI требует данные, код обучения и воспроизводимый pipeline — K3 отдаёт веса, отчёт и inference-infra. Путаница терминов = потеря доверия в r/LocalLLaMA и на compliance-review.
  2. Два коммерческих порога лицензии: MAAS с выручкой >$20M за 12 месяцев → отдельный договор с Moonshot. MAU >100M или месячная выручка >$20M → видимая маркировка «Kimi K3». Для стартапов — ноль эффекта; для API-конкурентов — красная линия для legal.
  3. Потолок качества vs цена vs deploy: AA Index #3, SWE-bench 93,4%, но ~$0,95/задача против $0,47 у GLM-5.2. Self-host: 1,56 ТБ + 64+ GPU. Одной метрики недостаточно.

02 · Хронология 16–28 июля

Дата Событие
2026-07-16API-релиз (kimi.com, Kimi Work, Kimi Code); блог «Open Frontier Intelligence»; независимый тест Artificial Analysis
2026-07-17WAIC 2026; госмедиа называют K3 крупнейшей open weight моделью
2026-07-22–23Эскалация US-обвинений в дистилляции; угрозы санкций
2026-07-27Полные веса + техотчёт; MoonEP и AgentEnv open source; ~1,56 ТБ на HF, #1 за 30 мин
2026-07-28Ответ Минкоммерции КНР; медиа о деталях лицензии

03 · Таблица спецификаций

Параметр Значение
Всего параметров2,8T
Активируемых~104B/токен
АрхитектураSparse MoE (Stable LatentMoE)
Эксперты896 router, 16 active/token (~1,8% sparsity)
AttentionKimi Delta Attention (KDA) + Gated MLA
Контекст1 048 576 токенов
МультимодальностьNative vision (ViT-V2, 27 слоёв)
КвантизацияMXFP4 веса, MXFP8 активации (QAT с SFT)
Размер весов~1,56 ТБ
ЛицензияКастомная (не Modified MIT)

Hard data #1: 1,56 ТБ + 1M контекст — структурное преимущество, которое closed-source конкуренты не реплицируют при том же API-тарифе.

04 · KDA и Attention Residuals: механизмы на уровне тензоров

4.1 Kimi Delta Attention (KDA)

Gated DeltaNet применяет скалярный forget-gate ко всему состоянию памяти. KDA заменяет это на поканальные gates: каждая feature-размерность получает собственный decay rate. Реализация — chunkwise DPLR (Diagonal-Plus-Low-Rank) recurrence: O(n) по длине последовательности, минимальный KV cache. K3 чередует KDA-слои с Gated MLA global attention для 1M токенов без взрыва памяти.

4.2 Attention Residuals (AttnRes)

Классические residual connections суммируют слои равномерно — глубокие сети размывают ранние сигналы. AttnRes делает селективную input-dependent агрегацию выходов всех предыдущих слоёв. Overhead: RMSNorm + pseudo-query на слой (<2% параметров). Прирост эффективности обучения: ~25%. Pseudo-query инициализируется нулём → на старте эквивалент uniform averaging, стабильный warmup.

4.3 Per-Head Muon и Stable LatentMoE

Muon-оптимизатор применяется per attention head — адаптивная сходимость каждой головы. MoE: 896 экспертов, 16 active, Quantile Balancing + математическое доказательство MoonEP на upper bound redundant experts per node.

05 · MoonEP / FlashKDA / AgentEnv: инфраструктурный стек

Компонент Назначение Метрика
MoonEP MoE all-to-all на supernode; временная репликация перегруженных экспертов для баланса токенов Доказанный upper bound redundant experts per compute node
FlashKDA CUTLASS-based KDA kernel; drop-in замена chunk_kda Prefill на H20: 1,72–2,22× vs flash-linear-attention baseline
AgentEnv Firecracker microVM sandbox (с KVCache.ai) для параллельного agent RL Checkpoint 133 ms, restore 49 ms, oversubscription до 6,5×

Hard data #2: FlashKDA 1,72–2,22× prefill — релиз отдаёт engineering stack, не только checkpoint files.

06 · Бенчмарки

6.1 SWE-bench Verified (Vals AI, июль 2026)

Модель Score Дата
Claude Opus 597,0%2026-07-24
GPT-5.6 Sol96,2%2026-07-09
Claude Fable 595,0%2026-06-09
Kimi K393,4%2026-07-16
Qwen3.7-Max79,4%2026-05-19
DeepSeek-V476,2%2026-04-23

6.2 Artificial Analysis Intelligence Index (max)

  • Claude Fable 5: 60
  • GPT-5.6 Sol: 59
  • Kimi K3: ~57 — #3 глобально, #1 open weight
  • GLM-5.2: 51
  • DeepSeek V4 Pro: 44

Стоимость agent-task: K3 ~$0,95 vs Fable 5 ~$2,40 (−60%) vs GLM-5.2 ~$0,47. Итог: потолок open weight, не лидер price/performance. Arena.ai Frontend Code Arena: K3 на #1.

07 · Кастомная лицензия: два коммерческих порога

Moonshot не использует «open source». Лицензия K3 — кастомный документ, не Modified MIT:

  1. MAAS revenue gate: Model-as-a-Service с выручкой >$20M за 12 месяцев → отдельное соглашение с Moonshot.
  2. Scale gate: MAU >100M или месячная выручка >$20M → видимая маркировка «Kimi K3» в UI.

Для большинства команд — нулевой эффект. Для планируемого K3-API-конкурента — legal review до архитектурного commit.

08 · API-тарифы и порог 64+ GPU

OpenAI-compatible API: https://api.moonshot.ai/v1, model ID kimi-k3.

Тип токена Цена / 1M
Input (cache hit)$0,30
Input (cache miss)$3,00
Output (с reasoning)$15,00

Mooncake disaggregated inference: cache hit rate >90% на coding workloads → эффективный input ближе к $0,30/M.

Self-deploy: официальная рекомендация 64+ ускорителей (supernode), 1,56 ТБ весов. 7 провайдеров на OpenRouter, цены ≈ официальным.

Hard data #3: 1,56 ТБ + 64 GPU — «K3 на MacBook» не production path; ответ — API или managed routing.

09 · 5 шагов валидации (Mac-разработчик)

  1. API key на platform.kimi.ai; OpenAI SDK + kimi-k3 — по одному тесту: long doc, bugfix, multi-file refactor
  2. Включить context cache; логировать hit rate и реальный $/task; сравнить с Fable 5 / GPT-5.6
  3. Проверить HF repo moonshotai: 1,56 ТБ shards, LICENSE, PDF техотчёта
  4. Изолированная среда (не daily driver): Kimi Code или Cursor + K3 routing — не экспортировать key в глобальный shell
  5. Свести архитектурную главу обзора 17.07 с обновлениями лицензии и infra в decision doc
curl -s https://api.moonshot.ai/v1/chat/completions \ -H "Authorization: Bearer $MOONSHOT_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model": "kimi-k3", "messages": [{"role": "user", "content": "Кратко опиши open weight релиз Kimi K3 от 27 июля 2026."}]}'

10 · FAQ

В: Kimi K3 — open source?
О: Нет в смысле OSI. Open weight: веса, отчёт, часть infra публичны; данные и полный train code — нет.

В: Коммерческое использование?
О: Да, в большинстве случаев. MAAS >$20M/год или MAU >100M / выручка >$20M/мес → доп. условия.

В: Сколько GPU для self-hosting?
О: Минимум 64 ускорителя (supernode). Для большинства — API или OpenRouter.

В: Насколько силён в бенчмарках?
О: SWE-bench 93,4%, AA Index #3 глобально. Дороже GLM-5.2 — потолок open weight, не price/performance лидер.

В: Отличие от Kimi K2?
О: ~3× параметров, AttnRes + Per-Head Muon, 1M контекст, кастомная лицензия вместо Modified MIT.

11 · Аренда изолированного Mac: K3 API без риска для Keychain

1,56 ТБ и 64-GPU кластер — вне зоны Mac-разработчика. Прагматичный путь: валидировать Kimi K3 API workflow в изолированном Apple Silicon узле — Moonshot key на арендованной машине, не в production Keychain; million-token эксперименты без локального cache pollution; A/B против Claude/GPT в destroy-after-acceptance setup.

API-тесты можно начать на ноутбуке, но daily driver несёт delivery risk: key leaks в .zshrc, необратимые long-context runs, смешанные credentials. Выделенный арендованный Mac отделяет validation от production — посуточная оплата вместо CapEx. Тарифы: вычисления серии M.

12 · Источники

  • Официально: kimi.com/blog/kimi-k3, platform.kimi.ai, Hugging Face moonshotai
  • Infra: GitHub moonshotai/FlashKDA, MoonEP, AgentEnv
  • Бенчмарки: Vals AI SWE-bench Verified, Artificial Analysis Intelligence Index
  • Пресса: VentureBeat, Simon Willison, Scientific American, The Register
  • Контекст: Минкоммерции 28.07, обвинения в дистилляции, Hacker News, r/LocalLLaMA

Данные на 28 июля 2026. Перед production — проверить LICENSE и HF repo.