Kimi K3 open weight: 2,8T MoE, 1M контекст — технический разбор релиза 27 июля
Кому и зачем: Mac-разработчикам и ML-инженерам после публикации весов 27 июля — нужно отделить open weight от open source, разобрать кастомную лицензию и оценить порог 64+ GPU. Что внутри: KDA/AttnRes на уровне механизмов, MoonEP/FlashKDA/AgentEnv, бенчмарки, API-тарифы, 5 шагов валидации. Структура: таблицы спецификаций, FAQ×5, аренда изолированного Mac.
Содержание
См. также: обзор 17.07, ожидание до 27.07, скандал дистилляции Opus 5.
TL;DR
27 июля 2026 (~23:00 CST) Moonshot AI опубликовала полные веса Kimi K3 (~1,56 ТБ на Hugging Face), технический отчёт, а также открыла MoonEP и AgentEnv (FlashKDA был открыт ранее). K3 — sparse MoE на 2,8T параметров с ~104B активируемых на токен, контекст 1M токенов, SWE-bench Verified 93,4%. Официальная терминология: open weight, не open source; лицензия кастомная с порогами $20M MAAS и 100M MAU — не Modified MIT как у K2.
Через 11 дней после API-релиза 16 июля Moonshot выкатила первую полностью открытую модель класса 3T. За 30 минут K3 занял #1 в трендах Hugging Face. Для Mac-разработчика вывод жёсткий: 1,56 ТБ весов и 64+ GPU — не ваш стек; API остаётся единственным production-путём, а веса — для аудита архитектуры и исследований.
01 · Три узких места решения
- Семантика open weight vs open source: Moonshot никогда не пишет «open source». OSI требует данные, код обучения и воспроизводимый pipeline — K3 отдаёт веса, отчёт и inference-infra. Путаница терминов = потеря доверия в r/LocalLLaMA и на compliance-review.
- Два коммерческих порога лицензии: MAAS с выручкой >$20M за 12 месяцев → отдельный договор с Moonshot. MAU >100M или месячная выручка >$20M → видимая маркировка «Kimi K3». Для стартапов — ноль эффекта; для API-конкурентов — красная линия для legal.
- Потолок качества vs цена vs deploy: AA Index #3, SWE-bench 93,4%, но ~$0,95/задача против $0,47 у GLM-5.2. Self-host: 1,56 ТБ + 64+ GPU. Одной метрики недостаточно.
02 · Хронология 16–28 июля
| Дата | Событие |
|---|---|
| 2026-07-16 | API-релиз (kimi.com, Kimi Work, Kimi Code); блог «Open Frontier Intelligence»; независимый тест Artificial Analysis |
| 2026-07-17 | WAIC 2026; госмедиа называют K3 крупнейшей open weight моделью |
| 2026-07-22–23 | Эскалация US-обвинений в дистилляции; угрозы санкций |
| 2026-07-27 | Полные веса + техотчёт; MoonEP и AgentEnv open source; ~1,56 ТБ на HF, #1 за 30 мин |
| 2026-07-28 | Ответ Минкоммерции КНР; медиа о деталях лицензии |
03 · Таблица спецификаций
| Параметр | Значение |
|---|---|
| Всего параметров | 2,8T |
| Активируемых | ~104B/токен |
| Архитектура | Sparse MoE (Stable LatentMoE) |
| Эксперты | 896 router, 16 active/token (~1,8% sparsity) |
| Attention | Kimi Delta Attention (KDA) + Gated MLA |
| Контекст | 1 048 576 токенов |
| Мультимодальность | Native vision (ViT-V2, 27 слоёв) |
| Квантизация | MXFP4 веса, MXFP8 активации (QAT с SFT) |
| Размер весов | ~1,56 ТБ |
| Лицензия | Кастомная (не Modified MIT) |
Hard data #1: 1,56 ТБ + 1M контекст — структурное преимущество, которое closed-source конкуренты не реплицируют при том же API-тарифе.
04 · KDA и Attention Residuals: механизмы на уровне тензоров
4.1 Kimi Delta Attention (KDA)
Gated DeltaNet применяет скалярный forget-gate ко всему состоянию памяти. KDA заменяет это на поканальные gates: каждая feature-размерность получает собственный decay rate. Реализация — chunkwise DPLR (Diagonal-Plus-Low-Rank) recurrence: O(n) по длине последовательности, минимальный KV cache. K3 чередует KDA-слои с Gated MLA global attention для 1M токенов без взрыва памяти.
4.2 Attention Residuals (AttnRes)
Классические residual connections суммируют слои равномерно — глубокие сети размывают ранние сигналы. AttnRes делает селективную input-dependent агрегацию выходов всех предыдущих слоёв. Overhead: RMSNorm + pseudo-query на слой (<2% параметров). Прирост эффективности обучения: ~25%. Pseudo-query инициализируется нулём → на старте эквивалент uniform averaging, стабильный warmup.
4.3 Per-Head Muon и Stable LatentMoE
Muon-оптимизатор применяется per attention head — адаптивная сходимость каждой головы. MoE: 896 экспертов, 16 active, Quantile Balancing + математическое доказательство MoonEP на upper bound redundant experts per node.
05 · MoonEP / FlashKDA / AgentEnv: инфраструктурный стек
| Компонент | Назначение | Метрика |
|---|---|---|
| MoonEP | MoE all-to-all на supernode; временная репликация перегруженных экспертов для баланса токенов | Доказанный upper bound redundant experts per compute node |
| FlashKDA | CUTLASS-based KDA kernel; drop-in замена chunk_kda |
Prefill на H20: 1,72–2,22× vs flash-linear-attention baseline |
| AgentEnv | Firecracker microVM sandbox (с KVCache.ai) для параллельного agent RL | Checkpoint 133 ms, restore 49 ms, oversubscription до 6,5× |
Hard data #2: FlashKDA 1,72–2,22× prefill — релиз отдаёт engineering stack, не только checkpoint files.
06 · Бенчмарки
6.1 SWE-bench Verified (Vals AI, июль 2026)
| Модель | Score | Дата |
|---|---|---|
| Claude Opus 5 | 97,0% | 2026-07-24 |
| GPT-5.6 Sol | 96,2% | 2026-07-09 |
| Claude Fable 5 | 95,0% | 2026-06-09 |
| Kimi K3 | 93,4% | 2026-07-16 |
| Qwen3.7-Max | 79,4% | 2026-05-19 |
| DeepSeek-V4 | 76,2% | 2026-04-23 |
6.2 Artificial Analysis Intelligence Index (max)
- Claude Fable 5: 60
- GPT-5.6 Sol: 59
- Kimi K3: ~57 — #3 глобально, #1 open weight
- GLM-5.2: 51
- DeepSeek V4 Pro: 44
Стоимость agent-task: K3 ~$0,95 vs Fable 5 ~$2,40 (−60%) vs GLM-5.2 ~$0,47. Итог: потолок open weight, не лидер price/performance. Arena.ai Frontend Code Arena: K3 на #1.
07 · Кастомная лицензия: два коммерческих порога
Moonshot не использует «open source». Лицензия K3 — кастомный документ, не Modified MIT:
- MAAS revenue gate: Model-as-a-Service с выручкой >$20M за 12 месяцев → отдельное соглашение с Moonshot.
- Scale gate: MAU >100M или месячная выручка >$20M → видимая маркировка «Kimi K3» в UI.
Для большинства команд — нулевой эффект. Для планируемого K3-API-конкурента — legal review до архитектурного commit.
08 · API-тарифы и порог 64+ GPU
OpenAI-compatible API: https://api.moonshot.ai/v1, model ID kimi-k3.
| Тип токена | Цена / 1M |
|---|---|
| Input (cache hit) | $0,30 |
| Input (cache miss) | $3,00 |
| Output (с reasoning) | $15,00 |
Mooncake disaggregated inference: cache hit rate >90% на coding workloads → эффективный input ближе к $0,30/M.
Self-deploy: официальная рекомендация 64+ ускорителей (supernode), 1,56 ТБ весов. 7 провайдеров на OpenRouter, цены ≈ официальным.
Hard data #3: 1,56 ТБ + 64 GPU — «K3 на MacBook» не production path; ответ — API или managed routing.
09 · 5 шагов валидации (Mac-разработчик)
- API key на platform.kimi.ai; OpenAI SDK +
kimi-k3— по одному тесту: long doc, bugfix, multi-file refactor - Включить context cache; логировать hit rate и реальный $/task; сравнить с Fable 5 / GPT-5.6
- Проверить HF repo moonshotai: 1,56 ТБ shards, LICENSE, PDF техотчёта
- Изолированная среда (не daily driver): Kimi Code или Cursor + K3 routing — не экспортировать key в глобальный shell
- Свести архитектурную главу обзора 17.07 с обновлениями лицензии и infra в decision doc
10 · FAQ
В: Kimi K3 — open source?
О: Нет в смысле OSI. Open weight: веса, отчёт, часть infra публичны; данные и полный train code — нет.
В: Коммерческое использование?
О: Да, в большинстве случаев. MAAS >$20M/год или MAU >100M / выручка >$20M/мес → доп. условия.
В: Сколько GPU для self-hosting?
О: Минимум 64 ускорителя (supernode). Для большинства — API или OpenRouter.
В: Насколько силён в бенчмарках?
О: SWE-bench 93,4%, AA Index #3 глобально. Дороже GLM-5.2 — потолок open weight, не price/performance лидер.
В: Отличие от Kimi K2?
О: ~3× параметров, AttnRes + Per-Head Muon, 1M контекст, кастомная лицензия вместо Modified MIT.
11 · Аренда изолированного Mac: K3 API без риска для Keychain
1,56 ТБ и 64-GPU кластер — вне зоны Mac-разработчика. Прагматичный путь: валидировать Kimi K3 API workflow в изолированном Apple Silicon узле — Moonshot key на арендованной машине, не в production Keychain; million-token эксперименты без локального cache pollution; A/B против Claude/GPT в destroy-after-acceptance setup.
API-тесты можно начать на ноутбуке, но daily driver несёт delivery risk: key leaks в .zshrc, необратимые long-context runs, смешанные credentials. Выделенный арендованный Mac отделяет validation от production — посуточная оплата вместо CapEx. Тарифы: вычисления серии M.
12 · Источники
- Официально: kimi.com/blog/kimi-k3, platform.kimi.ai, Hugging Face moonshotai
- Infra: GitHub moonshotai/FlashKDA, MoonEP, AgentEnv
- Бенчмарки: Vals AI SWE-bench Verified, Artificial Analysis Intelligence Index
- Пресса: VentureBeat, Simon Willison, Scientific American, The Register
- Контекст: Минкоммерции 28.07, обвинения в дистилляции, Hacker News, r/LocalLLaMA
Данные на 28 июля 2026. Перед production — проверить LICENSE и HF repo.