Kimi K3 全面开源:2.8 万亿参数、百万上下文,月之暗面这次放了什么大招
谁遇到什么问题?关注 7 月 27 日 Kimi K3 完整权重落地的 Mac 开发者与 AI 工程师,分不清 open weight 与 open source、自定义许可两道商业门槛,也不确定 1.56TB 权重能否自部署。本文给什么?发布复盘、架构创新、跑分对比、许可条款、API 定价与地缘背景下的选型结论。结构包含:时间线、参数表、Infra 表、benchmark 表、五步落地、FAQ×5、租用 Mac 隔离试跑。
📋 本文目录
姊妹篇见 Kimi K3 深度评测(7/17)、7/22 发布前 anticipation、Opus 5 + K3 蒸馏门周报。
Featured Snippet 直答
7 月 27 日晚 23 点左右,月之暗面正式发布 Kimi K3 完整模型权重与技术报告,并同步开源 MoonEP、FlashKDA、AgentEnv 三项核心基础设施。K3 是 2.8 万亿参数稀疏 MoE 模型(激活约 1040 亿),支持 100 万 token上下文,权重约 1.56TB,上线半小时内登顶 Hugging Face 趋势榜第一。官方始终使用 open weight(开放权重)表述,而非 open source;许可证为自定义文件,含 $20M MAAS 收入与 1 亿 MAU 两道商业门槛——不是 K2 时代的 Modified MIT。
7 月 27 日晚 23 点左右,月之暗面(Moonshot AI)正式发布 Kimi K3 的完整模型权重与技术报告,并同步开源支撑其训练的三项核心基础设施技术:MoonEP、FlashKDA、AgentEnv。Kimi K3 是一个拥有 2.8 万亿总参数的混合专家(MoE)模型,激活参数约 1040 亿,支持 100 万 token 上下文窗口,具备原生视觉理解能力——这是全球首个被完整开放的 3 万亿参数级别模型。权重文件在 Hugging Face 上体积约 1.56TB,上线半小时内即登顶趋势榜第一。这次开源距离 Kimi K3 在 kimi.com 和 API 端首发,只过去了 11 天。
01 · 三大决策痛点
- 「开源」语义陷阱:月之暗面官方材料从未使用 open source,一直采用 open weight。国内媒体普遍翻译为「开源」,但 OSI 标准要求训练数据、训练代码与可复现流水线——K3 只公开权重、技术报告与部分 Infra,写错术语会在 r/LocalLLaMA 被质疑外行。
- 许可证两道商业门槛:K3 不再自称 Modified MIT,而是自定义许可。MAAS 业务连续 12 个月收入超 $20M 须另行签约;月活超 1 亿或月收入超 $20M 须在界面显著展示「Kimi K3」。中小团队通常无感,但「拿 K3 做竞品 API」是法务红线。
- 能力天花板 vs 性价比 vs 部署现实:SWE-bench Verified 独立复测 93.4%、AA Index 全球第 3,是开源阵营能力天花板;但单任务约 $0.95,高于 GLM-5.2 的 $0.47。自部署需 64+ 卡超节点、权重 1.56TB——选型不能只看一张榜或一张价目表。
02 · 发布时间线:7/16–7/28
| 日期 | 事件 |
|---|---|
| 2026-07-16 | Kimi K3 在 kimi.com、Kimi Work、Kimi Code 及 API 首发(在线调用,权重未公开);官方博客《Kimi K3: Open Frontier Intelligence》;Artificial Analysis 同日发布独立评测 |
| 2026-07-17 | WAIC 2026 开幕;新华社称 K3 为「目前全球参数最大的开源模型」 |
| 2026-07-22–23 | 中美「模型蒸馏」争端升级:白宫科技顾问 Michael Kratsios 指控月之暗面对 Anthropic Fable 进行工业化蒸馏;财长 Scott Bessent 称将考虑制裁及实体清单 |
| 2026-07-27 | 完整权重 + 技术报告发布;开源 MoonEP、AgentEnv(FlashKDA 此前已开源);HF 约 1.56TB,半小时登顶趋势榜 |
| 2026-07-28 | 中国商务部就中美 AI 争端公开回应,指责美方「AI 霸权主义」并威胁反制;国内媒体跟进报道开源细节 |
03 · Kimi K3 核心参数一览
| 项目 | 参数 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T) |
| 激活参数量 | 约 1040 亿 |
| 架构类型 | 混合专家模型(MoE),Stable LatentMoE |
| 专家配置 | 896 个路由专家,每 token 激活 16 个(另有共享专家,稀疏度约 1.8%) |
| 注意力机制 | Kimi Delta Attention(KDA)+ 门控多头潜在注意力(Gated MLA) |
| 上下文窗口 | 100 万 token(1,048,576) |
| 多模态能力 | 原生视觉理解(ViT-V2,27 层) |
| 权重格式 | MXFP4 权重 + MXFP8 激活(SFT 阶段起量化感知训练) |
| 权重体积 | 约 1.56TB(Hugging Face) |
| License | 自定义许可证(官方称 open weight,非 Modified MIT) |
硬核数据 #1:1.56TB 完整权重 + 100 万 token 窗口——全球首个完整开放的 3T 级模型,结构性优势在闭源竞品同等单价下难以复制。
04 · 四大架构创新:KDA、AttnRes、Per-Head Muon 与 Stable LatentMoE
Kimi K3 重构了深度学习沿用多年的三大传统组件——注意力机制、残差连接、优化器,这也是它区别于「简单堆参数」的关键。
4.1 Kimi Delta Attention(KDA):让「遗忘」变得更精细
传统 Gated DeltaNet 使用标量级遗忘门——整个记忆用同一衰减系数。KDA 改为逐通道门控:每个特征维度拥有独立衰减率,某些特征长期保留、另一些快速遗忘。KDA 采用 chunkwise 的 Diagonal-Plus-Low-Rank(DPLR)公式实现线性时间递归,在保证硬件效率的同时大幅降低长序列显存开销。K3 将 KDA 与少量全局注意力层(Gated MLA)交替混合,支撑 100 万 token 上下文并将 KV Cache 压到极低。
4.2 Attention Residuals(AttnRes):残差连接不再是「雨露均沾」
传统残差连接逐层均匀累加,层数越深早期信息越易被稀释。AttnRes 改为选择性、依据输入动态聚合前面所有层的输出——每层仅新增一个 RMSNorm 和一个伪查询向量,参数开销几乎可忽略,却带来约 25% 训练效率提升,代价不到 2%。伪查询向量初始化为零,训练初期等价于均匀平均,避免早期不稳定。
4.3 Per-Head Muon:让每个注意力头独立学习
Muon 是近年广泛采用的优化器;K3 扩展为逐注意力头独立优化,让每个头拥有更自适应的收敛路径。这是纯训练期技术,API 调用者无感知,但正是这类细节堆叠,使 K3 以相对更少激活参数打出接近顶尖闭源模型的效果。
4.4 Stable LatentMoE:896 选 16 的稀疏艺术
MoE 层拥有 896 个路由专家,每 token 只激活 16 个(稀疏度约 1.8%),配合共享专家保证基础能力稳定。团队采用 Quantile Balancing 均衡策略,并配合 MoonEP 从数学上证明每个计算节点冗余专家数的理论上界,保证负载均衡方案可行。
05 · 三大开源 Infra:MoonEP、FlashKDA、AgentEnv
月之暗面没有只发权重文件,而是把支撑 K3 训练效率与稳定性的三项关键基础设施一并开源——这也是本次发布在开发者社区获较高评价的重要原因。
| 技术 | 定位 | 关键能力 |
|---|---|---|
| MoonEP | 面向超大规模细粒度 MoE 的高性能通信库 | 通过临时复制过载专家保证每个计算节点获得均等 token 数;数学证明冗余专家数理论上界,负载不均衡时仍维持高通信效率 |
| FlashKDA | 基于 NVIDIA CUTLASS 的 KDA 高性能算子(此前已开源) | 在 NVIDIA H20 上 prefill 比 flash-linear-attention 基线快 1.72–2.22 倍;可作为 chunk_kda 直接替代后端,无需改代码 |
| AgentEnv | 与 KVCache.ai 联合开发的 Agent 沙箱(Firecracker microVM) | 面向大规模并行 Agent RL 训练;支持快速快照、恢复与 fork;官方披露 checkpoint 延迟低至 133ms、恢复 49ms、内存超分最高 6.5 倍(尚未经第三方独立复现) |
硬核数据 #2:FlashKDA 在 H20 上 prefill 加速 1.72–2.22 倍——开源的不只是权重,而是可复用的工程栈。
06 · 跑分对比:SWE-bench 与 Artificial Analysis
不同机构、不同评测框架数字差异较大,以下优先引用独立第三方复测数据。
6.1 SWE-bench Verified(独立复测,Vals AI,截至 2026 年 7 月)
| 模型 | 分数 | 发布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
6.2 Artificial Analysis 智能指数(max 推理档)
- Claude Fable 5(max + fallback):60
- GPT-5.6 Sol(max):59
- Kimi K3(max):约 57,全球第 3,开源模型第 1
- GLM-5.2(max):51(此前开源第一名)
- DeepSeek V4 Pro(max):44
Kimi K3 是开源 3T 级模型中综合能力最强的一个,但成本并非最优——每任务约 $0.95,比 Claude Fable 5(约 $2.4/任务)便宜约 60%,但比 GLM-5.2(约 $0.47/任务)更贵。简单说:开源阵营能力天花板最高,而非性价比最优。K3 目前在 Arena.ai Frontend Code Arena 榜单排名第一。
07 · 开放权重 vs 开源?自定义许可的两道商业门槛
这是本次发布争议最大、也最值得企业用户仔细阅读的部分。
月之暗面官方材料从未使用「open source」,一直采用 open weight(开放权重)表述——与国内媒体普遍使用的「开源」翻译存在语义落差。按 OSI 标准,真正开源需同时公开训练数据、训练代码与完整可复现流程;K3 只公开训练完成后的权重、技术报告和推理相关 Infra,训练数据与完整训练代码并未公开。
许可证不再自称 Modified MIT(K2 时代的说法),而是一份完全自定义的文件,含两道 K2 系列都没有的商业门槛:
- Model-as-a-Service 收入门槛:若被许可方及关联方运营 MAAS 业务,且连续 12 个月内该业务累计收入超过 $20M(2000 万美元),须与月之暗面另行签署商业协议。
- 规模展示门槛:若产品或服务月活超过 1 亿,或月收入超过 $20M,须在产品界面显著展示「Kimi K3」字样。
对绝大多数中小团队和创业公司,两道门槛几乎不会被触发;但若商业计划是「拿 K3 开与月之暗面竞争的模型服务」,第一道门槛是法务团队需重点关注的红线。
08 · API 定价与自部署:64 卡超节点与 1.56TB 权重
8.1 API 方式
月之暗面提供 OpenAI SDK 兼容的 Chat Completions API(https://api.moonshot.ai/v1,模型 ID kimi-k3),大部分项目只需改 base URL 和密钥即可接入。
| Token 类型 | 价格(每百万 token) |
|---|---|
| 输入(缓存命中) | $0.30 |
| 输入(缓存未命中) | $3.00 |
| 输出(含推理过程) | $15.00 |
Mooncake 分离式推理架构在典型编程类工作负载上缓存命中率可达 90% 以上,实际成本更接近 $0.30 档,而非 $3 表头价。
8.2 自部署方式
2.8 万亿参数、896 个专家的规模决定了 K3 几乎不可能在消费级硬件上运行。官方建议部署在 64 卡及以上超节点配置;权重约 1.56TB。对个人开发者和大部分中小团队,更现实的路径是通过官方 API 或 OpenRouter 等第三方平台调用(目前已有 7 家服务商上线,定价大多与官方一致)。
硬核数据 #3:1.56TB 权重 + 64+ 加速器——任何「在 MacBook 上跑 K3」的教程对生产环境应无视;正确答案是 API 或托管路由。
09 · 中美 AI 争端、商务部 7/28 回应与 Qwen3.8-Max-Preview
Kimi K3 开源节点并非孤立事件。它卡在 WAIC 2026 窗口期,同时叠加正在升级的中美「模型蒸馏」争端——权重开源前几天,美方指控月之暗面「工业化蒸馏」Anthropic 模型训练 K3 并威胁制裁;7 月 28 日中国商务部公开回应,指责美方搞「AI 霸权主义」并威胁采取反制措施。
在此背景下,月之暗面把权重、技术报告和三项核心 Infra 全部公开,某种程度上是用完整工程细节自证技术路径独立性。三天后,阿里巴巴(月之暗面投资方之一)发布 24 万亿参数的 Qwen3.8-Max-Preview,被外界普遍解读为对 K3 的直接回应——国产大模型竞争正式进入「3T 俱乐部」阶段。
10 · 五步落地实操(Mac 开发者)
- 在 platform.kimi.ai 注册 API Key,用 OpenAI 兼容 SDK 跑通
kimi-k3基线任务(长文档 / 修 bug / 多文件重构各 1 个) - 开启上下文缓存,记录编码场景命中率与真实 $/task,对比 Fable 5 / GPT-5.6 账单
- 核对 Hugging Face Moonshot 组织仓库:1.56TB 权重分片、LICENSE 自定义条款、技术报告 PDF
- 在隔离环境(非主力 Mac)完成 Kimi Code 或 Cursor + K3 路由试跑,避免 API Key 污染全局 shell
- 预读 7/17 深度评测架构章节,结合本文许可与 Infra 更新完成选型文档
11 · 常见问题 FAQ
Q: Kimi K3 真的是开源模型吗?
A: 严格来说不是。它属于「开放权重(open weight)」模型:训练完成的权重文件、技术报告和部分 Infra 工具是公开的,但训练数据和完整训练代码没有公开,不符合 OSI 标准下的「开源」定义。
Q: Kimi K3 可以免费商用吗?
A: 可以,绝大多数商业场景不受限制。但如果你运营的是「模型即服务」业务且年收入超过 2000 万美元,或产品月活超过 1 亿/月收入超过 2000 万美元,需要额外满足许可证中的特定条款。
Q: Kimi K3 需要多少显卡才能自己部署?
A: 官方建议部署在 64 卡及以上的超节点集群。个人和大部分企业用户更现实的方式是通过官方 API 或 OpenRouter 等第三方平台调用。
Q: Kimi K3 的性能到底强不强?
A: 在开源模型阵营中综合能力最强,Artificial Analysis 智能指数全球第 3,仅次于 Claude Fable 5 和 GPT-5.6 Sol;但成本高于同为开源的 GLM-5.2,属于「开源阵营天花板最高、但非性价比最优」的选择。
Q: Kimi K3 和 Kimi K2 有什么区别?
A: K3 参数规模是 K2.5 的约 3 倍,架构上新增了 Attention Residuals 和 Per-Head Muon,上下文窗口和多模态能力也大幅提升;许可证方面 K3 新增了 Model-as-a-Service 收入门槛,商业限制比 K2 系列更细化。
12 · 租用隔离 Mac:在主力机外完成 Kimi K3 API 验收
权重已落地,但 1.56TB 下载与 64 卡自部署对 Mac 开发者仍不现实。更务实的路径是在隔离 Apple Silicon 节点上把 Kimi K3 API 工作流跑通:Moonshot Key 写入租用机而非主力机 Keychain、百万 token 长上下文实验不污染本地缓存、与 Claude/GPT 的同仓库对比可在「用完即毁」环境中复现。Windows/Linux 用户虽可通过 kimi.com 体验,但无法验证与 macOS 原生工具链并存的 Kimi Code 场景。
虽然你可以直接在笔记本上接入 K3 API,但主力机更适合稳定交付;隔离 Mac 试跑能降低 Key 泄露与长上下文实验的不可逆风险,租赁则避免为「试模型」专门买硬件。计费见 M 系列 Mac 算力租赁定价。
13 · 信源清单
- 官方:kimi.com/blog/kimi-k3(技术博客)、platform.kimi.ai(API 文档与定价)、Hugging Face(moonshotai 组织)
- 开源 Infra:GitHub moonshotai/FlashKDA、MoonEP、AgentEnv 仓库
- 独立评测:Vals AI SWE-bench Verified 榜单、Artificial Analysis Intelligence Index(7 月 16 日)
- 深度报道:VentureBeat、Simon Willison's blog、Scientific American、The Register
- 地缘与社区:商务部 7/28 回应、白宫蒸馏指控报道、Hacker News、r/LocalLLaMA
数据整理日期:2026 年 7 月 28 日。发布前请以官方最新 LICENSE 原文与 Hugging Face 仓库为准。