Kimi K3 开源权重 7 月 27 日发布:2.8 万亿参数、百万上下文,闭源溢价还守得住吗?
谁遇到什么问题?关注 7 月 27 日 Kimi K3 完整权重发布的 Mac 开发者与 AI 工程师,分不清 API 上线(7/16)与权重开源(7/27)两个节点,也不确定自部署是否可行、能否替代 Claude Fable 5。本文给什么?时间线、规格表、跑分胜负、定价真实成本、部署门槛、发布日核对清单与行业意义。结构包含:对比表、五步发布前准备、FAQ×6、租用 Mac 隔离试跑。
📋 本文目录
姊妹篇深度评测见 Kimi K3 深度评测(7/17);横向对比可参考 GPT-5.6 Sol 发布解析、Claude Fable 5 替代方案。
Featured Snippet 直答
月之暗面(Moonshot AI)将于 2026 年 7 月 27 日在 Hugging Face 以 Modified MIT 许可证发布 Kimi K3 完整权重——一款 2.8 万亿参数稀疏 MoE 模型,拥有 1,048,576 token(约 100 万)上下文窗口。API 与 Kimi 全家桶已于 7 月 16 日上线;权重开源是第二个关键节点。
01 · 事件核心(TL;DR)
- 7 月 16 日:月之暗面通过 Kimi App、Kimi Work、Kimi Code 和 API 上线 Kimi K3;Artificial Analysis 同日发布独立评测。
- 7 月 27 日:计划公开完整模型权重(Modified MIT)+ 发布技术报告(架构、训练、评估细节)。
- 定位:全球首个 3 万亿参数级(实际 2.8T)开源权重模型,被普遍视为对闭源模型溢价定价的直接冲击。
- 关键结论:K3 不是「Fable 5 杀手」——综合智能仍排第三(AA Intelligence Index 57.1,落后 Claude Fable 5 的 59.9 和 GPT-5.6 Sol 的 58.9),但以约 1/3 的成本达到「接近前沿」的能力,且拥有闭源给不了的两样东西:开源权重 + 100 万 token 上下文。
02 · 三大决策痛点
- 两个日期混淆:7/16 API 已可用 ≠ 7/27 权重可下载。在权重放出前搜「K3 本地部署教程」多半是不负责任的标题党;生产级自部署需超节点,与 Mac 无关。
- 「开源」语义陷阱:英文社区严格区分 open weights 与 open source。K3 发布的是权重 + Modified MIT,训练代码/数据是否开放待 7/27 LICENSE 确认——写错术语会在 r/LocalLLaMA 被质疑外行。
- 跑分 vs 账单 vs 稳定性:Frontend Code Arena 第一、SWE Marathon 42.0 领先,但 GDPval 长程判断力、DeepSWE、幻觉率仍落后;单任务成本 $0.94 比 Fable 5 低 65.8%,对话打磨度与单次方差仍逊于顶级闭源——选型不能只看一张榜。
03 · 发布时间线
| 日期 | 事件 |
|---|---|
| 2026-07-16 | Kimi K3 通过 API / Kimi 全家桶上线;Artificial Analysis 同日发布独立评测 |
| 2026-07-17 | 上海世界人工智能大会(WAIC)开幕,新华社将 K3 发布定调为「国家级里程碑」 |
| 2026-07-27 | 完整权重公开下载(Hugging Face,Modified MIT 许可)+ 技术报告发布 |
距权重发布(本文撰写日 7 月 22 日)还有 5 天——这是布局「K3 权重下载 / 如何本地跑」搜索意图的最后窗口期。
04 · 模型规格一览
| 项目 | 数据 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T),史上最大开源权重模型 |
| 架构 | 稀疏 MoE:Stable LatentMoE,896 个专家中每 token 激活 16 个 |
| 注意力机制 | Kimi Delta Attention(KDA,混合线性注意力)+ Attention Residuals(AttnRes)+ Gated MLA |
| 上下文窗口 | 1,048,576 tokens(约 100 万) |
| 模态 | 原生视觉理解(文本 + 图像,产品端还支持视频理解),输出为文本 |
| 权重格式 | MXFP4 权重 + MXFP8 激活(原生低精度训练,4-bit 量化接近训练精度) |
| 扩展效率 | 官方称比 K2 提升约 2.5 倍(同等算力换更多智能) |
| 训练稳定性技术 | Quantile Balancing(专家路由)、Per-Head Muon 优化器、SiTU 激活函数 |
| 长上下文解码 | KDA 在百万 token 上下文中最高 6.3 倍解码加速 |
硬核数据 #1:KDA 使 K3 能以平价提供真实可用的 100 万 token 窗口——这是闭源竞品难以在同等单价下复制的结构性优势。
05 · Kimi K3 发布日期:API 上线 vs 开源权重
当前最大搜索困惑是「K3 到底什么时候能下载?」——两个日期必须分开理解:
- 7 月 16 日(已发生):可通过 kimi.com、Kimi Code、官方 API(
kimi-k3)、OpenRouter(moonshotai/kimi-k3)立即调用;这是产品/API 发布。 - 7 月 27 日(待发生):Moonshot Hugging Face 组织上架完整 2.8T 权重 + 技术报告 + vLLM 对 KDA/prefix caching 的支持落地;这是open weights 发布。
06 · 跑分对比:K3 赢在哪、输在哪
6.1 综合智能(Artificial Analysis Intelligence Index)
| 模型 | 分数 |
|---|---|
| Claude Fable 5 | 59.9 |
| GPT-5.6 Sol | 58.9 |
| Kimi K3 | 57.1(第 3 / 189) |
| Claude Opus 4.8 / GPT-5.5 | 同档或更低 |
差距从「数百分」缩到「两三分」——闭源厂商很难再纯靠能力证明溢价。
6.2 K3 领先或打平的项目
- Frontend Code Arena:第 1(盲测中开发者偏好其 UI 代码超过 Fable 和 Sol)
- Automation Bench、SpreadsheetBench 2:第 1
- BrowseComp:91.2(第 1;配合 1M 上下文无压缩策略可到 90.4+)
- SWE Marathon(超长编码会话):42.0,明显领先(GPT-5.5 / GLM-5.2 在此崩到十几分)
- Terminal Bench 2.1:88.3,与 GPT-5.6 Sol 的 88.8 基本打平
- Program Bench:77.8,微超 Sol 的 77.6
- FrontierSWE:81.2,大幅超 Sol 的 71.3(但落后 Fable 5 的 86.6)
6.3 K3 落后的项目与官方诚实态度
- GDPval v2 Elo:1668–1687 vs Fable 5 的 1760、Sol 的 1748——长程判断力仍是 Fable 的天下
- DeepSWE:67.5 vs Sol 的 73.0
- 幻觉率:比 K2.6 有所上升(官方承认);Reddit 有用户反馈接入自建应用后「幻觉明显多于顶级闭源模型」
- 对话打磨度、稳定性(单次会话方差)仍逊于 Fable 5 / Sol
月之暗面在发布时罕见地主动承认综合性能仍落后 Fable 5 和 GPT-5.6 Sol,并列出已知短板:对 harness 传回推理内容敏感、意图模糊时过于主动等——这种透明度在国产大模型发布中并不常见,值得在选型文档中引用。
硬核数据 #2:Artificial Analysis 实测单任务成本 K3 $0.94,比 GPT-5.6 Sol 低 9.4%,比 Claude Fable 5 低 65.8%——「接近前沿 at a third of the cost」是有据表述,而非营销口号。
07 · Kimi K3 API 定价(与缓存后的真实成本)
| 项目 | 价格(每百万 tokens) |
|---|---|
| 输入(缓存未命中) | $3.00 |
| 输入(缓存命中,自动缓存) | $0.30 |
| 输出 | $15.00 |
定价刻意对齐西方标准(走「质量牌」而非「低价牌」),是目前中国大模型厂商中最高的,但仍显著低于 Claude Opus 4.8 的单任务成本。编码类工作负载缓存命中率据称超 90%,实际成本远低于表面单价。
08 · Kimi K3 真的开源吗?Open Weights vs Open Source
英文社区会严格区分两个概念——这本身是好内容:
- Open weights(开源权重):发布完整模型权重文件,允许下载、推理、微调(受 LICENSE 约束)。K3 属于这一类。
- Open source(完全开源):通常还包含训练代码、训练数据、完整可复现流水线。K3 7/27 发布是否达到这一标准,需看 LICENSE 原文与技术报告披露范围。
许可证为 Modified MIT,具体条款待 7 月 27 日发布日 Hugging Face 仓库确认。在对外沟通中,建议使用「开源权重」而非笼统的「完全开源」,以免在技术社区失去可信度。
09 · 能在本地跑 Kimi K3 吗?硬件要求与诚实结论
不是消费级硬件能跑的。这是英文读者最关心、也最容易踩坑的部分:
- 4-bit 权重约 1.4 TB
- 官方建议 64+ 加速器的「超节点」部署,需要专家并行 + 张量并行的分布式推理
- 参照:上一代 1T 参数的 K2.7 Code,INT4 也要约 577 GB显存;K3 是它的 2.8 倍
对绝大多数人,正确答案是 API($3/$15)。自部署只在三种场景成立:
- 严格数据驻留 / 离线要求
- 需要在自有数据上微调
- 调用量大到自建硬件反而便宜
硬核数据 #3:4-bit 权重约 1.4 TB + 64+ 加速器——任何「在你的 MacBook 上跑 K3」的教程,在 7 月 27 日后仍会泛滥,但生产环境应无视。
10 · 7 月 27 日开源发布:具体会发生什么
- 完整 2.8T 权重上架 Moonshot 的 Hugging Face 组织,Modified MIT 许可证(具体条款待发布日确认)
- 同步发布技术报告(架构、训练、评估细节)
- vLLM 对 KDA / prefix caching 的支持将随权重一起落地(官方称正与推理伙伴和开源维护者对齐,确保生态可用)
- 预期后续:Ollama、GGUF 量化版本会像 K2 系列一样陆续跟进
11 · 7 月 27 日发布日核对清单
权重放出后 2 小时内建议逐项核对(这是抢「kimi k3 download」搜索排名的关键动作):
- Hugging Face 仓库文件是否齐全(config、tokenizer、分片权重索引)
- LICENSE 原文(Modified MIT 具体限制条款)
- 量化版本是否同步放出(MXFP4 / NVFP4 / GGUF)
- vLLM / SGLang 启动命令与最低可行硬件说明
- 独立长上下文复测(验证 1M token 是否可在第三方 harness 复现)
12 · 为什么 7 月 27 日权重发布很重要
- 开源与闭源能力差距在前沿基本闭合:差距从「数百分」缩到「两三分」,闭源厂商很难再纯靠能力证明溢价。
- 地缘背景:发布赶在 WAIC 前一天;一个月前美国政府曾短暂下架 Anthropic 的 Fable/Mythos 模型(7 月 1 日恢复)——「监管可以关掉闭源模型,但关不掉已发布的开源权重」成为开源叙事的新论据。
- 中国厂商梯队集体逼近:Z.ai GLM-5.2(编码对标 Opus 4.8、价格 1/5)、DeepSeek V4 Pro(1.6T)、MiniMax 等,K3 是这波浪潮的最高点。
- 月之暗面的翻身仗:2025 年初被 DeepSeek R1 冲击后排名跌至国内第七,靠 K2(2025-07)→ K2.5(2026-01)→ K3 的开源路线重建地位。
13 · 权重发布前五步准备(Mac 开发者实操)
- 在 platform.kimi.ai 注册 API Key,用 OpenAI 兼容 SDK 跑通
kimi-k3基线任务(长文档 / 修 bug / 多文件重构各 1 个) - 开启上下文缓存,记录编码场景命中率与真实 $/task,对比 Fable 5 / GPT-5.6 账单
- Bookmark Moonshot Hugging Face 组织页面,7/27 设置发布日提醒
- 在隔离环境(非主力 Mac)完成 Kimi Code 或 Cursor + K3 路由试跑,避免 API Key 污染全局 shell
- 预读 7/17 深度评测中的架构与 benchmark 章节,发布日只需增量更新 HF 链接与 LICENSE
14 · 常见问题 FAQ
Q: Kimi K3 权重什么时候发布?
A: 2026 年 7 月 27 日 Hugging Face 完整权重 + 技术报告。API 已于 7 月 16 日上线。
Q: K3 真的开源吗?
A: 更准确是 open weights(开源权重)+ Modified MIT;是否 fully open source 取决于训练代码/数据是否一并发布。
Q: K3 多少钱?
A: $3/$15 per 1M tokens;缓存命中输入 $0.30/M。单任务约 $0.94,比 Fable 5 低 65.8%。
Q: 能在 Mac 本地跑吗?
A: 不能。4-bit 约 1.4 TB,需 64+ 加速器超节点。走 API 或等 GGUF 也只能跑极小蒸馏版(若有)。
Q: K3 比 Fable 5 / GPT-5.6 更强吗?
A: 综合第三(57.1);前端代码、长编码会话领先;长程判断力、DeepSWE、稳定性落后。
Q: 用什么许可证?
A: Modified MIT,7/27 以 HF 仓库 LICENSE 原文为准。
Q: K3 和 DeepSeek 哪个强?
A: K3 综合智能更高(57.1 vs DeepSeek 同档更低),但 DeepSeek V4 Pro API 便宜得多(输出 $3.48/M vs $15/M);成本敏感选 DeepSeek,要 1M 上下文 + 即将开源的最大权重选 K3。
15 · 租用隔离 Mac:在权重放出前完成 API 验收
7 月 27 日前最该做的事不是等权重下载,而是在隔离 Apple Silicon 节点上把 Kimi K3 API 工作流跑通:Moonshot Key 写入租用机而非主力机 Keychain、百万 token 长上下文实验不污染本地缓存、与 Claude/GPT 的同仓库对比可在「用完即毁」环境中复现。Windows/Linux 用户虽可通过 kimi.com 体验,但无法验证与 macOS 原生工具链并存的 Kimi Code 场景。
虽然你可以直接在笔记本上接入 K3 API,但主力机更适合稳定交付;隔离 Mac 试跑能降低 Key 泄露与长上下文实验的不可逆风险,租赁则进一步避免为「试模型」专门买硬件。计费见 M 系列 Mac 算力租赁定价。
16 · 信源清单
- 官方:kimi.com/en/blog/kimi-k3(技术博客)、platform.kimi.ai(API 文档与定价)
- 独立评测:Artificial Analysis(Intelligence Index 57.1,7 月 16 日)
- 深度报道:VentureBeat、Northflank(自部署分析)、atoms.dev / llmrumors(对比数据)
- 社区:r/LocalLLaMA(benchmaxxed 质疑、open-weight 定义之争)、Hacker News
数据整理日期:2026 年 7 月 22 日(距权重发布 5 天)。7 月 27 日发布后请更新 HF 直链与 LICENSE 原文。