Kimi K3 全面開源權重:2.8 兆參數落地,月之暗面這次釋出了什麼
誰該讀?追蹤 7 月 27 日 Kimi K3 完整權重上線的 Mac 開發者與 AI 工程師,常被「開源」與 open weight 混用誤導,也不確定 1.56TB 權重能否自架。本文提供什麼?發布復盤、KDA/AttnRes 架構拆解、跑分對照、自訂授權門檻、API 定價與中美 AI 背景下的選型結論。結構包含:時間線表、規格表、Infra 表、benchmark 表、五步落地、FAQ×5、租用 Mac 隔離試跑。
📋 本文目錄
姊妹篇見 Kimi K3 深度評測(7/17)、7/22 發布前 anticipation、Opus 5 + K3 蒸餾門週報。
Featured Snippet 直答
7 月 27 日晚 23 點左右,月之暗面正式發布 Kimi K3 完整模型權重與技術報告,並同步開源 MoonEP、FlashKDA、AgentEnv 三項核心基礎設施。K3 是 2.8 兆參數稀疏 MoE 模型(激活約 1040 億),支援 100 萬 token上下文,權重約 1.56TB,上線半小時內登頂 Hugging Face 趨勢榜第一。官方始終使用 open weight(開放權重)表述,而非 open source;授權為自訂條款,含 $20M MAAS 收入與 1 億 MAU 兩道商業門檻——不是 K2 時代的 Modified MIT。
7 月 27 日晚,月之暗面(Moonshot AI)正式釋出 Kimi K3 的完整模型權重與技術報告,並同步開源支撐其訓練的三項核心基礎設施:MoonEP、FlashKDA、AgentEnv。Kimi K3 擁有 2.8 兆總參數的混合專家(MoE)架構,激活參數約 1040 億,支援 100 萬 token 上下文視窗與原生視覺理解——這是全球首個被完整開放的 3 兆參數級別模型。權重檔案在 Hugging Face 上體積約 1.56TB,上線半小時內即登頂趨勢榜第一。這次開源距離 Kimi K3 在 kimi.com 與 API 端首發,只過去了 11 天。
01 · 三大決策痛點
- 「開源」語意陷阱:月之暗面官方材料從未使用 open source,一直採用 open weight。台港媒體常翻成「開源」,但 OSI 標準要求訓練資料、訓練程式碼與可復現流水線——K3 只公開權重、技術報告與部分 Infra,用錯術語會在 r/LocalLLaMA 被質疑外行。
- 授權兩道商業門檻:K3 不再自稱 Modified MIT,而是自訂授權。MAAS 業務連續 12 個月收入超 $20M 須另行簽約;月活超 1 億或月收入超 $20M 須在介面顯著展示「Kimi K3」。中小團隊通常無感,但「拿 K3 做競品 API」是法務紅線。
- 能力天花板 vs 性價比 vs 部署現實:SWE-bench Verified 獨立復測 93.4%、AA Index 全球第 3,是開源陣營能力天花板;但單任務約 $0.95,高於 GLM-5.2 的 $0.47。自部署需 64+ 卡超節點、權重 1.56TB——選型不能只看一張榜或一張價目表。
02 · 發布時間線:7/16–7/28
| 日期 | 事件 |
|---|---|
| 2026-07-16 | Kimi K3 在 kimi.com、Kimi Work、Kimi Code 及 API 首發(線上呼叫,權重未公開);官方部落格《Kimi K3: Open Frontier Intelligence》;Artificial Analysis 同日發布獨立評測 |
| 2026-07-17 | WAIC 2026 開幕;新華社稱 K3 為「目前全球參數最大的開源模型」 |
| 2026-07-22–23 | 中美「模型蒸餾」爭端升級:白宮科技顧問 Michael Kratsios 指控月之暗面對 Anthropic Fable 進行工業化蒸餾;財長 Scott Bessent 稱將考慮制裁及實體清單 |
| 2026-07-27 | 完整權重 + 技術報告發布;開源 MoonEP、AgentEnv(FlashKDA 此前已開源);HF 約 1.56TB,半小時登頂趨勢榜 |
| 2026-07-28 | 中國商務部就中美 AI 爭端公開回應,指責美方「AI 霸權主義」並威脅反制;國內媒體跟進報導開源細節 |
03 · Kimi K3 核心參數一覽
| 項目 | 參數 |
|---|---|
| 總參數量 | 2.8 兆(2.8T) |
| 激活參數量 | 約 1040 億 |
| 架構類型 | 混合專家模型(MoE),Stable LatentMoE |
| 專家配置 | 896 個路由專家,每 token 激活 16 個(另有共享專家,稀疏度約 1.8%) |
| 注意力機制 | Kimi Delta Attention(KDA)+ 門控多頭潛在注意力(Gated MLA) |
| 上下文視窗 | 100 萬 token(1,048,576) |
| 多模態能力 | 原生視覺理解(ViT-V2,27 層) |
| 權重格式 | MXFP4 權重 + MXFP8 激活(SFT 階段起量化感知訓練) |
| 權重體積 | 約 1.56TB(Hugging Face) |
| License | 自訂授權條款(官方稱 open weight,非 Modified MIT) |
硬核數據 #1:1.56TB 完整權重 + 100 萬 token 視窗——全球首個完整開放的 3T 級模型,結構性優勢在閉源競品同等單價下難以複製。
04 · 四大架構創新:KDA、AttnRes、Per-Head Muon 與 Stable LatentMoE
Kimi K3 重構了深度學習沿用多年的三大傳統元件——注意力機制、殘差連接、優化器,這也是它區別於「單純堆參數」的關鍵。
4.1 Kimi Delta Attention(KDA):讓「遺忘」變得更精細
傳統 Gated DeltaNet 使用標量級遺忘門——整段記憶用同一衰減係數。KDA 改為逐通道門控:每個特徵維度擁有獨立衰減率,某些特徵長期保留、另一些快速遺忘。KDA 採用 chunkwise 的 Diagonal-Plus-Low-Rank(DPLR)公式實現線性時間遞迴,在保證硬體效率的同時大幅降低長序列顯存開銷。K3 將 KDA 與少量全域注意力層(Gated MLA)交替混合,支撐 100 萬 token 上下文並將 KV Cache 壓到極低。
4.2 Attention Residuals(AttnRes):殘差連接不再是「雨露均霑」
傳統殘差連接逐層均勻累加,層數越深早期資訊越易被稀釋。AttnRes 改為選擇性、依據輸入動態聚合前面所有層的輸出——每層僅新增一個 RMSNorm 和一個偽查詢向量,參數開銷幾乎可忽略,卻帶來約 25% 訓練效率提升,代價不到 2%。偽查詢向量初始化為零,訓練初期等價於均勻平均,避免早期不穩定。
4.3 Per-Head Muon:讓每個注意力頭獨立學習
Muon 是近年廣泛採用的優化器;K3 擴展為逐注意力頭獨立優化,讓每個頭擁有更自適應的收斂路徑。這是純訓練期技術,API 呼叫者無感知,但正是這類細節堆疊,使 K3 以相對更少激活參數打出接近頂尖閉源模型的效果。
4.4 Stable LatentMoE:896 選 16 的稀疏藝術
MoE 層擁有 896 個路由專家,每 token 只激活 16 個(稀疏度約 1.8%),配合共享專家保證基礎能力穩定。團隊採用 Quantile Balancing 均衡策略,並配合 MoonEP 從數學上證明每個計算節點冗餘專家數的理論上界,保證負載均衡方案可行。
05 · 三大開源 Infra:MoonEP、FlashKDA、AgentEnv
月之暗面沒有只發權重檔案,而是把支撐 K3 訓練效率與穩定性的三項關鍵基礎設施一併開源——這也是本次發布在開發者社群獲較高評價的重要原因。
| 技術 | 定位 | 關鍵能力 |
|---|---|---|
| MoonEP | 面向超大規模細粒度 MoE 的高效能通訊函式庫 | 透過臨時複製過載專家保證每個計算節點獲得均等 token 數;數學證明冗餘專家數理論上界,負載不均衡時仍維持高通訊效率 |
| FlashKDA | 基於 NVIDIA CUTLASS 的 KDA 高效能算子(此前已開源) | 在 NVIDIA H20 上 prefill 比 flash-linear-attention 基線快 1.72–2.22 倍;可作為 chunk_kda 直接替代後端,無需改程式碼 |
| AgentEnv | 與 KVCache.ai 聯合開發的 Agent 沙箱(Firecracker microVM) | 面向大規模並行 Agent RL 訓練;支援快速快照、恢復與 fork;官方披露 checkpoint 延遲低至 133ms、恢復 49ms、記憶體超分最高 6.5 倍(尚未經第三方獨立復現) |
硬核數據 #2:FlashKDA 在 H20 上 prefill 加速 1.72–2.22 倍——開源的不只是權重,而是可復用的工程棧。
06 · 跑分對照:SWE-bench 與 Artificial Analysis
不同機構、不同評測框架數字差異較大,以下優先引用獨立第三方復測資料。
6.1 SWE-bench Verified(獨立復測,Vals AI,截至 2026 年 7 月)
| 模型 | 分數 | 發布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
6.2 Artificial Analysis 智能指數(max 推理檔)
- Claude Fable 5(max + fallback):60
- GPT-5.6 Sol(max):59
- Kimi K3(max):約 57,全球第 3,開源模型第 1
- GLM-5.2(max):51(此前開源第一名)
- DeepSeek V4 Pro(max):44
Kimi K3 是開源 3T 級模型中綜合能力最強的一個,但成本並非最優——每任務約 $0.95,比 Claude Fable 5(約 $2.4/任務)便宜約 60%,但比 GLM-5.2(約 $0.47/任務)更貴。簡單說:開源陣營能力天花板最高,而非性價比最優。K3 目前在 Arena.ai Frontend Code Arena 榜單排名第一。
07 · 開放權重 vs 開源?自訂授權的兩道商業門檻
這是本次發布爭議最大、也最值得企業用戶仔細閱讀的部分。
月之暗面官方材料從未使用「open source」,一直採用 open weight(開放權重)表述——與媒體普遍使用的「開源」翻譯存在語意落差。按 OSI 標準,真正開源需同時公開訓練資料、訓練程式碼與完整可復現流程;K3 只公開訓練完成後的權重、技術報告和推理相關 Infra,訓練資料與完整訓練程式碼並未公開。
授權不再自稱 Modified MIT(K2 時代的說法),而是一份完全自訂的檔案,含兩道 K2 系列都沒有的商業門檻:
- Model-as-a-Service 收入門檻:若被授權方及關聯方營運 MAAS 業務,且連續 12 個月內該業務累計收入超過 $20M(2000 萬美元),須與月之暗面另行簽署商業協議。
- 規模展示門檻:若產品或服務月活超過 1 億,或月收入超過 $20M,須在產品介面顯著展示「Kimi K3」字樣。
對絕大多數中小團隊和新創公司,兩道門檻幾乎不會被觸發;但若商業計畫是「拿 K3 開與月之暗面競爭的模型服務」,第一道門檻是法務團隊需重點關注的紅線。
08 · API 定價與自部署:64 卡超節點與 1.56TB 權重
8.1 API 方式
月之暗面提供 OpenAI SDK 相容的 Chat Completions API(https://api.moonshot.ai/v1,模型 ID kimi-k3),大部分專案只需改 base URL 和金鑰即可接入。
| Token 類型 | 價格(每百萬 token) |
|---|---|
| 輸入(快取命中) | $0.30 |
| 輸入(快取未命中) | $3.00 |
| 輸出(含推理過程) | $15.00 |
Mooncake 分離式推理架構在典型程式設計類工作負載上快取命中率可達 90% 以上,實際成本更接近 $0.30 檔,而非 $3 表頭價。
8.2 自部署方式
2.8 兆參數、896 個專家的規模決定了 K3 幾乎不可能在消費級硬體上執行。官方建議部署在 64 卡及以上超節點配置;權重約 1.56TB。對個人開發者和大部分中小團隊,更現實的路徑是透過官方 API 或 OpenRouter 等第三方平台呼叫(目前已有 7 家服務商上線,定價大多與官方一致)。
硬核數據 #3:1.56TB 權重 + 64+ 加速器——任何「在 MacBook 上跑 K3」的教學對生產環境應無視;正確答案是 API 或託管路由。
09 · 中美 AI 爭端、商務部 7/28 回應與 Qwen3.8-Max-Preview
Kimi K3 開源節點並非孤立事件。它卡在 WAIC 2026 視窗期,同時疊加正在升級的中美「模型蒸餾」爭端——權重開源前幾天,美方指控月之暗面「工業化蒸餾」Anthropic 模型訓練 K3 並威脅制裁;7 月 28 日中國商務部公開回應,指責美方搞「AI 霸權主義」並威脅採取反制措施。
在此背景下,月之暗面把權重、技術報告和三項核心 Infra 全部公開,某種程度上是用完整工程細節自證技術路徑獨立性。三天後,阿里巴巴(月之暗面投資方之一)發布 24 兆參數的 Qwen3.8-Max-Preview,被外界普遍解讀為對 K3 的直接回應——國產大模型競爭正式進入「3T 俱樂部」階段。
10 · 五步落地實操(Mac 開發者)
- 在 platform.kimi.ai 註冊 API Key,用 OpenAI 相容 SDK 跑通
kimi-k3基線任務(長文件/修 bug/多檔案重構各 1 個) - 開啟上下文快取,記錄編碼場景命中率與真實 $/task,對照 Fable 5/GPT-5.6 帳單
- 核對 Hugging Face Moonshot 組織倉庫:1.56TB 權重分片、LICENSE 自訂條款、技術報告 PDF
- 在隔離環境(非主力 Mac)完成 Kimi Code 或 Cursor + K3 路由試跑,避免 API Key 污染全域 shell
- 預讀 7/17 深度評測架構章節,結合本文授權與 Infra 更新完成選型文件
11 · 常見問題 FAQ
Q: Kimi K3 真的是開源模型嗎?
A: 嚴格來說不是。它屬於「開放權重(open weight)」模型:訓練完成的權重檔案、技術報告和部分 Infra 工具是公開的,但訓練資料和完整訓練程式碼沒有公開,不符合 OSI 標準下的「開源」定義。
Q: Kimi K3 可以免費商用嗎?
A: 可以,絕大多數商業場景不受限制。但如果你營運的是「模型即服務」業務且年收入超過 2000 萬美元,或產品月活超過 1 億/月收入超過 2000 萬美元,需要額外滿足授權條款中的特定條件。
Q: Kimi K3 需要多少顯卡才能自己部署?
A: 官方建議部署在 64 卡及以上的超節點叢集。個人和大部分企業用戶更現實的方式是透過官方 API 或 OpenRouter 等第三方平台呼叫。
Q: Kimi K3 的效能到底強不強?
A: 在開源模型陣營中綜合能力最強,Artificial Analysis 智能指數全球第 3,僅次於 Claude Fable 5 和 GPT-5.6 Sol;但成本高於同為開源的 GLM-5.2,屬於「開源陣營天花板最高、但非性價比最優」的選擇。
Q: Kimi K3 和 Kimi K2 有什麼區別?
A: K3 參數規模是 K2.5 的約 3 倍,架構上新增了 Attention Residuals 和 Per-Head Muon,上下文視窗與多模態能力也大幅提升;授權方面 K3 採自訂條款並新增 Model-as-a-Service 收入門檻,商業限制比 K2 系列更細化,且不再是 Modified MIT。
12 · 租用隔離 Mac:在主力機外完成 Kimi K3 API 驗收
權重已落地,但 1.56TB 下載與 64 卡自部署對 Mac 開發者仍不現實。更務實的路徑是在隔離 Apple Silicon 節點上把 Kimi K3 API 工作流跑通:Moonshot Key 寫入租用機而非主力機 Keychain、百萬 token 長上下文實驗不污染本機快取、與 Claude/GPT 的同儲存庫對照可在「用完即毀」環境中復現。Windows/Linux 用戶雖可透過 kimi.com 體驗,但無法驗證與 macOS 原生工具鏈並存的 Kimi Code 場景。
雖然你可以直接在筆電上接入 K3 API,但主力機更適合穩定交付;隔離 Mac 試跑能降低 Key 外洩與長上下文實驗的不可逆風險,租用則避免為「試模型」專門買硬體。按天租用的 M 系列 Mac mini 提供用完即毀的隔離環境:伺服器規格、記憶體與頻寬選型、SSH 接入見 M 系列 Mac 算力租用定價。
13 · 信源清單
- 官方:kimi.com/blog/kimi-k3(技術部落格)、platform.kimi.ai(API 文件與定價)、Hugging Face(moonshotai 組織)
- 開源 Infra:GitHub moonshotai/FlashKDA、MoonEP、AgentEnv 倉庫
- 獨立評測:Vals AI SWE-bench Verified 榜單、Artificial Analysis Intelligence Index(7 月 16 日)
- 深度報導:VentureBeat、Simon Willison's blog、Scientific American、The Register
- 地緣與社群:商務部 7/28 回應、白宮蒸餾指控報導、Hacker News、r/LocalLLaMA
資料整理日期:2026 年 7 月 28 日。發布前請以官方最新 LICENSE 原文與 Hugging Face 倉庫為準。