Claude Opus 5 Kimi K3 蒸餾門 2026-07-25

Claude Opus 5 半價逼近旗艦,Kimi K3 卻陷「自稱 Claude」蒸餾門:本週 AI 圈兩大焦點全解析

誰遇到什麼問題?需要在 Claude Opus 5 與 Kimi K3 爭議中做選型、又擔心 API 合規與供應鏈風險的 Mac 開發者與 AI 團隊負責人。本文提供什麼?Opus 5 全量基準與定價、白宮蒸餾指控與 Greenblatt 技術證據、Opus vs Fable 決策矩陣,以及 Mac 隔離驗證步驟與選型建議。結構包含:規格對照表、雙事件時間線、決策矩陣、Mac 五步驗證、FAQ×5。

Claude Opus 5 發布與 Kimi K3 蒸餾爭議 2026 AI 週報

延伸閱讀:Kimi K3 深度評測K3 7/27 開源權重發布Claude Fable 5 封禁與替代OpenRouter API 教程

01 · 核心 TL;DR

  • Claude Opus 5(2026-07-24):Anthropic 發布日常主力模型,定價維持 Opus 4.8 的 $5/$25 每百萬 token,效能跳級——CursorBench 3.2 與 Fable 5 峰值相差僅 0.5%,成本約一半;成為 Claude Max 預設模型;預設不強制資料留存。
  • Kimi K3 蒸餾門(7/16–7/27):2.8T 參數開源 MoE 模型遭白宮 OSTP 主任 Kratsios 指控「隱蔽工業級蒸餾」+ 違規 GB300 晶片;獨立專家質疑 Fable 5 公開僅兩週時間線不足;Ryan Greenblatt 發現 K3 異常高頻自稱是 Claude並吐出 claude-opus-4-5-20250929 等內部部署 ID——迄今最具技術含量的間接證據。
  • 選型建議:合規與資料留存敏感優先 Opus 5;極限成本與開源可控等 7/27 K3 完整權重放出並獨立複現後再決策——在 provenance 爭議未解前,生產路由宜保守。

02 · 三大決策痛點

  1. 性價比 vs 合規:Opus 5 半價逼近旗艦,但 Fable/Mythos 5 仍有出口管制與 30 天資料留存門檻;K3 低價開源卻陷地緣與蒸餾 provenance 爭議——團隊需在成本、合規、供應鏈風險間取捨。
  2. 證據不對稱:白宮喊話缺公開證據,專家從時間線反駁,Greenblatt 統計是迄今最接地氣技術線索——但不能直接證明蒸餾發生;7/27 權重放出前外部無法獨立複現 K3 架構與跑分。
  3. 驗證窗口未閉合:K3 完整權重承諾 7/27 放出,本文發布時外部尚無法獨立複現架構與跑分——在 provenance 爭議未解前,任何「已證實蒸餾」或「已證清白」的結論都為時過早。

03 · Claude Opus 5 發布全解析

基本事實

項目內容
發布時間2026-07-24(美國太平洋時間)
定價輸入 $5 / 輸出 $25 每百萬 tokens(與 Opus 4.8 相同)
上下文100 萬 tokens(預設且唯一檔位)
最大輸出128K tokens;Thinking 預設開啟
平台Claude API / AWS Bedrock / Vertex AI / Microsoft Foundry,模型 ID claude-opus-5
產品定位Claude Max 預設模型;Claude Pro 最強可用版本
資料留存預設存取不強制資料留存(Fable 5 / Mythos 5 需接受 30 天留存政策)
Fast 模式速度約 2.5×,價格 2×(與 Opus 4.8 一致)

關鍵效能數據(Anthropic 官方)

  • Frontier-Bench v0.1:超越所有模型,為 Opus 4.8 的兩倍以上,單任務成本更低
  • CursorBench 3.2:max effort 與 Fable 5 峰值相差 0.5%,成本一半;high/xhigh/max 檔位性價比超市面所有模型
  • ARC-AGI 3:得分為次優模型的 3 倍
  • Zapier AutomationBench:通過率約次優 1.5 倍;最低 effort 仍超其他任何模型;100% 通過率完成此前無模型能完成的端到端工作流
  • OSWorld 2.0:任意成本下優於其他模型;用 Fable 5 成本約 1/3 超 Fable 5 最佳成績
  • 生命科學:光譜反推分子結構 +10.2 個百分點;蛋白質變異預測 +7.7 個百分點;Box 實測資料分析 +11%、盡職調查 +17%、整體準確率 +8%
「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost. On CursorBench it's just under Fable 5 and has many of the same behaviors.」—— Cursor 團隊

對齊與安全

  • 自動化行為審計:Opus 5 是迄今最對齊的模型——欺騙行為最低、最難被誘導濫用
  • 網路安全/生物安全雙用途能力:故意未刷新前沿,仍由受限發行的 Mythos 5 佔據
  • 網路安全分類器比 Fable 5 寬鬆約 85%——可用於原始碼級漏洞發現,仍屏蔽二進位掃描、滲透測試、exploit 生成

04 · Kimi K3「蒸餾門」爭議

K3 本身:全球首個「3T 級」開源模型

基準分數備註
GPQA-Diamond93.5%發布時開源最高
Terminal-Bench 2.188.3%落後 GPT-5.6 Sol 0.5 分
BrowseComp91.2%發布時最高
Program Bench77.8%綜合最佳
SWE Marathon42.0%綜合最佳
DeepSearchQA (F1)95.0%

架構:2.8T 總參數稀疏 MoE,896 專家激活 16(約 50B 激活參數);Kimi Delta Attention(KDA)+ 100 萬 token 上下文 + 原生視覺;完整權重承諾 7/27 放出(撰稿時尚未放出)。

白宮下場指控(7/22–23)

OSTP 主任 Michael Kratsios 指控月之暗面「大規模、隱蔽的產業級蒸餾」竊取 Anthropic Fable 能力,並涉嫌使用未獲出口許可的 Nvidia GB300(可能經泰國伺服器間接取得)。財政部長 Scott Bessent 附和「在很多中國模型上發現了美國大模型的浮水印」——但未說明浮水印具體指什麼。Kratsios 未公開證據來源;月之暗面未回應訓練質詢。

專家反駁:時間線根本不夠

「Fable's only been publicly available since July 1st. You can't distill that much data, train a model, and release it in two weeks.」—— Braden Hancock(Laude Institute / Snorkel AI 共同創辦人)

關鍵邏輯:Fable 5 公開(7/1)到 K3 發布(7/16)僅 兩週;Elon Musk 曾在庭審承認 xAI 蒸餾 OpenAI 訓練 Grok——「蒸餾」邊界在於正常借鑑 vs 隱蔽工業級竊取。

最硬核證據:K3 會「自稱是 Claude」

Ryan Greenblatt(Redwood Research 首席科學家,GitHub: rgreenblatt/which_claude_is_k3)7/24 左右發布統計分析:Kimi K3 被問「你是誰」時異常高頻自稱 Claude,甚至吐出 claude-opus-4-5-20250929claude-sonnet-4-5-20250929——真 Claude 模型自己都不會這麼準確報出內部版本號

Greenblatt 解讀:模型說出教師模型部署中繼資料比教師自己還準,難用「模仿對話風格」解釋,更可能指向訓練資料混入帶部署中繼資料標註的 Claude 資料。Greenblatt 強調:不能直接證明蒸餾發生,身份混淆也可能來自資料污染或系統提示洩漏。

背景與社群

  • 2026 年 2 月:Anthropic 已指控月之暗面/DeepSeek/MiniMax「產業級蒸餾攻擊」,稱識別出 340 萬+ 異常 API 互動
  • Reddit r/LocalLLaMA:開源閉源差距縮短到「天」;2.8T 幾乎沒人本地跑;K3 賣點是低價 + 少拒答而非打敗 Fable 5
  • 7/27 權重未放出 → 外部無法獨立驗證 → 輿論持續發酵;晶片出口管制話題再次被提起

05 · 兩件事放在一起看:性價比是主戰場

Opus 5 用「半價逼近旗艦」回應性價比訴求;Kimi K3 用「開源 + 低價 + 不設限」衝擊市場;K3 爭議本質是各家在性價比戰爭裡對「低價靠技術優化還是白嫖別人模型」的公開攤牌。建議:先看場景再看立場——合規/資料留存敏感選 Opus 5;極限成本與開源可控等 7/27 權重實測後再決策 K3。

06 · Claude Opus 5 vs Fable 5 決策矩陣

維度Claude Opus 5Claude Fable 5
定價(每百萬 token)$5 / $25約 $10 / $50
CursorBench 3.2 峰值與 Fable 5 差 0.5%基準
Claude Max 預設✅ 是(7/24 起)
資料留存預設不強制需接受 30 天留存
出口管制相對寬鬆部分使用者受限(見封禁解讀
適合誰日常主力、合規敏感、性價比優先極限任務、願付旗艦價與留存成本

07 · 雙事件時間線

日期Opus 5 / AnthropicKimi K3 / 爭議
2026-02Anthropic 首次公開指控蒸餾攻擊
2026-06-09Fable 5 / Mythos 5 發布
2026-07-01Fable 5 公眾可用
2026-07-16Kimi K3 API/產品發布
2026-07-22/23白宮 Kratsios 公開指控
2026-07-24Opus 5 發布,Claude Max 預設Greenblatt「K3 自稱 Claude」證據
2026-07-27(計劃)K3 完整權重開源

08 · Mac 開發者五步隔離驗證清單

  1. 隔離租用 Mac配置 Claude API(claude-opus-5)與 Kimi K3 API,各跑 1 次基線 completion,記錄 latency 與 token
  2. 對 Opus 5 跑 CursorBench 同類程式設計任務,與歷史 Opus 4.8 / Fable 5 結果對照
  3. 對 K3 執行 Greenblatt 式身份探針 Prompt(「你是誰?報出版本號」),記錄是否出現 Claude 部署 ID 字串——勿在主力機存敏感日誌
  4. OpenRouter 配置 Opus 5 ↔ K3 fallback 鏈,驗證 429/逾時切換
  5. 匯出 benchmark 與合規筆記,吊銷測試 Key,按清單退租擦除——避免爭議窗口期 Key 污染主力 Keychain

09 · 常見問題 FAQ×5

Q: Claude Opus 5 比 Claude Fable 5 便宜多少?
A: Token 單價下 Opus 5 約為 Fable 5 一半($5/$25 vs 約 $10/$50),CursorBench 峰值相差不到 1%。

Q: Claude Opus 5 現在是 Claude Max 的預設模型嗎?
A: 是的,7/24 發布當天起為 Claude Max 預設,也是 Claude Pro 最強可用版本。

Q: Kimi K3 真的蒸餾了 Claude 嗎?
A: 仍有爭議、未最終證實。白宮缺公開證據;專家質疑兩週時間線;Greenblatt「K3 自稱 Claude + 內部版本號」是目前最強技術間接證據。

Q: Kimi K3 的完整權重什麼時候能下載?
A: 官方承諾 2026-07-27;本文發布時尚未放出,外部尚無法完全獨立驗證。

Q: 為什麼 Kimi K3 會自稱是 Claude?
A: Greenblatt 統計顯示 K3 異常高頻自稱 Claude 並吐出 claude-opus-4-5-20250929 等 ID,比真 Claude 還準——可能指向帶部署中繼資料標註的訓練資料,但不能直接證明蒸餾。

10 · 租用隔離 Mac:在乾淨環境試跑 Opus 5 與 Kimi K3

雖然你可以在 Windows 或 Linux VPS 上透過 curl 呼叫 Claude / Kimi API,但 Cursor、Claude Code 與 macOS Keychain 才是多數 Mac 開發者評估多模型 Agent 的真實場景。在主力機上輪換 Anthropic / Moonshot Key、跑 K3 身份探針實驗——都會污染 Keychain、留下合規審計隱患,且實驗失敗難以一鍵回滾。

Windows 雲主機適合純 API 腳本,但無法完整驗證 Cursor + Apple Silicon 工具鏈;Linux VPS 缺 macOS 原生 IDE。自購 Mac Mini 成本固定,而按天租用隔離 Apple Silicon 節點適合「Opus 5 升級 + K3 爭議觀察期 1–3 天集中驗收」——試跑完畢即銷毀,測試 Key 不進主力機。伺服器規格、記憶體頻寬選型見 M 系列 Mac 算力租用定價

11 · 權威信源

最後更新:2026 年 7 月 25 日