Claude Opus 5 Kimi K3 蒸馏门 2026-07-25

Claude Opus 5 半价逼近旗舰,Kimi K3 却陷「自称 Claude」蒸馏门:本周 AI 圈两大瓜全解析

谁遇到什么问题?需要在 Claude Opus 5 与 Kimi K3 争议中做选型、又担心 API 合规与供应链风险的 Mac 开发者与 AI 团队负责人。本文给什么?Opus 5 全量基准与定价、白宫蒸馏指控与 Greenblatt 技术证据、Opus vs Fable 决策矩阵,以及 Mac 隔离验证步骤与选型建议。结构包含:规格对比表、双事件时间线、决策矩阵、Mac 五步验证、FAQ×5。

Claude Opus 5 release and Kimi K3 distillation controversy AI weekly report 2026

延伸阅读:Kimi K3 深度评测K3 7/27 开源权重发布Claude Fable 5 封禁与替代OpenRouter API 教程

01 · 核心 TL;DR

  • Claude Opus 5(2026-07-24):Anthropic 发布日常主力模型,定价维持 Opus 4.8 的 $5/$25 每百万 token,性能跳级——CursorBench 3.2 与 Fable 5 峰值相差仅 0.5%,成本约一半;成为 Claude Max 默认模型;默认不强制数据留存。
  • Kimi K3 蒸馏门(7/16–7/27):2.8T 参数开源 MoE 模型遭白宫 OSTP 主任 Kratsios 指控「隐蔽工业级蒸馏」+ 违规 GB300 芯片;独立专家质疑 Fable 5 公开仅两周时间线不够;Ryan Greenblatt 发现 K3 异常高频自称是 Claude并吐出 claude-opus-4-5-20250929 等内部部署 ID——迄今最具技术含量的间接证据。
  • 选型建议:合规与数据留存敏感优先 Opus 5;极限成本与开源可控等 7/27 K3 完整权重放出并独立复现后再决策——在 provenance 争议未解前,生产路由宜保守。

02 · 三大决策痛点

  1. 性价比 vs 合规:Opus 5 半价逼近旗舰,但 Fable/Mythos 5 仍有出口管制与 30 天数据留存门槛;K3 低价开源却陷地缘与蒸馏 provenance 争议——团队需在成本、合规、供应链风险间取舍。
  2. 证据不对称:白宫喊话缺公开证据,专家从时间线反驳,Greenblatt 统计是迄今最接地气技术线索——但不能直接证明蒸馏发生;7/27 权重放出前外部无法独立复现 K3 架构与跑分。
  3. 验证窗口未闭合:K3 完整权重承诺 7/27 放出,本文发布时外部尚无法独立复现架构与跑分——在 provenance 争议未解前,任何「已证实蒸馏」或「已证清白」的结论都为时过早。

03 · Claude Opus 5 发布全解析

基本事实

项目内容
发布时间2026-07-24(美国太平洋时间)
定价输入 $5 / 输出 $25 每百万 tokens(与 Opus 4.8 相同)
上下文100 万 tokens(默认且唯一档位)
最大输出128K tokens;Thinking 默认开启
平台Claude API / AWS Bedrock / Vertex AI / Microsoft Foundry,模型 ID claude-opus-5
产品定位Claude Max 默认模型;Claude Pro 最强可用版本
数据留存默认访问不强制数据留存(Fable 5 / Mythos 5 需接受 30 天留存政策)
Fast 模式速度约 2.5×,价格 2×(与 Opus 4.8 一致)

关键性能数据(Anthropic 官方)

  • Frontier-Bench v0.1:超越所有模型,为 Opus 4.8 的两倍以上,单任务成本更低
  • CursorBench 3.2:max effort 与 Fable 5 峰值相差 0.5%,成本一半;high/xhigh/max 档位性价比超市面所有模型
  • ARC-AGI 3:得分为次优模型的 3 倍
  • Zapier AutomationBench:通过率约次优 1.5 倍;最低 effort 仍超其他任何模型;100% 通过率完成此前无模型能完成的端到端工作流
  • OSWorld 2.0:任意成本下优于其他模型;用 Fable 5 成本约 1/3 超 Fable 5 最佳成绩
  • 生命科学:光谱反推分子结构 +10.2 个百分点;蛋白质变异预测 +7.7 个百分点;Box 实测数据分析 +11%、尽职调查 +17%、整体准确率 +8%
「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost. On CursorBench it's just under Fable 5 and has many of the same behaviors.」—— Cursor 团队
「Claude Opus 5 topped Zapier's AutomationBench leaderboard without spending more tokens than prior Claude models... Previous models didn't pass; Opus 5 hit 100%.」—— Zapier

对齐与安全

  • 自动化行为审计:Opus 5 是迄今最对齐的模型——欺骗行为最低、最难被诱导滥用
  • 网络安全/生物安全双用途能力:故意未刷新前沿,仍由受限发行的 Mythos 5 占据
  • 网络安全分类器比 Fable 5 宽松约 85%——可用于源码级漏洞发现,仍屏蔽二进制扫描、渗透测试、exploit 生成
  • 生物类请求:原本 Fable 5 拦截的,现路由给 Opus 5(而非回 Opus 4.8)

04 · Kimi K3「蒸馏门」争议

K3 本身:全球首个「3T 级」开源模型

基准分数备注
GPQA-Diamond93.5%发布时开源最高
Terminal-Bench 2.188.3%落后 GPT-5.6 Sol 0.5 分
BrowseComp91.2%发布时最高
Program Bench77.8%综合最佳
SWE Marathon42.0%综合最佳
DeepSearchQA (F1)95.0%

架构:2.8T 总参数稀疏 MoE,896 专家激活 16(约 50B 激活参数);Kimi Delta Attention(KDA)+ 100 万 token 上下文 + 原生视觉;完整权重承诺 7/27 放出(撰稿时尚未放出)。

白宫下场指控(7/22–23)

OSTP 主任 Michael Kratsios 指控月之暗面「大规模、隐蔽的产业级蒸馏」窃取 Anthropic Fable 能力,并涉嫌使用未获出口许可的 Nvidia GB300(可能经泰国服务器间接获取)。财政部长 Scott Bessent 附和「在很多中国模型上发现了美国大模型的水印」——但未说明水印具体指什么。Kratsios 未公开证据来源;月之暗面未回应训练质询。

专家反驳:时间线根本不够

「Fable's only been publicly available since July 1st. You can't distill that much data, train a model, and release it in two weeks.」—— Braden Hancock(Laude Institute / Snorkel AI 联合创始人)
「Distillation is becoming less and less impactful... if it were the case, everyone would be easily able to catch up to a GLM or to a K3 by using its data for distillation. But we have not.」—— Nathan Lambert(Allen Institute for AI)

关键逻辑:Fable 5 公开(7/1)到 K3 发布(7/16)仅 两周;Elon Musk 曾在庭审承认 xAI 蒸馏 OpenAI 训练 Grok——「蒸馏」边界在于正常借鉴 vs 隐蔽工业级窃取。

最硬核证据:K3 会「自称是 Claude」

Ryan Greenblatt(Redwood Research 首席科学家,GitHub: rgreenblatt/which_claude_is_k3)7/24 左右发布统计分析:Kimi K3 被问「你是谁」时异常高频自称 Claude,甚至吐出 claude-opus-4-5-20250929claude-sonnet-4-5-20250929——真 Claude 模型自己都不会这么准确报出内部版本号

Greenblatt 解读:模型说出教师模型部署元数据比教师自己还准,难用「模仿对话风格」解释,更可能指向训练数据混入带部署元数据标注的 Claude 数据(API 日志或打标合成数据)。K3 信号锁定「Claude 4.5 时代」(2025 年末),K2 指向更早 Sonnet 4——呈现「逐代追新」规律。Greenblatt 强调:不能直接证明蒸馏发生,身份混淆也可能来自数据污染或系统提示泄露。

背景与社区

  • 2026 年 2 月:Anthropic 已指控月之暗面/DeepSeek/MiniMax「产业级蒸馏攻击」,称识别出 340 万+ 异常 API 交互
  • Reddit r/LocalLLaMA:开源闭源差距缩短到「天」;2.8T 几乎没人本地跑;K3 卖点是低价 + 少拒答而非打败 Fable 5
  • 7/27 权重未放出 → 外部无法独立验证 → 舆论持续发酵;芯片出口管制话题再次被提起

05 · 两件事放在一起看:性价比是主战场

Opus 5 用「半价逼近旗舰」回应性价比诉求;Kimi K3 用「开源 + 低价 + 不设限」冲击市场;K3 争议本质是各家在性价比战争里对「低价靠技术优化还是白嫖别人模型」的公开摊牌。建议:先看场景再看立场——合规/数据留存敏感选 Opus 5;极限成本与开源可控等 7/27 权重实测后再决策 K3。

06 · Claude Opus 5 vs Fable 5 决策矩阵

维度Claude Opus 5Claude Fable 5
定价(每百万 token)$5 / $25约 $10 / $50
CursorBench 3.2 峰值与 Fable 5 差 0.5%基准
Claude Max 默认✅ 是(7/24 起)
数据留存默认不强制需接受 30 天留存
出口管制相对宽松部分用户受限(见封禁解读
适合谁日常主力、合规敏感、性价比优先极限任务、愿付旗舰价与留存成本

07 · 双事件时间线

日期Opus 5 / AnthropicKimi K3 / 争议
2026-02Anthropic 首次公开指控蒸馏攻击
2026-06-09Fable 5 / Mythos 5 发布
2026-07-01Fable 5 公众可用
2026-07-16Kimi K3 API/产品发布
2026-07-22/23白宫 Kratsios 公开指控
2026-07-24Opus 5 发布,Claude Max 默认Greenblatt「K3 自称 Claude」证据
2026-07-27(计划)K3 完整权重开源

08 · Mac 开发者五步隔离验证清单

  1. 隔离租用 Mac配置 Claude API(claude-opus-5)与 Kimi K3 API,各跑 1 次基线 completion,记录 latency 与 token
  2. 对 Opus 5 跑 CursorBench 同类编程任务(或内部 repo 小 patch),与历史 Opus 4.8 / Fable 5 结果对照
  3. 对 K3 执行 Greenblatt 式身份探针 Prompt(「你是谁?报出版本号」),记录是否出现 Claude 部署 ID 字符串——勿在主力机存敏感日志
  4. OpenRouter 或自研路由配置 Opus 5 ↔ K3 fallback 链,验证 429/超时切换
  5. 导出 benchmark 与合规笔记,吊销测试 Key,按清单退租擦除——避免争议窗口期 Key 污染主力 Keychain

09 · 常见问题 FAQ×5

Q: Claude Opus 5 比 Claude Fable 5 便宜多少?
A: Token 单价下 Opus 5 约为 Fable 5 一半($5/$25 vs 约 $10/$50),CursorBench 峰值相差不到 1%。

Q: Claude Opus 5 现在是 Claude Max 的默认模型吗?
A: 是的,7/24 发布当天起为 Claude Max 默认,也是 Claude Pro 最强可用版本。

Q: Kimi K3 真的蒸馏了 Claude 吗?
A: 仍有争议、未最终证实。白宫缺公开证据;专家质疑两周时间线;Greenblatt「K3 自称 Claude + 内部版本号」是目前最强技术间接证据。

Q: Kimi K3 的完整权重什么时候能下载?
A: 官方承诺 2026-07-27;本文发布时尚未放出,外部尚无法完全独立验证。

Q: 为什么 Kimi K3 会自称是 Claude?
A: Greenblatt 统计显示 K3 异常高频自称 Claude 并吐出 claude-opus-4-5-20250929 等 ID,比真 Claude 还准——可能指向带部署元数据标注的训练数据,但不能直接证明蒸馏。

10 · 租用隔离 Mac:在干净环境试跑 Opus 5 与 Kimi K3

虽然你可以在 Windows 或 Linux VPS 上通过 curl 调用 Claude / Kimi API,但 Cursor、Claude Code 与 macOS Keychain 才是多数 Mac 开发者评估多模型 Agent 的真实场景。在主力机上轮换 Anthropic / Moonshot Key、跑 K3 身份探针实验、或在争议窗口期切换 fallback——都会污染 Keychain、留下合规审计隐患,且实验失败难以一键回滚。

Windows 云主机适合纯 API 脚本,但无法完整验证 Cursor + Apple Silicon 工具链;Linux VPS 缺 macOS 原生 IDE。自购 Mac Mini 成本固定,而按天租用隔离 Apple Silicon 节点适合「Opus 5 升级 + K3 争议观察期 1–3 天集中验收」——试跑完毕即销毁,测试 Key 不进主力机。计费见 M 系列 Mac 算力租赁定价

11 · 权威信源

最后更新:2026 年 7 月 25 日