Claude Opus 5 半价逼近旗舰,Kimi K3 却陷「自称 Claude」蒸馏门:本周 AI 圈两大瓜全解析
谁遇到什么问题?需要在 Claude Opus 5 与 Kimi K3 争议中做选型、又担心 API 合规与供应链风险的 Mac 开发者与 AI 团队负责人。本文给什么?Opus 5 全量基准与定价、白宫蒸馏指控与 Greenblatt 技术证据、Opus vs Fable 决策矩阵,以及 Mac 隔离验证步骤与选型建议。结构包含:规格对比表、双事件时间线、决策矩阵、Mac 五步验证、FAQ×5。
📋 本文目录
延伸阅读:Kimi K3 深度评测、K3 7/27 开源权重发布、Claude Fable 5 封禁与替代、OpenRouter API 教程。
01 · 核心 TL;DR
- Claude Opus 5(2026-07-24):Anthropic 发布日常主力模型,定价维持 Opus 4.8 的 $5/$25 每百万 token,性能跳级——CursorBench 3.2 与 Fable 5 峰值相差仅 0.5%,成本约一半;成为 Claude Max 默认模型;默认不强制数据留存。
- Kimi K3 蒸馏门(7/16–7/27):2.8T 参数开源 MoE 模型遭白宫 OSTP 主任 Kratsios 指控「隐蔽工业级蒸馏」+ 违规 GB300 芯片;独立专家质疑 Fable 5 公开仅两周时间线不够;Ryan Greenblatt 发现 K3 异常高频自称是 Claude并吐出
claude-opus-4-5-20250929等内部部署 ID——迄今最具技术含量的间接证据。 - 选型建议:合规与数据留存敏感优先 Opus 5;极限成本与开源可控等 7/27 K3 完整权重放出并独立复现后再决策——在 provenance 争议未解前,生产路由宜保守。
02 · 三大决策痛点
- 性价比 vs 合规:Opus 5 半价逼近旗舰,但 Fable/Mythos 5 仍有出口管制与 30 天数据留存门槛;K3 低价开源却陷地缘与蒸馏 provenance 争议——团队需在成本、合规、供应链风险间取舍。
- 证据不对称:白宫喊话缺公开证据,专家从时间线反驳,Greenblatt 统计是迄今最接地气技术线索——但不能直接证明蒸馏发生;7/27 权重放出前外部无法独立复现 K3 架构与跑分。
- 验证窗口未闭合:K3 完整权重承诺 7/27 放出,本文发布时外部尚无法独立复现架构与跑分——在 provenance 争议未解前,任何「已证实蒸馏」或「已证清白」的结论都为时过早。
03 · Claude Opus 5 发布全解析
基本事实
| 项目 | 内容 |
|---|---|
| 发布时间 | 2026-07-24(美国太平洋时间) |
| 定价 | 输入 $5 / 输出 $25 每百万 tokens(与 Opus 4.8 相同) |
| 上下文 | 100 万 tokens(默认且唯一档位) |
| 最大输出 | 128K tokens;Thinking 默认开启 |
| 平台 | Claude API / AWS Bedrock / Vertex AI / Microsoft Foundry,模型 ID claude-opus-5 |
| 产品定位 | Claude Max 默认模型;Claude Pro 最强可用版本 |
| 数据留存 | 默认访问不强制数据留存(Fable 5 / Mythos 5 需接受 30 天留存政策) |
| Fast 模式 | 速度约 2.5×,价格 2×(与 Opus 4.8 一致) |
关键性能数据(Anthropic 官方)
- Frontier-Bench v0.1:超越所有模型,为 Opus 4.8 的两倍以上,单任务成本更低
- CursorBench 3.2:max effort 与 Fable 5 峰值相差 0.5%,成本一半;high/xhigh/max 档位性价比超市面所有模型
- ARC-AGI 3:得分为次优模型的 3 倍
- Zapier AutomationBench:通过率约次优 1.5 倍;最低 effort 仍超其他任何模型;100% 通过率完成此前无模型能完成的端到端工作流
- OSWorld 2.0:任意成本下优于其他模型;用 Fable 5 成本约 1/3 超 Fable 5 最佳成绩
- 生命科学:光谱反推分子结构 +10.2 个百分点;蛋白质变异预测 +7.7 个百分点;Box 实测数据分析 +11%、尽职调查 +17%、整体准确率 +8%
「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost. On CursorBench it's just under Fable 5 and has many of the same behaviors.」—— Cursor 团队
「Claude Opus 5 topped Zapier's AutomationBench leaderboard without spending more tokens than prior Claude models... Previous models didn't pass; Opus 5 hit 100%.」—— Zapier
对齐与安全
- 自动化行为审计:Opus 5 是迄今最对齐的模型——欺骗行为最低、最难被诱导滥用
- 网络安全/生物安全双用途能力:故意未刷新前沿,仍由受限发行的 Mythos 5 占据
- 网络安全分类器比 Fable 5 宽松约 85%——可用于源码级漏洞发现,仍屏蔽二进制扫描、渗透测试、exploit 生成
- 生物类请求:原本 Fable 5 拦截的,现路由给 Opus 5(而非回 Opus 4.8)
04 · Kimi K3「蒸馏门」争议
K3 本身:全球首个「3T 级」开源模型
| 基准 | 分数 | 备注 |
|---|---|---|
| GPQA-Diamond | 93.5% | 发布时开源最高 |
| Terminal-Bench 2.1 | 88.3% | 落后 GPT-5.6 Sol 0.5 分 |
| BrowseComp | 91.2% | 发布时最高 |
| Program Bench | 77.8% | 综合最佳 |
| SWE Marathon | 42.0% | 综合最佳 |
| DeepSearchQA (F1) | 95.0% | — |
架构:2.8T 总参数稀疏 MoE,896 专家激活 16(约 50B 激活参数);Kimi Delta Attention(KDA)+ 100 万 token 上下文 + 原生视觉;完整权重承诺 7/27 放出(撰稿时尚未放出)。
白宫下场指控(7/22–23)
OSTP 主任 Michael Kratsios 指控月之暗面「大规模、隐蔽的产业级蒸馏」窃取 Anthropic Fable 能力,并涉嫌使用未获出口许可的 Nvidia GB300(可能经泰国服务器间接获取)。财政部长 Scott Bessent 附和「在很多中国模型上发现了美国大模型的水印」——但未说明水印具体指什么。Kratsios 未公开证据来源;月之暗面未回应训练质询。
专家反驳:时间线根本不够
「Fable's only been publicly available since July 1st. You can't distill that much data, train a model, and release it in two weeks.」—— Braden Hancock(Laude Institute / Snorkel AI 联合创始人)
「Distillation is becoming less and less impactful... if it were the case, everyone would be easily able to catch up to a GLM or to a K3 by using its data for distillation. But we have not.」—— Nathan Lambert(Allen Institute for AI)
关键逻辑:Fable 5 公开(7/1)到 K3 发布(7/16)仅 两周;Elon Musk 曾在庭审承认 xAI 蒸馏 OpenAI 训练 Grok——「蒸馏」边界在于正常借鉴 vs 隐蔽工业级窃取。
最硬核证据:K3 会「自称是 Claude」
Ryan Greenblatt(Redwood Research 首席科学家,GitHub: rgreenblatt/which_claude_is_k3)7/24 左右发布统计分析:Kimi K3 被问「你是谁」时异常高频自称 Claude,甚至吐出 claude-opus-4-5-20250929、claude-sonnet-4-5-20250929——真 Claude 模型自己都不会这么准确报出内部版本号。
Greenblatt 解读:模型说出教师模型部署元数据比教师自己还准,难用「模仿对话风格」解释,更可能指向训练数据混入带部署元数据标注的 Claude 数据(API 日志或打标合成数据)。K3 信号锁定「Claude 4.5 时代」(2025 年末),K2 指向更早 Sonnet 4——呈现「逐代追新」规律。Greenblatt 强调:不能直接证明蒸馏发生,身份混淆也可能来自数据污染或系统提示泄露。
背景与社区
- 2026 年 2 月:Anthropic 已指控月之暗面/DeepSeek/MiniMax「产业级蒸馏攻击」,称识别出 340 万+ 异常 API 交互
- Reddit r/LocalLLaMA:开源闭源差距缩短到「天」;2.8T 几乎没人本地跑;K3 卖点是低价 + 少拒答而非打败 Fable 5
- 7/27 权重未放出 → 外部无法独立验证 → 舆论持续发酵;芯片出口管制话题再次被提起
05 · 两件事放在一起看:性价比是主战场
Opus 5 用「半价逼近旗舰」回应性价比诉求;Kimi K3 用「开源 + 低价 + 不设限」冲击市场;K3 争议本质是各家在性价比战争里对「低价靠技术优化还是白嫖别人模型」的公开摊牌。建议:先看场景再看立场——合规/数据留存敏感选 Opus 5;极限成本与开源可控等 7/27 权重实测后再决策 K3。
06 · Claude Opus 5 vs Fable 5 决策矩阵
| 维度 | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| 定价(每百万 token) | $5 / $25 | 约 $10 / $50 |
| CursorBench 3.2 峰值 | 与 Fable 5 差 0.5% | 基准 |
| Claude Max 默认 | ✅ 是(7/24 起) | 否 |
| 数据留存 | 默认不强制 | 需接受 30 天留存 |
| 出口管制 | 相对宽松 | 部分用户受限(见封禁解读) |
| 适合谁 | 日常主力、合规敏感、性价比优先 | 极限任务、愿付旗舰价与留存成本 |
07 · 双事件时间线
| 日期 | Opus 5 / Anthropic | Kimi K3 / 争议 |
|---|---|---|
| 2026-02 | — | Anthropic 首次公开指控蒸馏攻击 |
| 2026-06-09 | Fable 5 / Mythos 5 发布 | — |
| 2026-07-01 | Fable 5 公众可用 | — |
| 2026-07-16 | — | Kimi K3 API/产品发布 |
| 2026-07-22/23 | — | 白宫 Kratsios 公开指控 |
| 2026-07-24 | Opus 5 发布,Claude Max 默认 | Greenblatt「K3 自称 Claude」证据 |
| 2026-07-27(计划) | — | K3 完整权重开源 |
08 · Mac 开发者五步隔离验证清单
- 在隔离租用 Mac配置 Claude API(
claude-opus-5)与 Kimi K3 API,各跑 1 次基线 completion,记录 latency 与 token - 对 Opus 5 跑 CursorBench 同类编程任务(或内部 repo 小 patch),与历史 Opus 4.8 / Fable 5 结果对照
- 对 K3 执行 Greenblatt 式身份探针 Prompt(「你是谁?报出版本号」),记录是否出现 Claude 部署 ID 字符串——勿在主力机存敏感日志
- 用 OpenRouter 或自研路由配置 Opus 5 ↔ K3 fallback 链,验证 429/超时切换
- 导出 benchmark 与合规笔记,吊销测试 Key,按清单退租擦除——避免争议窗口期 Key 污染主力 Keychain
09 · 常见问题 FAQ×5
Q: Claude Opus 5 比 Claude Fable 5 便宜多少?
A: Token 单价下 Opus 5 约为 Fable 5 一半($5/$25 vs 约 $10/$50),CursorBench 峰值相差不到 1%。
Q: Claude Opus 5 现在是 Claude Max 的默认模型吗?
A: 是的,7/24 发布当天起为 Claude Max 默认,也是 Claude Pro 最强可用版本。
Q: Kimi K3 真的蒸馏了 Claude 吗?
A: 仍有争议、未最终证实。白宫缺公开证据;专家质疑两周时间线;Greenblatt「K3 自称 Claude + 内部版本号」是目前最强技术间接证据。
Q: Kimi K3 的完整权重什么时候能下载?
A: 官方承诺 2026-07-27;本文发布时尚未放出,外部尚无法完全独立验证。
Q: 为什么 Kimi K3 会自称是 Claude?
A: Greenblatt 统计显示 K3 异常高频自称 Claude 并吐出 claude-opus-4-5-20250929 等 ID,比真 Claude 还准——可能指向带部署元数据标注的训练数据,但不能直接证明蒸馏。
10 · 租用隔离 Mac:在干净环境试跑 Opus 5 与 Kimi K3
虽然你可以在 Windows 或 Linux VPS 上通过 curl 调用 Claude / Kimi API,但 Cursor、Claude Code 与 macOS Keychain 才是多数 Mac 开发者评估多模型 Agent 的真实场景。在主力机上轮换 Anthropic / Moonshot Key、跑 K3 身份探针实验、或在争议窗口期切换 fallback——都会污染 Keychain、留下合规审计隐患,且实验失败难以一键回滚。
Windows 云主机适合纯 API 脚本,但无法完整验证 Cursor + Apple Silicon 工具链;Linux VPS 缺 macOS 原生 IDE。自购 Mac Mini 成本固定,而按天租用隔离 Apple Silicon 节点适合「Opus 5 升级 + K3 争议观察期 1–3 天集中验收」——试跑完毕即销毁,测试 Key 不进主力机。计费见 M 系列 Mac 算力租赁定价。
11 · 权威信源
- Anthropic:Claude Opus 5 官方发布
- Ryan Greenblatt:which_claude_is_k3
- TechCrunch:专家质疑蒸馏时间线(2026-07-23)
- MacDate:Kimi K3 深度评测
- MacDate:OpenRouter API 教程
最后更新:2026 年 7 月 25 日