开源大模型 V4-Flash-0731 2026-08-05

DeepSeek V4 Flash 正式版上线:跑分逼近 Opus 4.8,价格却只要几十分之一

谁遇到什么问题?在 Mac 上用 DeepSeek API 做 Agent 与批量推理的开发者,面对 7 月 31 日 V4-Flash-0731「官方版」上线,不确定是换新模型还是同一架构重训,也不清楚跑分能否横向对比 Claude Code。本文给什么?基于 8 月 5 日发稿时的完整时间线、定价对比表、Harness 框架解读与国产六方混战矩阵。结构包含:三大痛点、核心数据表、后训练拆解、争议标注、五步 Mac 隔离试跑、FAQ×5。

DeepSeek V4 Flash 0731 正式版评测 Agent 跑分 Kimi K3 Qwen3.8 对比 2026

V4 满血版 GA 全景见 DeepSeek V4 满血版正式发布解读;Kimi K3 开源权重见 Kimi K3 全面开源解读;Qwen3.8-Max 见 Qwen3.8-Max 发布解读

7 月 31 日,DeepSeek 将 V4-Flash 升级为官方版:参数不变,仅重新做了一遍后训练。跑分反超更大的 V4-Pro 预览版,价格只要 Claude Opus 4.8 的几十分之一——但旗舰 V4-Pro 官方版,以及 DeepSeek 首次自研的 Agent 框架 Harness,目前仍处于「即将发布」状态,没有确切日期。

01 · 三大决策痛点:「官方版」不等于「新模型」

  1. 命名误导:媒体标题常写「DeepSeek V4 正式版」,实际是同一 284B/13B 架构重新后训练,App 与网页端截至发稿仍未同步,仅 API 公测——容易误判为全端已切换。
  2. 跑分不可横向套娃:Terminal Bench 2.0 等 Agent 跑分全部基于尚未公开发布的 Harness「极简模式」测得,官方 changelog 主动提醒「对 harness 选择极其敏感」——不能直接等同于在 Claude Code / Cursor 里的真实能力。
  3. Pro 与 Harness 空窗期:V4-Pro 官方版仍无确认日期,社区流传的 8 月 10–20 日 GA 窗口未经官方证实;在 Pro 落地前,复杂推理只能继续用预览版或竞品 API,选型存在断层。

02 · 时间线:从 4 月预览到 7 月「官方版」

时间 事件
2026-04-24V4 预览版发布并开源:V4-Pro(1.6T/49B)与 V4-Flash(284B/13B),均支持 100 万 token,MIT 协议
2026-07-24deepseek-chatdeepseek-reasoner 正式停用,流量切换至 V4 系列命名
2026-07-27月之暗面 Kimi K3(2.8T)开源权重上线 Hugging Face,竞争压力陡增
2026-07-31V4-Flash-0731 正式版 API 公测,开源权重同步 Hugging Face;changelog 首次点名 Harness「即将随 V4 正式版发布」;仅限 API
截至 2026-08-05V4-Pro 官方版仍「尽快发布」;8 月 10–20 日 GA 窗口为未经证实的传言

03 · 核心数据一览

模型 状态 总/激活参数 输入价(未命中/命中,$/M) 输出价($/M)
V4-Flash-0731官方正式版284B / 13B$0.14 / $0.0028$0.28
V4-Pro预览版1.6T / 49B$0.435 / $0.003625$0.87
Kimi K3权重开源2.8T / ~104B$3.00 / $0.30$15.00
GLM-5.2开源~744B / ~40B
Qwen3.8-MaxAPI GA(权重待放)2.4T / 95B$2.00 / ~$0.17–0.25$6.00

硬核数据点 #1:按 21 世纪经济报道援引数据,V4-Flash 官方版相对 Claude Opus 4.8,缓存未命中输入约便宜 36 倍,缓存命中输入约便宜 179 倍,输出约便宜 89 倍(厂商标价,非独立审计)。

硬核数据点 #2:Artificial Analysis 独立指数:V4-Flash Intelligence Index 50,单任务平均成本 $0.03;Kimi K3 指数 57、成本 $0.86;Claude Fable 5 成本 $3.15——Flash 打的不是跑分第一,而是「够用智能 + 极致价格」。

硬核数据点 #3:官方技术报告:V4-Pro 在 100 万 token 上下文下,单 token 推理 FLOPs 仅为 V3.2 的 27%,KV Cache 占用仅为 10%(厂商自报,尚未见独立第三方复现)。

04 · 深度拆解:性能是怎么「变出来」的

4.1 架构没有变,变的是后训练

V4-Flash-0731 在参数规模与模型结构上与 4 月预览版完全相同,性能提升「完全来自重新进行的后训练」。284B/13B 的 Flash 在多项 Agent 基准上反而超过 1.6T/49B 的 V4-Pro 预览版——印证 2026 年下半年竞争焦点正从「堆参数」转向「后训练质量」。

4.2 混合注意力:CSA + HCA、mHC、Muon 优化器

技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》描述三处关键改动:

  • 混合注意力:压缩稀疏注意力(CSA)+ 高度压缩注意力(HCA),对外称 DSA 稀疏注意力,降低长上下文计算与显存;
  • 流形约束超连接(mHC):改进传统残差连接;
  • Muon 优化器:替换传统优化器,提升收敛速度与稳定性。

4.3 Harness:自研 Agent 框架首次亮相

7 月 31 日 changelog 首次正式出现 DeepSeek Harness——对标 Claude Code 的自研 Agent 执行框架。官方 Agent 跑分(Terminal Bench 2.0 82.7 vs V4-Pro 预览版 67.9)全部用 Harness「极简模式」、max 档位、top_p=0.95、temperature=1.0 测得。Harness 尚未公开发布,跑分应视为「厂商自报 + 特定框架」结果。

05 · 横向对比:中国开源大模型的「六边形混战」

模型 实验室 Intelligence Index 单任务成本
V4-Flash-0731DeepSeek50$0.03
Kimi K3月之暗面57$0.86
GLM-5.2智谱比 Flash 高约 1 分
GPT-5.6 SolOpenAI比 Flash 高 9+ 分$1.86
Claude Fable 5Anthropic比 Flash 高 9+ 分$3.15

指数与成本引自 Artificial Analysis(第三方),与 DeepSeek 自报 Agent 跑分方法论不同,本文分开列出。V4-Flash 预览版曾在 OpenRouter 连续七周调用量第一——目标用户是需要大规模调用、对绝对智能上限不敏感的 Agent 与批量任务场景。

06 · 争议点:跑分好看,不代表没有水分

  • Harness 依赖:官方自己提醒别只看数字;在 Hugging Face 博主与海外开发者论坛独立复现前,Agent 类跑分应谨慎对待。
  • 可用性问题:21 世纪经济报道援引海外社区反馈,正式版存在输入缓存命中率偏低、安全分类器偶发超时等问题。
  • Pro/Harness 时间未证实:快科技等媒体报道的「内部测试」「8 月 10–20 日 GA」均为未署名消息源,官方原话仅为「将尽快发布」。
  • 融资传闻:多家媒体报道约 74 亿美元融资、487 亿美元估值等,目前主要来自财经媒体「据报道」,尚无官方或监管备案直接确认。

07 · 影响与背景:从「梁白开」到「梁圣」,价格战进入下一轮

Pro 版本迟迟未兑现「7 月中旬全量上线」预期时,中文 AI 社区曾戏称梁文锋为「梁白开」;V4-Flash-0731 超预期后昵称又翻回「梁圣」。更值得留意的是开发者口中的「斩杀线」:DeepSeek 以「够用性能 + 极端低价」给同行设门槛——性能无明显超过、价格又降不下来,就容易失去存在感。这也解释了 GPT-5.6 Luna 一次性降价 80% 等密集调价动作。

7 月 31 日当天英伟达、博通、AMD 等算力股未明显波动——市场似乎已习惯「DeepSeek 式效率突破」,与 2025 年初 R1 发布时引发全球 AI 芯片股下跌形成鲜明对比。

08 · 五步 Mac 隔离试跑:在干净环境验证 V4-Flash-0731

  1. 在隔离 Mac 上克隆测试仓库子集,配置 DeepSeek API Key(勿写入主力机全局 shell)
  2. 将模型 ID 设为 deepseek-v4-flash,对比迁移前后延迟与输出质量
  3. 分别测试非思考模式与思考模式(extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
  4. 用 Kimi K3 / Qwen3.8-Max API 跑同一批 Agent 任务,记录单任务成本与失败率
  5. 验收通过后销毁隔离节点;实验配置不污染主力机 Keychain 与 Cursor 路由
# 验证 V4-Flash-0731 指向新官方版 curl https://api.deepseek.com/chat/completions \ -H "Authorization: Bearer $DEEPSEEK_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"ping"}]}'

09 · 常见问题 FAQ

Q1:DeepSeek V4 和 V3.2 相比最大的区别是什么?
A:原生 100 万 token 上下文,长上下文开销大幅降低;Agent 能力专项优化,适配 Claude Code、OpenCode 等工具。

Q2:日常选 Flash 还是 Pro?
A:大规模低成本调用、批量处理优先 Flash-0731;更深推理可暂用 Pro 预览版,等官方版再评估。

Q3:现在能用 V4 Pro 官方版吗?
A:截至 2026-08-05 不能。仅 Flash-0731 官方版且限 API;8 月 10–20 日为未经证实的传言。

Q4:跑分能直接相信吗?
A:SWE-bench Verified 等第三方基准较可信;Terminal Bench 2.0 等基于未公开 Harness,建议等独立复现。

Q5:对普通开发者有什么影响?
A:已用 OpenAI/Anthropic 格式接入则无需改代码,deepseek-v4-flash 自动指向新官方版;仍用旧名需尽快切换。

10 · 租用 Mac 弹性验证:API 试跑不等于生产就绪

虽然你可以直接在笔记本上改一行 model="deepseek-v4-flash" 完成短期验证,但主力机更适合稳定交付。常见限制包括:多模型路由实验污染 Cursor 全局配置、无法隔离对比 Kimi K3 / Qwen3.8-Max 的 Keychain 凭证、以及 Windows/Linux 上无法完整验证与 Xcode 侧车项目并存的 Agent 场景。若你追求可复现的对比结论、按天计费与真实 Apple Silicon 硬件,隔离 Mac 试跑通常是更优解,租赁能进一步降低「为试模型买机器」的前期投入。计费见 M 系列 Mac 算力租赁定价

11 · 数据来源

  • DeepSeek 官方 API 文档与更新日志(api-docs.deepseek.com)
  • 技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》及 Hugging Face 模型卡
  • Artificial Analysis 第三方评测(经财经媒体转引)
  • 21 世纪经济报道、快科技、V2EX 社区讨论
  • Moonshot AI(Kimi K3)、智谱(GLM-5.2)、阿里云(Qwen3.8-Max)官方发布信息

数据截至 2026 年 8 月 5 日。定价、跑分及 V4-Pro/Harness 上线状态可能随时变化,发布前请核实最新官方信息。