國產大模型 V4-Flash 0731 官方版 2026-08-05

DeepSeek V4 Flash 正式版:架構不變、跑分反超 V4-Pro,價格僅為 Opus 4.8 幾十分之一

誰遇到什麼問題?在 Kimi K3、Qwen3.8-Max 密集發布窗口中,需要判斷 DeepSeek V4-Flash-0731 是否值得遷移 API、以及官方 Agent 跑分能否代表真實生產表現的開發者與 Agent 團隊。本文給什麼?7 月 31 日官方版上線的完整時間軸、定價與規格表、Harness 框架解讀、橫向對照與跑分水分爭議標註。結構包含:三大痛點、核心數據表、架構拆解、六邊形混戰對照、爭議點、斬殺線背景、五步 Mac 隔離試跑、FAQ×5。

DeepSeek V4 Flash 0731 官方版 Agent 跑分與定價對照

V4 系列 GA 與峰谷計費見 DeepSeek V4 滿血版正式發布解讀;Kimi K3 開源全景見 Kimi K3 全面開源權重解讀;Qwen3.8-Max GA 見 阿里 Qwen3.8-Max 正式發布解讀

7 月 31 日,DeepSeek 將 V4-Flash 升級為官方版(build tag 0731):參數規模與 4 月預覽版完全相同,僅重新做了一遍後訓練,卻在多項 Agent 基準上反超體量更大的 V4-Pro 預覽版;API 定價僅為 Claude Opus 4.8 的幾十分之一。旗艦 V4-Pro 官方版,以及 DeepSeek 首次自研的 Agent 框架 Harness,目前仍處於「即將發布」狀態,沒有確切日期。

01 · 三大決策痛點:為什麼不能只看「V4 正式版上線」標題

  1. 這不是新模型,而是同一套 284B 架構的重訓:若你以為 7 月 31 日是全新旗艦發布,可能誤判遷移時機;實際變動在後訓練與 API 命名,App/網頁端截至發稿尚未同步,僅 API 公測可用。
  2. Agent 跑分高度依賴未公開的 Harness 極簡模式:Terminal Bench 2.0 82.7 分(反超 V4-Pro 預覽版 67.9)全部基於自研 Harness 測得,官方 changelog 主動提醒「跑分對 harness 選擇非常敏感」——與 Claude Code、Cursor 等第三方框架下的真實表現未必一致。
  3. V4-Pro 官方版與 Harness 上線時間仍不確定:媒體流傳 8 月 10–20 日 GA 窗口僅來自未署名消息源;若你的選型卡在「等 Pro 滿血」與「先上 Flash」之間,需以官方「盡快發布」為準,勿把傳言當排期。

02 · 時間軸:從 4 月預覽到 7 月「官方版」

  • 2026 年 4 月 24 日:DeepSeek-V4 預覽版首次發布並開源,包含 V4-Pro(1.6T 總參數/49B 激活)與 V4-Flash(284B 總參數/13B 激活),均支援 100 萬 token 上下文,MIT 協定。
  • 2026 年 7 月 24 日:舊介面模型名 deepseek-chatdeepseek-reasoner 正式停用,全部流量切換到 V4 系列命名。
  • 2026 年 7 月 27 日:月之暗面 Kimi K3(2.8T 總參數)開源權重上線 Hugging Face,給 DeepSeek 製造不小競爭壓力。
  • 2026 年 7 月 31 日:DeepSeek-V4-Flash-0731 正式版進入 API 公測,開源權重同步上線 Hugging Face;changelog 首次點名自研 Agent 框架「Harness」,稱即將隨 V4 正式版一起發布。此次公測僅限 API,App 與網頁端暫未同步更新。
  • 截至 2026 年 8 月 5 日(發稿時):V4-Pro 官方版仍是「盡快發布」,無官方確認日期。部分媒體援引未署名消息源稱內部測試已在 7 月 28 日那週啟動,正式 GA 窗口可能在 8 月 10 日至 20 日之間——此時間點目前未經 DeepSeek 官方證實,僅供參考

03 · 核心數據一覽

模型 狀態 總參數/激活 上下文 輸入價(快取未命中/命中,每百萬 token) 輸出價(每百萬 token) 協定
DeepSeek-V4-Flash-0731官方正式版(07-31)284B/13B1M$0.14/$0.0028$0.28MIT
DeepSeek-V4-Pro預覽版(04-24,官方版未發布)1.6T/49B1M$0.435/$0.003625$0.87MIT
Kimi K3權重開源(07-27)2.8T/激活未公開(社群估算約 104B)~1.05M$3.00/$0.30$15.00Kimi K3 License
GLM-5.2開源(2026 年 6 月)~744B/~40B1M本文未核實本文未核實MIT
Qwen3.8-MaxAPI 可用(08-02),權重待放出2.4T/95B1M$2.00/~$0.17–0.25$6.00承諾開源,權重尚未放出

說明:以上定價均為 DeepSeek、Moonshot、阿里等官方公開數據;DeepSeek 已預告未來將對 API 啟用「高峰時段 2 倍加價」(北京時間 9–12 點、14–18 點),截至發稿未公布具體生效日期。

硬核數據 #1:V4-Flash-0731 輸入快取命中僅 $0.0028/百萬 token,輸出 $0.28/百萬 token,約為 Claude Opus 4.8 的幾十分之一。

硬核數據 #2:Terminal Bench 2.0 官方自報 82.7 分,反超 V4-Pro 預覽版 67.9 分(均基於 Harness 極簡模式)。

硬核數據 #3:Artificial Analysis Intelligence Index 給 V4-Flash 50 分、單任務平均成本 $0.03——智能分非最高,但成本約為 Kimi K3 的 1/29。

04 · 深度拆解:效能是怎麼「變出來」的

4.1 架構沒變,變的是後訓練

V4-Flash-0731 在參數規模、模型結構上與 4 月預覽版完全相同,DeepSeek 官方明確說明效能提升「完全來自重新進行的後訓練」,而非擴大模型規模。284B 總參數、13B 激活的 Flash 版本,在多項 Agent 基準上反而超過參數量是自己好幾倍的 V4-Pro 預覽版——印證 2026 年下半年大模型競爭中,後訓練數據品質與方法的重要性正逼近甚至超過單純堆參數。

4.2 混合注意力:CSA+HCA、mHC、Muon 優化器

依 DeepSeek 技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列架構有三處關鍵改動:

  • 混合注意力架構:結合壓縮稀疏注意力(CSA)與高度壓縮注意力(HCA),對外統稱「DSA 稀疏注意力」,核心目的是在長上下文場景降低計算與記憶體開銷;
  • 流形約束超連接(mHC):對傳統殘差連接結構改進;
  • Muon 優化器:替換傳統優化器,提升訓練收斂速度與穩定性。

三項改動疊加:在 100 萬 token 上下文下,V4-Pro 相較前代 V3.2,單 token 推論所需 FLOPs 僅為 27%,KV Cache 占用僅為 10%(DeepSeek 官方技術指標,尚未見獨立第三方複現驗證)。若基本屬實,百萬級上下文有望以接近主流上下文長度的成本大規模商用。

4.3 自研 Agent 框架 Harness 首次亮相

7 月 31 日 changelog 首次正式出現「DeepSeek Harness」——自研 Agent 執行框架,用於讓模型讀寫檔案、呼叫工具、執行命令、完成端到端工程任務,對標 Claude Code。此前 DeepSeek 模型主要依賴 Claude Code、OpenCode 等第三方 Agent 工具。官方公開的 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部是用 Harness「極簡模式」(minimal mode)測出來的;changelog 主動提示:「跑分對 harness 選擇非常敏感,不能簡單等同於模型本身能力的提升」。

05 · 橫向對照:中國開源大模型的「六邊形混戰」

模型 實驗室 發布/權重時間 總參數 AA Intelligence Index 單任務平均成本(AA)
DeepSeek-V4-Flash-0731DeepSeek2026-07-31(官方版)284B50$0.03
Kimi K3月之暗面07-16 預覽/07-27 權重2.8T57$0.86
GLM-5.2智譜/Z.ai2026 年 6 月~744B比 V4-Flash 高約 1 分本文未核實
Qwen3.8-Max阿里08-02 GA(權重待放出)2.4T本文未核實本文未核實
GPT-5.6 SolOpenAI閉源未公開比 V4-Flash 高 9 分以上$1.86
Claude Fable 5Anthropic閉源未公開比 V4-Flash 高 9 分以上$3.15

資料來源:Intelligence Index 與單任務成本引自 Artificial Analysis(第三方獨立評測),經財經媒體轉引;DeepSeek 官方跑分為廠商自報,兩組數據評測方法與權重不完全一致,本文分開列出。

反差明顯:在 Artificial Analysis 第三方綜合指數上,V4-Flash 智能分並非最高,甚至落後 Kimi K3 與 GLM-5.2;但單任務成本僅為 Kimi K3 的約 1/29、GPT-5.6 Sol 的約 1/62、Claude Fable 5 的約 1/105。DeepSeek 打的不是「跑分第一」,而是「夠用的智能 + 極致的價格」——這也解釋 V4-Flash 預覽版曾在 OpenRouter 連續七週穩坐呼叫量第一。

06 · 爭議點:跑分好看,不代表沒有水分

  • 跑分方法依賴 Harness,官方自己都在提醒別只看數字:V4-Flash-0731 公布的 Agent 類跑分(Terminal Bench 2.0 82.7 分)全部基於自研且尚未公開的 Harness 極簡模式,參數為 max 檔位、top_p=0.95、temperature=1.0。在獨立社群複現之前,應視為「廠商自報+特定框架」結果。
  • 海外開發者回報具體可用性問題:據 21 世紀經濟報導援引海外開發者社群回饋,V4-Flash 正式版存在輸入快取命中率偏低、安全分類器偶發逾時等問題,反映算力與參數儲備仍是限制模型能力上限的現實瓶頸。
  • V4-Pro 官方版與 Harness 上線時間未經證實:多家中文媒體報導「內部測試」與「8 月 10–20 日 GA」等窗口,均為未署名消息源或社群傳言;官方 changelog 原話僅「將盡快發布」,讀者應以此為準。
  • 企業融資與 IPO 傳聞需謹慎對待:多家媒體報導 DeepSeek 近期完成約 74 億美元融資、估值約 487 億美元等消息,目前主要來自「據報導」「消息人士稱」,尚無 DeepSeek 官方或監管備案文件直接確認,本文作背景資訊呈現,不作已核實事實處理。

07 · 影響與背景:從「梁白開」到「梁聖」,斬殺線進入下一輪

在 V4 正式版發布前,因 Pro 版本遲遲未兌現「7 月中旬全量上線」預期,中文 AI 社群一度把創辦人梁文鋒戲稱為「梁白開」。V4-Flash-0731 上線後實際表現超出預期,網友又把「梁聖」稱號還了回去——戲謔式暱稱反轉,本身就是觀察中國 AI 社群情緒的有趣側面。

更值得關注的是中文開發者社群流傳的「斬殺線」:DeepSeek 憑「夠用的效能 + 極端低價」給同行設下門檻——友商模型若效能沒有明顯超過 DeepSeek,又拿不出更低價格,就可能在市場上失去存在感。這也解釋近期部分友商(如有報導提到 GPT-5.6 Luna 低價版一次性降價 80%)為何密集調整定價。一位 AI 創業孵化人士對 21 世紀經濟報導的評價頗為形象:「所有大模型公司都在梁文鋒前面奔跑,不管用什麼方式,都必須跑到 DeepSeek 前面才能生存。」

從更大產業背景看,V4-Flash 正式版上線當天(7 月 31 日),英偉達、博通、AMD 等算力晶片股並未出現明顯波動——市場似乎已習慣「DeepSeek 式效率突破」敘事,不再簡單把「用更少算力做到同等效果」等同於「利空算力股」。這與 2025 年初 DeepSeek-R1 發布時引發全球 AI 晶片股集體下跌形成鮮明對比。

08 · 五步 Mac 隔離試跑(V4-Flash API 與 Agent 工具鏈驗收)

  1. 在 DeepSeek 控制台取得 API Key,用 OpenAI 相容 SDK 以 deepseek-v4-flash 跑通基線任務(長文件摘要/修 bug/多檔案重構各 1 個),記錄快取命中與未命中帳單差異
  2. 在隔離環境設定 OPENAI_BASE_URL=https://api.deepseek.com,接入 Claude Code/OpenCode/Cursor,避免 API Key 寫入主力機全域 shell 或 Keychain
  3. 對照 Kimi K3Qwen3.8-Max 跑同一組 Agent 任務,記錄 $/task 與成功率
  4. 關注 Hugging Face 上 deepseek-ai/DeepSeek-V4-Flash 0731 權重與 Harness 公開時間;權重落地後再評估本地 Ollama/vLLM 部署可行性與記憶體需求
  5. 結合 V4 GA 定價與峰谷計費解讀,輸出團隊選型文件並設定 V4-Pro/Harness 正式上線後的複測節點
# OpenAI 相容介面試跑 V4-Flash-0731(隔離環境) export OPENAI_API_KEY="your-deepseek-api-key" export OPENAI_BASE_URL="https://api.deepseek.com" curl https://api.deepseek.com/chat/completions \ -H "Content-Type: application/json" \ -d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"Summarize V4-Flash-0731 GA on July 31, 2026."}]}'

09 · 常見問題 FAQ

Q1:DeepSeek V4 和之前的 V3.2 相比,最大的差別是什麼?
A:最直接差別是原生支援 100 萬 token 上下文,且長上下文場景下計算與記憶體開銷大幅降低(官方數據:V4-Pro 在百萬 token 上下文下所需 FLOPs 僅為 V3.2 的 27%,KV Cache 僅為 10%)。此外 V4 系列在 Agent 能力上做了專項優化,適配 Claude Code、OpenCode 等主流 Agent 工具。

Q2:日常使用應該選 V4 Flash 還是 V4 Pro?
A:若只是普通對話、簡單任務或需要大規模、低成本呼叫,目前的 V4-Flash-0731 官方版性價比更高,且 Agent 跑分已反超 V4-Pro 預覽版。若任務涉及更深世界知識或複雜推理且預算不敏感,可先用 V4-Pro 預覽版,等官方版上線後再評估。

Q3:現在能用上 V4 Pro 官方版嗎?
A:截至本文發稿(2026 年 8 月 5 日)還不能。目前上線的官方版只有 V4-Flash-0731,且僅限 API 呼叫,App 與網頁端仍是舊版本。V4-Pro 官方版與 Harness 官方口徑是「盡快發布」,網上「8 月 10–20 日」等時間未經證實。

Q4:DeepSeek 公布的跑分能直接相信嗎?
A:建議區分對待。SWE-bench Verified 等第三方基準可信度相對較高;Terminal Bench 2.0 等 Agent 跑分用自研且未公開的 Harness 測得,官方也提示對框架選擇高度敏感,建議等社群用 Claude Code、Cursor 等獨立複現後再下結論。

Q5:這次更新對一般開發者有什麼實際影響?
A:若用 OpenAI 或 Anthropic 格式 API 接入 DeepSeek,不需改程式碼,deepseek-v4-flash 會自動指向新官方版。若此前用已停用的 deepseek-chatdeepseek-reasoner,需盡快切換,官方已在 7 月 24 日停用舊名稱。

10 · 租用 Mac 彈性驗證:在主力機外完成 V4-Flash Agent 對照試跑

DeepSeek V4-Flash API 雖已透過 OpenAI 相容端點降低遷移成本,但在主力開發機上直接切換 Agent 工具鏈仍有風險:API Key 污染全域環境、百萬 token 長上下文實驗占用本地快取、與 Claude Code/Cursor 並存的設定衝突難以回滾。Windows 或 Linux 使用者雖可呼叫雲端 API,但無法完整驗證與 macOS 原生 Xcode、Keychain 並存的 Agent 工作流程。

雖然你可以直接在筆電上接入 V4-Flash API 完成短期驗證,主力機更適合穩定交付;若在 Windows 或老舊 Intel Mac 上遠端試水,常見風險包括延遲誤判、無法完整驗證憑證鏈與本地 Ollama 並存場景。若你追求按天計費、隔離環境、真實 Apple Silicon 硬體且不願為「試模型」專門買機器,MacDate 按天彈性租用讓你在 Harness 正式公開前低成本完成 V4-Flash 與 Kimi K3、Qwen3.8-Max 的 Agent 對照實驗。計費見 裸機 macOS 定價

短期用雲端 API 完成選型驗證完全合理;若你需要可複現的 Agent 環境、完整 Apple 生態相容與更低的 Key 外洩風險,直接租用 Mac mini M4 通常是更優解,按天租賃能進一步降低前期投入與選型失誤成本。

11 · 資料來源

  • DeepSeek 官方 API 文件與更新日誌(api-docs.deepseek.com)
  • DeepSeek-V4 技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》及 Hugging Face 模型卡(deepseek-ai/DeepSeek-V4-Pro、DeepSeek-V4-Flash)
  • Artificial Analysis 第三方模型評測數據(經旺得富理財網、Meyka 等財經媒體轉引)
  • 21 世紀經濟報導《DeepSeek 又發重磅更新 行業夢回 2025 年春天》
  • 快科技(鳳凰網科技轉載)《DeepSeek V4 正式版有多強》
  • V2EX 社群討論帖《最新的 deepseek-v4-flash 正式版真的有這麼強嗎?》
  • 36 氪歐洲版、HTX Insights 相關報導
  • Moonshot AI(Kimi K3)、智譜/Z.ai(GLM-5.2)、阿里雲(Qwen3.8-Max)官方發布資訊

發布前請務必核實最新定價、跑分及 V4-Pro/Harness 上線狀態,本文所有數據截至 2026 年 8 月 5 日,AI 產業資訊更新極快,具體細節可能已發生變化。