DeepSeek V4 Flash 正式版:架構不變、跑分反超 V4-Pro,價格僅為 Opus 4.8 幾十分之一
誰遇到什麼問題?在 Kimi K3、Qwen3.8-Max 密集發布窗口中,需要判斷 DeepSeek V4-Flash-0731 是否值得遷移 API、以及官方 Agent 跑分能否代表真實生產表現的開發者與 Agent 團隊。本文給什麼?7 月 31 日官方版上線的完整時間軸、定價與規格表、Harness 框架解讀、橫向對照與跑分水分爭議標註。結構包含:三大痛點、核心數據表、架構拆解、六邊形混戰對照、爭議點、斬殺線背景、五步 Mac 隔離試跑、FAQ×5。
📋 本文目錄
V4 系列 GA 與峰谷計費見 DeepSeek V4 滿血版正式發布解讀;Kimi K3 開源全景見 Kimi K3 全面開源權重解讀;Qwen3.8-Max GA 見 阿里 Qwen3.8-Max 正式發布解讀。
7 月 31 日,DeepSeek 將 V4-Flash 升級為官方版(build tag 0731):參數規模與 4 月預覽版完全相同,僅重新做了一遍後訓練,卻在多項 Agent 基準上反超體量更大的 V4-Pro 預覽版;API 定價僅為 Claude Opus 4.8 的幾十分之一。旗艦 V4-Pro 官方版,以及 DeepSeek 首次自研的 Agent 框架 Harness,目前仍處於「即將發布」狀態,沒有確切日期。
01 · 三大決策痛點:為什麼不能只看「V4 正式版上線」標題
- 這不是新模型,而是同一套 284B 架構的重訓:若你以為 7 月 31 日是全新旗艦發布,可能誤判遷移時機;實際變動在後訓練與 API 命名,App/網頁端截至發稿尚未同步,僅 API 公測可用。
- Agent 跑分高度依賴未公開的 Harness 極簡模式:Terminal Bench 2.0 82.7 分(反超 V4-Pro 預覽版 67.9)全部基於自研 Harness 測得,官方 changelog 主動提醒「跑分對 harness 選擇非常敏感」——與 Claude Code、Cursor 等第三方框架下的真實表現未必一致。
- V4-Pro 官方版與 Harness 上線時間仍不確定:媒體流傳 8 月 10–20 日 GA 窗口僅來自未署名消息源;若你的選型卡在「等 Pro 滿血」與「先上 Flash」之間,需以官方「盡快發布」為準,勿把傳言當排期。
02 · 時間軸:從 4 月預覽到 7 月「官方版」
- 2026 年 4 月 24 日:DeepSeek-V4 預覽版首次發布並開源,包含 V4-Pro(1.6T 總參數/49B 激活)與 V4-Flash(284B 總參數/13B 激活),均支援 100 萬 token 上下文,MIT 協定。
- 2026 年 7 月 24 日:舊介面模型名
deepseek-chat與deepseek-reasoner正式停用,全部流量切換到 V4 系列命名。 - 2026 年 7 月 27 日:月之暗面 Kimi K3(2.8T 總參數)開源權重上線 Hugging Face,給 DeepSeek 製造不小競爭壓力。
- 2026 年 7 月 31 日:DeepSeek-V4-Flash-0731 正式版進入 API 公測,開源權重同步上線 Hugging Face;changelog 首次點名自研 Agent 框架「Harness」,稱即將隨 V4 正式版一起發布。此次公測僅限 API,App 與網頁端暫未同步更新。
- 截至 2026 年 8 月 5 日(發稿時):V4-Pro 官方版仍是「盡快發布」,無官方確認日期。部分媒體援引未署名消息源稱內部測試已在 7 月 28 日那週啟動,正式 GA 窗口可能在 8 月 10 日至 20 日之間——此時間點目前未經 DeepSeek 官方證實,僅供參考。
03 · 核心數據一覽
| 模型 | 狀態 | 總參數/激活 | 上下文 | 輸入價(快取未命中/命中,每百萬 token) | 輸出價(每百萬 token) | 協定 |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 官方正式版(07-31) | 284B/13B | 1M | $0.14/$0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | 預覽版(04-24,官方版未發布) | 1.6T/49B | 1M | $0.435/$0.003625 | $0.87 | MIT |
| Kimi K3 | 權重開源(07-27) | 2.8T/激活未公開(社群估算約 104B) | ~1.05M | $3.00/$0.30 | $15.00 | Kimi K3 License |
| GLM-5.2 | 開源(2026 年 6 月) | ~744B/~40B | 1M | 本文未核實 | 本文未核實 | MIT |
| Qwen3.8-Max | API 可用(08-02),權重待放出 | 2.4T/95B | 1M | $2.00/~$0.17–0.25 | $6.00 | 承諾開源,權重尚未放出 |
說明:以上定價均為 DeepSeek、Moonshot、阿里等官方公開數據;DeepSeek 已預告未來將對 API 啟用「高峰時段 2 倍加價」(北京時間 9–12 點、14–18 點),截至發稿未公布具體生效日期。
硬核數據 #1:V4-Flash-0731 輸入快取命中僅 $0.0028/百萬 token,輸出 $0.28/百萬 token,約為 Claude Opus 4.8 的幾十分之一。
硬核數據 #2:Terminal Bench 2.0 官方自報 82.7 分,反超 V4-Pro 預覽版 67.9 分(均基於 Harness 極簡模式)。
硬核數據 #3:Artificial Analysis Intelligence Index 給 V4-Flash 50 分、單任務平均成本 $0.03——智能分非最高,但成本約為 Kimi K3 的 1/29。
04 · 深度拆解:效能是怎麼「變出來」的
4.1 架構沒變,變的是後訓練
V4-Flash-0731 在參數規模、模型結構上與 4 月預覽版完全相同,DeepSeek 官方明確說明效能提升「完全來自重新進行的後訓練」,而非擴大模型規模。284B 總參數、13B 激活的 Flash 版本,在多項 Agent 基準上反而超過參數量是自己好幾倍的 V4-Pro 預覽版——印證 2026 年下半年大模型競爭中,後訓練數據品質與方法的重要性正逼近甚至超過單純堆參數。
4.2 混合注意力:CSA+HCA、mHC、Muon 優化器
依 DeepSeek 技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列架構有三處關鍵改動:
- 混合注意力架構:結合壓縮稀疏注意力(CSA)與高度壓縮注意力(HCA),對外統稱「DSA 稀疏注意力」,核心目的是在長上下文場景降低計算與記憶體開銷;
- 流形約束超連接(mHC):對傳統殘差連接結構改進;
- Muon 優化器:替換傳統優化器,提升訓練收斂速度與穩定性。
三項改動疊加:在 100 萬 token 上下文下,V4-Pro 相較前代 V3.2,單 token 推論所需 FLOPs 僅為 27%,KV Cache 占用僅為 10%(DeepSeek 官方技術指標,尚未見獨立第三方複現驗證)。若基本屬實,百萬級上下文有望以接近主流上下文長度的成本大規模商用。
4.3 自研 Agent 框架 Harness 首次亮相
7 月 31 日 changelog 首次正式出現「DeepSeek Harness」——自研 Agent 執行框架,用於讓模型讀寫檔案、呼叫工具、執行命令、完成端到端工程任務,對標 Claude Code。此前 DeepSeek 模型主要依賴 Claude Code、OpenCode 等第三方 Agent 工具。官方公開的 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部是用 Harness「極簡模式」(minimal mode)測出來的;changelog 主動提示:「跑分對 harness 選擇非常敏感,不能簡單等同於模型本身能力的提升」。
05 · 橫向對照:中國開源大模型的「六邊形混戰」
| 模型 | 實驗室 | 發布/權重時間 | 總參數 | AA Intelligence Index | 單任務平均成本(AA) |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 2026-07-31(官方版) | 284B | 50 | $0.03 |
| Kimi K3 | 月之暗面 | 07-16 預覽/07-27 權重 | 2.8T | 57 | $0.86 |
| GLM-5.2 | 智譜/Z.ai | 2026 年 6 月 | ~744B | 比 V4-Flash 高約 1 分 | 本文未核實 |
| Qwen3.8-Max | 阿里 | 08-02 GA(權重待放出) | 2.4T | 本文未核實 | 本文未核實 |
| GPT-5.6 Sol | OpenAI | 閉源 | 未公開 | 比 V4-Flash 高 9 分以上 | $1.86 |
| Claude Fable 5 | Anthropic | 閉源 | 未公開 | 比 V4-Flash 高 9 分以上 | $3.15 |
資料來源:Intelligence Index 與單任務成本引自 Artificial Analysis(第三方獨立評測),經財經媒體轉引;DeepSeek 官方跑分為廠商自報,兩組數據評測方法與權重不完全一致,本文分開列出。
反差明顯:在 Artificial Analysis 第三方綜合指數上,V4-Flash 智能分並非最高,甚至落後 Kimi K3 與 GLM-5.2;但單任務成本僅為 Kimi K3 的約 1/29、GPT-5.6 Sol 的約 1/62、Claude Fable 5 的約 1/105。DeepSeek 打的不是「跑分第一」,而是「夠用的智能 + 極致的價格」——這也解釋 V4-Flash 預覽版曾在 OpenRouter 連續七週穩坐呼叫量第一。
06 · 爭議點:跑分好看,不代表沒有水分
- 跑分方法依賴 Harness,官方自己都在提醒別只看數字:V4-Flash-0731 公布的 Agent 類跑分(Terminal Bench 2.0 82.7 分)全部基於自研且尚未公開的 Harness 極簡模式,參數為 max 檔位、top_p=0.95、temperature=1.0。在獨立社群複現之前,應視為「廠商自報+特定框架」結果。
- 海外開發者回報具體可用性問題:據 21 世紀經濟報導援引海外開發者社群回饋,V4-Flash 正式版存在輸入快取命中率偏低、安全分類器偶發逾時等問題,反映算力與參數儲備仍是限制模型能力上限的現實瓶頸。
- V4-Pro 官方版與 Harness 上線時間未經證實:多家中文媒體報導「內部測試」與「8 月 10–20 日 GA」等窗口,均為未署名消息源或社群傳言;官方 changelog 原話僅「將盡快發布」,讀者應以此為準。
- 企業融資與 IPO 傳聞需謹慎對待:多家媒體報導 DeepSeek 近期完成約 74 億美元融資、估值約 487 億美元等消息,目前主要來自「據報導」「消息人士稱」,尚無 DeepSeek 官方或監管備案文件直接確認,本文作背景資訊呈現,不作已核實事實處理。
07 · 影響與背景:從「梁白開」到「梁聖」,斬殺線進入下一輪
在 V4 正式版發布前,因 Pro 版本遲遲未兌現「7 月中旬全量上線」預期,中文 AI 社群一度把創辦人梁文鋒戲稱為「梁白開」。V4-Flash-0731 上線後實際表現超出預期,網友又把「梁聖」稱號還了回去——戲謔式暱稱反轉,本身就是觀察中國 AI 社群情緒的有趣側面。
更值得關注的是中文開發者社群流傳的「斬殺線」:DeepSeek 憑「夠用的效能 + 極端低價」給同行設下門檻——友商模型若效能沒有明顯超過 DeepSeek,又拿不出更低價格,就可能在市場上失去存在感。這也解釋近期部分友商(如有報導提到 GPT-5.6 Luna 低價版一次性降價 80%)為何密集調整定價。一位 AI 創業孵化人士對 21 世紀經濟報導的評價頗為形象:「所有大模型公司都在梁文鋒前面奔跑,不管用什麼方式,都必須跑到 DeepSeek 前面才能生存。」
從更大產業背景看,V4-Flash 正式版上線當天(7 月 31 日),英偉達、博通、AMD 等算力晶片股並未出現明顯波動——市場似乎已習慣「DeepSeek 式效率突破」敘事,不再簡單把「用更少算力做到同等效果」等同於「利空算力股」。這與 2025 年初 DeepSeek-R1 發布時引發全球 AI 晶片股集體下跌形成鮮明對比。
08 · 五步 Mac 隔離試跑(V4-Flash API 與 Agent 工具鏈驗收)
- 在 DeepSeek 控制台取得 API Key,用 OpenAI 相容 SDK 以
deepseek-v4-flash跑通基線任務(長文件摘要/修 bug/多檔案重構各 1 個),記錄快取命中與未命中帳單差異 - 在隔離環境設定
OPENAI_BASE_URL=https://api.deepseek.com,接入 Claude Code/OpenCode/Cursor,避免 API Key 寫入主力機全域 shell 或 Keychain - 對照 Kimi K3 與 Qwen3.8-Max 跑同一組 Agent 任務,記錄 $/task 與成功率
- 關注 Hugging Face 上
deepseek-ai/DeepSeek-V4-Flash0731 權重與 Harness 公開時間;權重落地後再評估本地 Ollama/vLLM 部署可行性與記憶體需求 - 結合 V4 GA 定價與峰谷計費解讀,輸出團隊選型文件並設定 V4-Pro/Harness 正式上線後的複測節點
09 · 常見問題 FAQ
Q1:DeepSeek V4 和之前的 V3.2 相比,最大的差別是什麼?
A:最直接差別是原生支援 100 萬 token 上下文,且長上下文場景下計算與記憶體開銷大幅降低(官方數據:V4-Pro 在百萬 token 上下文下所需 FLOPs 僅為 V3.2 的 27%,KV Cache 僅為 10%)。此外 V4 系列在 Agent 能力上做了專項優化,適配 Claude Code、OpenCode 等主流 Agent 工具。
Q2:日常使用應該選 V4 Flash 還是 V4 Pro?
A:若只是普通對話、簡單任務或需要大規模、低成本呼叫,目前的 V4-Flash-0731 官方版性價比更高,且 Agent 跑分已反超 V4-Pro 預覽版。若任務涉及更深世界知識或複雜推理且預算不敏感,可先用 V4-Pro 預覽版,等官方版上線後再評估。
Q3:現在能用上 V4 Pro 官方版嗎?
A:截至本文發稿(2026 年 8 月 5 日)還不能。目前上線的官方版只有 V4-Flash-0731,且僅限 API 呼叫,App 與網頁端仍是舊版本。V4-Pro 官方版與 Harness 官方口徑是「盡快發布」,網上「8 月 10–20 日」等時間未經證實。
Q4:DeepSeek 公布的跑分能直接相信嗎?
A:建議區分對待。SWE-bench Verified 等第三方基準可信度相對較高;Terminal Bench 2.0 等 Agent 跑分用自研且未公開的 Harness 測得,官方也提示對框架選擇高度敏感,建議等社群用 Claude Code、Cursor 等獨立複現後再下結論。
Q5:這次更新對一般開發者有什麼實際影響?
A:若用 OpenAI 或 Anthropic 格式 API 接入 DeepSeek,不需改程式碼,deepseek-v4-flash 會自動指向新官方版。若此前用已停用的 deepseek-chat/deepseek-reasoner,需盡快切換,官方已在 7 月 24 日停用舊名稱。
10 · 租用 Mac 彈性驗證:在主力機外完成 V4-Flash Agent 對照試跑
DeepSeek V4-Flash API 雖已透過 OpenAI 相容端點降低遷移成本,但在主力開發機上直接切換 Agent 工具鏈仍有風險:API Key 污染全域環境、百萬 token 長上下文實驗占用本地快取、與 Claude Code/Cursor 並存的設定衝突難以回滾。Windows 或 Linux 使用者雖可呼叫雲端 API,但無法完整驗證與 macOS 原生 Xcode、Keychain 並存的 Agent 工作流程。
雖然你可以直接在筆電上接入 V4-Flash API 完成短期驗證,主力機更適合穩定交付;若在 Windows 或老舊 Intel Mac 上遠端試水,常見風險包括延遲誤判、無法完整驗證憑證鏈與本地 Ollama 並存場景。若你追求按天計費、隔離環境、真實 Apple Silicon 硬體且不願為「試模型」專門買機器,MacDate 按天彈性租用讓你在 Harness 正式公開前低成本完成 V4-Flash 與 Kimi K3、Qwen3.8-Max 的 Agent 對照實驗。計費見 裸機 macOS 定價。
短期用雲端 API 完成選型驗證完全合理;若你需要可複現的 Agent 環境、完整 Apple 生態相容與更低的 Key 外洩風險,直接租用 Mac mini M4 通常是更優解,按天租賃能進一步降低前期投入與選型失誤成本。
11 · 資料來源
- DeepSeek 官方 API 文件與更新日誌(api-docs.deepseek.com)
- DeepSeek-V4 技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》及 Hugging Face 模型卡(deepseek-ai/DeepSeek-V4-Pro、DeepSeek-V4-Flash)
- Artificial Analysis 第三方模型評測數據(經旺得富理財網、Meyka 等財經媒體轉引)
- 21 世紀經濟報導《DeepSeek 又發重磅更新 行業夢回 2025 年春天》
- 快科技(鳳凰網科技轉載)《DeepSeek V4 正式版有多強》
- V2EX 社群討論帖《最新的 deepseek-v4-flash 正式版真的有這麼強嗎?》
- 36 氪歐洲版、HTX Insights 相關報導
- Moonshot AI(Kimi K3)、智譜/Z.ai(GLM-5.2)、阿里雲(Qwen3.8-Max)官方發布資訊
發布前請務必核實最新定價、跑分及 V4-Pro/Harness 上線狀態,本文所有數據截至 2026 年 8 月 5 日,AI 產業資訊更新極快,具體細節可能已發生變化。