開源大模型 DeepSeek V4 GA 2026-07-20

DeepSeek V4 GA 正式版上線:峰谷計費、1.6T 架構與 GPT-5.6 橫向評估

誰該讀?在 Mac 上以 deepseek-chat / reasoner 做程式開發與 Agent 的台港工程師,面對 7 月 20 日 GA 上線與 7 月 24 日舊介面下線,需要明確遷移路徑與成本模型。你會得到什麼?時間軸、CSA/HCA/mHC 架構拆解、benchmark 對照表、峰谷價目、六步遷移清單與選型矩陣。結構包含:規格表、定價表、程式碼範例、FAQ×6 與隔離 Mac 驗收建議。

DeepSeek V4 GA 正式版 峰谷計費 架構 benchmark GPT-5.6 對比 2026

橫向對比見 GPT-5.6 Sol 發布解析;本機推理可參考 DeepSeek V4-Flash Mac 本機推理;降價背景見 2026 AI 降價全攻略

經過三個月預覽期,DeepSeek V4 GA 正式版於 2026 年 7 月 20 日全面上線。相較 4 月預覽版,這次 GA 不僅強化了 Agent、數學與程式碼能力,更首次導入峰谷差異化計費——標誌 DeepSeek 從「近乎免費試用」邁向有紀律的商業化營運。以下從架構、benchmark、定價、與 GPT-5.6 / Claude Fable 5 橫向對比,以及7 月 24 日 API 遷移五個面向,為台港開發者整理決策所需資訊。

01 · 三大遷移痛點:GA 上線不等於零成本換模

  1. 7 月 24 日硬截止:舊模型名 deepseek-chatdeepseek-reasoner 將於台北時間 7 月 24 日 23:59 永久下線。生產環境若仍硬編碼舊 ID,週末一過服務直接中斷——這是硬切,不是灰度。
  2. 峰谷計費帳單盲區:GA 版在工作日 09:00–12:00、14:00–18:00(北京時間)費率翻倍。Agent 長任務若在高峰批次執行,月帳單可能較預覽期翻倍,而團隊往往未安排 cron 排程與快取分層。
  3. Pro vs Flash 選型混亂:reasoner 可遷 Flash 思考模式或升級 Pro,但 Think Max 需 384K+ 上下文;全量升 Pro 抬升成本,全量降 Flash 又可能犧牲 SWE-bench 級程式碼品質——需按場景分流而非一刀切。

02 · 時間軸回顧:從預覽版到 GA

時間 事件
2026 年 4 月 24 日V4 預覽版上線並開源(MIT),含 V4-Pro(1.6T)與 V4-Flash(284B)
2026 年 5 月V4-Flash 與 V4-Pro 生產調優版上線,API 正式可用
2026 年 6 月V4-Pro 輸出價永久降 75%($0.87/M tokens),進入高 CP 值區間
2026 年 6 月 29 日DeepSeek 向 API 用戶發信,宣布 GA 將於 7 月中旬上線,並首次披露峰谷計費
2026 年 7 月 19 日部分開發者取得 GA 灰度資格,媒體報導「正式版最快隔日發布」
2026 年 7 月 20 日GA 正式版上線(本文發布日)
2026 年 7 月 24 日舊介面名 deepseek-chatdeepseek-reasoner 永久下線

一句話:預覽版已夠強,GA 是在此基礎上針對 Agent、推理與程式碼做專項提升,並配套正式商業計費體系。

03 · 技術架構深度解析

3.1 模型家族:V4-Pro vs V4-Flash

規格 V4-Pro V4-Flash
總參數量1.6 兆(1.6T)2840 億(284B)
每 Token 啟用參數490 億(49B)130 億(13B)
Transformer 層數61 層43 層
上下文視窗1,000,000 tokens1,000,000 tokens
最大輸出384K tokens384K tokens
精度FP4(專家權重)+ FP8(其餘)FP4 + FP8 混合
預訓練資料量33T+ tokens32T+ tokens
開源協議MITMIT

3.2 CSA + HCA 混合注意力

傳統 Transformer 的 KV Cache 記憶體隨上下文線性成長,百萬 token 幾乎不可行。DeepSeek V4 捨棄 V2/V3 的 MLA,改採兩種新注意力機制的混合:

壓縮稀疏注意力(CSA,Compressed Sparse Attention)

  • 以 Softmax 門控池化將 KV 序列壓縮 4 倍
  • FP4 精度「閃電索引器」(Lightning Indexer)做 top-k 稀疏選擇(Pro 選 top-1024,Flash 選 top-512)
  • 保留最近 128 個 token 的滑動視窗
  • 1M 上下文下,推理 FLOPs 僅為 DeepSeek V3.2 的 27%

重度壓縮注意力(HCA,Heavily Compressed Attention)

  • 將 token 壓縮 128 倍後做全域密集注意力
  • 捕捉長程依賴,與 CSA 互補
  • V4-Flash 前 2 層用 HCA,之後 CSA/HCA 交替;V4-Pro 結構類似

硬核數據 #1:1M token 場景下,KV Cache 記憶體僅為 V3.2 的 10%(Flash 低至 7%)。同等硬體可服務更長上下文,伺服器成本大幅下降。

3.3 流形約束超連接(mHC)

升級傳統殘差連接。標準 Transformer 用 x = x + f(x),極深網路易梯度退化。mHC 引入 4 通道殘差流,以滿足雙隨機矩陣約束(Birkhoff 多面體)的混合矩陣穩定傳遞 61 層訊號,同時保留表達力。更深、更穩

3.4 Muon 優化器

訓練採 Muon(非 AdamW),以牛頓-舒爾茨正交化處理梯度,步長更有依據,收斂更快、更穩定。

3.5 三種推理模式

模式 特點 適用場景
Non-think無思維鏈,極速回應簡單問答、路由分發
Think High顯式推理(<redacted_thinking> 標籤)中等複雜任務、程式除錯
Think Max最大推理力度,需 384K+ 上下文複雜數學、長鏈路 Agent

建議採樣參數:temperature=1.0, top_p=1.0(官方推薦,全模式通用)。

04 · Benchmark 成績:開源陣營的新標竿

4.1 V4-Pro 核心評測

基準測試 V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified80.6% ★ 開源最高96.0%未單獨公布~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

SWE-bench Verified 測試真實 GitHub 倉庫 Bug 修復,80.6% 為目前開源最高分。SWE-bench Pro 更嚴格,Fable 5 的 80.3% 暫時領先。

4.2 性價比(Artificial Analysis)

硬核數據 #2:Strategy & Ops 指數任務:

  • Claude Fable 5:每任務 $3.48,得分 50
  • DeepSeek V4-Pro:每任務 $0.03,得分 38
  • V4-Flash:六類指數任務均低於 $0.04

Fable 5 成本為 V4-Pro 的 116 倍,得分僅高出約 31%。多數生產場景,V4-Pro 的 CP 值難以匹敵。

05 · 與 GPT-5.6 / Claude Fable 5 對比

5.1 定位差異

維度 V4-Pro GPT-5.6 Sol Claude Fable 5
開源✅ MIT❌ 閉源❌ 閉源
可自架✅ 支援
上下文1M tokens未公開1M tokens
程式碼能力極強(接近 Fable 5)極強最強
API 輸出價(離峰)$0.87/M~$15/M$50/M
高峰輸出價$1.74/M
Agent強,支援多 Agent 編排最強
資料隱私✅ 可私有部署

5.2 場景選型矩陣

場景 推薦 原因
預算有限 / 高頻呼叫 / 私有部署V4-Pro / V4-Flash輸出 $0.87/M(Pro)或 $0.28/M(Flash),MIT 可自架
極致程式碼、不計成本Claude Fable 5SWE-bench Pro 80.3% 最高
複雜演算法 + 數學推理GPT-5.6 Sol / UltraTerminal-Bench 85.1%,生態嵌入深
超大規模日誌/文件(低成本)V4-Flash快取命中輸入 $0.0028/M,近乎免費

06 · 峰谷計費:如何控管成本?

GA 最受關注的變化。DeepSeek 首次導入峰谷差異定價,類似電力分時電價。

6.1 完整價格表

模型 計費項 離峰(Off-Peak) 高峰(Peak)
V4-Pro輸入(快取命中)¥0.025 / $0.0035 / 1M翻倍
輸入(快取未命中)¥3.00 / $0.435 / 1M¥6.00 / $0.87
輸出¥6.00 / $0.87 / 1M¥12.00 / $1.74
V4-Flash輸入(快取命中)¥0.02 / $0.0028 / 1M翻倍
輸入(快取未命中)¥1.00 / $0.14 / 1M¥2.00 / $0.28
輸出¥2.00 / $0.28 / 1M¥4.00 / $0.56

高峰時段(北京時間,UTC+8):工作日 09:00–12:0014:00–18:00

硬核數據 #3:即使高峰,V4-Pro 輸出($1.74/M)仍比 Claude Opus 4.8($15/M)便宜 8.6 倍

6.2 四條省錢策略

  1. 非即時任務排離峰:文件批次、標註、程式審查安排在 18:00 後或 09:00 前
  2. 善用快取:重複 System Prompt 建 Prompt Cache,Flash 快取命中 $0.0028/M
  3. Flash 分流:簡單意圖用 Flash,複雜推理轉 Pro
  4. 訂閱帳單通知:DeepSeek 承諾計費變更 24 小時前發信

07 · API 遷移指南(7 月 24 日截止)⚠️

重要deepseek-chatdeepseek-reasoner 將於 2026 年 7 月 24 日 15:59 UTC(台北 7 月 24 日 23:59) 永久停止。請在此之前完成遷移。

7.1 遷移對照

舊模型 新模型 備註
deepseek-chatdeepseek-v4-flash(非思考)輕量、高速
deepseek-reasonerdeepseek-v4-flash(思考)或 deepseek-v4-pro升 Pro 獲更強推理

7.2 六步遷移清單

  1. 全域搜尋 deepseek-chatdeepseek-reasoner(含 CI/CD 與環境變數)
  2. 依上表替換為 deepseek-v4-flashdeepseek-v4-pro
  3. 原 reasoner 啟用思考:extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
  4. Think Max 確認上下文 ≥ 384K tokens
  5. staging 跑回歸,對比品質與延遲
  6. 7 月 24 日 23:59 前切換生產,監控首週峰谷帳單

7.3 Python 範例(OpenAI SDK)

# ❌ 舊寫法(7月24日後失效) client.chat.completions.create( model="deepseek-chat", messages=[...] ) # ✅ 新寫法 client.chat.completions.create( model="deepseek-v4-pro", # 或 deepseek-v4-flash messages=[...], # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}} )

7.4 Anthropic SDK 相容

client = anthropic.Anthropic( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com" ) message = client.messages.create( model="deepseek-v4-pro", max_tokens=4096, messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}] )

08 · 總結

DeepSeek V4 GA 是 2026 年開源大模型的重要里程碑。價值不在於能否打敗 Fable 5 或 GPT-5.6,而在於以閉源旗艦 1/10 乃至 1/100 的成本,提供開源陣營最強性能。對於資料不出境的企業、預算有限的獨立開發者、需要 1M 上下文的 Agent 工程師,V4-Pro 是目前最均衡的選擇。峰谷計費增加複雜度,但整體仍極具競爭力。

09 · 常見問題

Q: GA 與預覽版差異?
A: Agent、推理、程式碼提升,並首次峰谷計費。架構仍為 V4-Pro / V4-Flash。

Q: deepseek-chat 何時停用?
A: 7 月 24 日 23:59(台北)永久下線。

Q: 高峰時段?
A: 北京時間工作日 09:00–12:00、14:00–18:00,費率翻倍。

Q: V4-Pro vs Fable 5?
A: Fable 5 在 SWE-bench 系列領先;V4-Pro 開源最高 80.6%,成本僅 1/116。

Q: Pro vs Flash?
A: Pro 適合複雜推理;Flash 適合高頻輕量,快取 $0.0028/M。

Q: Mac 本機部署?
A: MIT 開源。Flash 可量化試跑;Pro 需多卡叢集。見 本機推理指南

10 · 租用隔離 Mac:完成 V4 API 遷移驗收

7 月 24 日前,最穩妥做法不是在主力 MacBook 上全域替換 deepseek-chat,而是在隔離的 Apple Silicon 節點完成驗收:克隆生產倉庫子集、配置 API Key、分別用 deepseek-v4-flashdeepseek-v4-pro 跑回歸,對比峰谷帳單與輸出品質。主力機常見風險:舊模型名殘留 shell 設定、思考模式污染快取、多模型路由無法單獨驗證。

Windows 或 Linux 雖可透過 API 呼叫 V4,但無法完整驗證與 macOS 原生工具鏈、Keychain 與 Xcode 側車專案並存場景。按天租用的 M 系列 Mac mini 提供用完即毀隔離環境:驗收通過後銷毀節點,實驗設定不污染主力機。計費與 SSH 見 M 系列 Mac 算力租用定價

雖可在現有筆電直接改 API 路由,但主力機更適合穩定交付;若追求可復現的遷移驗收與更低 Keychain 污染風險,隔離 Mac 試跑通常是更優解,租用可進一步降低前期硬體投入。

11 · 參考資料

資料截至 2026 年 7 月 20 日。請以官方文件為準。