DeepSeek V4 GA 正式版上線:峰谷計費、1.6T 架構與 GPT-5.6 橫向評估
誰該讀?在 Mac 上以 deepseek-chat / reasoner 做程式開發與 Agent 的台港工程師,面對 7 月 20 日 GA 上線與 7 月 24 日舊介面下線,需要明確遷移路徑與成本模型。你會得到什麼?時間軸、CSA/HCA/mHC 架構拆解、benchmark 對照表、峰谷價目、六步遷移清單與選型矩陣。結構包含:規格表、定價表、程式碼範例、FAQ×6 與隔離 Mac 驗收建議。
📋 本文目錄
橫向對比見 GPT-5.6 Sol 發布解析;本機推理可參考 DeepSeek V4-Flash Mac 本機推理;降價背景見 2026 AI 降價全攻略。
經過三個月預覽期,DeepSeek V4 GA 正式版於 2026 年 7 月 20 日全面上線。相較 4 月預覽版,這次 GA 不僅強化了 Agent、數學與程式碼能力,更首次導入峰谷差異化計費——標誌 DeepSeek 從「近乎免費試用」邁向有紀律的商業化營運。以下從架構、benchmark、定價、與 GPT-5.6 / Claude Fable 5 橫向對比,以及7 月 24 日 API 遷移五個面向,為台港開發者整理決策所需資訊。
01 · 三大遷移痛點:GA 上線不等於零成本換模
- 7 月 24 日硬截止:舊模型名
deepseek-chat與deepseek-reasoner將於台北時間 7 月 24 日 23:59 永久下線。生產環境若仍硬編碼舊 ID,週末一過服務直接中斷——這是硬切,不是灰度。 - 峰谷計費帳單盲區:GA 版在工作日 09:00–12:00、14:00–18:00(北京時間)費率翻倍。Agent 長任務若在高峰批次執行,月帳單可能較預覽期翻倍,而團隊往往未安排 cron 排程與快取分層。
- Pro vs Flash 選型混亂:reasoner 可遷 Flash 思考模式或升級 Pro,但 Think Max 需 384K+ 上下文;全量升 Pro 抬升成本,全量降 Flash 又可能犧牲 SWE-bench 級程式碼品質——需按場景分流而非一刀切。
02 · 時間軸回顧:從預覽版到 GA
| 時間 | 事件 |
|---|---|
| 2026 年 4 月 24 日 | V4 預覽版上線並開源(MIT),含 V4-Pro(1.6T)與 V4-Flash(284B) |
| 2026 年 5 月 | V4-Flash 與 V4-Pro 生產調優版上線,API 正式可用 |
| 2026 年 6 月 | V4-Pro 輸出價永久降 75%($0.87/M tokens),進入高 CP 值區間 |
| 2026 年 6 月 29 日 | DeepSeek 向 API 用戶發信,宣布 GA 將於 7 月中旬上線,並首次披露峰谷計費 |
| 2026 年 7 月 19 日 | 部分開發者取得 GA 灰度資格,媒體報導「正式版最快隔日發布」 |
| 2026 年 7 月 20 日 | GA 正式版上線(本文發布日) |
| 2026 年 7 月 24 日 | 舊介面名 deepseek-chat 與 deepseek-reasoner 永久下線 |
一句話:預覽版已夠強,GA 是在此基礎上針對 Agent、推理與程式碼做專項提升,並配套正式商業計費體系。
03 · 技術架構深度解析
3.1 模型家族:V4-Pro vs V4-Flash
| 規格 | V4-Pro | V4-Flash |
|---|---|---|
| 總參數量 | 1.6 兆(1.6T) | 2840 億(284B) |
| 每 Token 啟用參數 | 490 億(49B) | 130 億(13B) |
| Transformer 層數 | 61 層 | 43 層 |
| 上下文視窗 | 1,000,000 tokens | 1,000,000 tokens |
| 最大輸出 | 384K tokens | 384K tokens |
| 精度 | FP4(專家權重)+ FP8(其餘) | FP4 + FP8 混合 |
| 預訓練資料量 | 33T+ tokens | 32T+ tokens |
| 開源協議 | MIT | MIT |
3.2 CSA + HCA 混合注意力
傳統 Transformer 的 KV Cache 記憶體隨上下文線性成長,百萬 token 幾乎不可行。DeepSeek V4 捨棄 V2/V3 的 MLA,改採兩種新注意力機制的混合:
壓縮稀疏注意力(CSA,Compressed Sparse Attention)
- 以 Softmax 門控池化將 KV 序列壓縮 4 倍
- FP4 精度「閃電索引器」(Lightning Indexer)做 top-k 稀疏選擇(Pro 選 top-1024,Flash 選 top-512)
- 保留最近 128 個 token 的滑動視窗
- 1M 上下文下,推理 FLOPs 僅為 DeepSeek V3.2 的 27%
重度壓縮注意力(HCA,Heavily Compressed Attention)
- 將 token 壓縮 128 倍後做全域密集注意力
- 捕捉長程依賴,與 CSA 互補
- V4-Flash 前 2 層用 HCA,之後 CSA/HCA 交替;V4-Pro 結構類似
硬核數據 #1:1M token 場景下,KV Cache 記憶體僅為 V3.2 的 10%(Flash 低至 7%)。同等硬體可服務更長上下文,伺服器成本大幅下降。
3.3 流形約束超連接(mHC)
升級傳統殘差連接。標準 Transformer 用 x = x + f(x),極深網路易梯度退化。mHC 引入 4 通道殘差流,以滿足雙隨機矩陣約束(Birkhoff 多面體)的混合矩陣穩定傳遞 61 層訊號,同時保留表達力。更深、更穩。
3.4 Muon 優化器
訓練採 Muon(非 AdamW),以牛頓-舒爾茨正交化處理梯度,步長更有依據,收斂更快、更穩定。
3.5 三種推理模式
| 模式 | 特點 | 適用場景 |
|---|---|---|
| Non-think | 無思維鏈,極速回應 | 簡單問答、路由分發 |
| Think High | 顯式推理(<redacted_thinking> 標籤) | 中等複雜任務、程式除錯 |
| Think Max | 最大推理力度,需 384K+ 上下文 | 複雜數學、長鏈路 Agent |
建議採樣參數:temperature=1.0, top_p=1.0(官方推薦,全模式通用)。
04 · Benchmark 成績:開源陣營的新標竿
4.1 V4-Pro 核心評測
| 基準測試 | V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% ★ 開源最高 | 96.0% | 未單獨公布 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified 測試真實 GitHub 倉庫 Bug 修復,80.6% 為目前開源最高分。SWE-bench Pro 更嚴格,Fable 5 的 80.3% 暫時領先。
4.2 性價比(Artificial Analysis)
硬核數據 #2:Strategy & Ops 指數任務:
- Claude Fable 5:每任務 $3.48,得分 50
- DeepSeek V4-Pro:每任務 $0.03,得分 38
- V4-Flash:六類指數任務均低於 $0.04
Fable 5 成本為 V4-Pro 的 116 倍,得分僅高出約 31%。多數生產場景,V4-Pro 的 CP 值難以匹敵。
05 · 與 GPT-5.6 / Claude Fable 5 對比
5.1 定位差異
| 維度 | V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 開源 | ✅ MIT | ❌ 閉源 | ❌ 閉源 |
| 可自架 | ✅ 支援 | ❌ | ❌ |
| 上下文 | 1M tokens | 未公開 | 1M tokens |
| 程式碼能力 | 極強(接近 Fable 5) | 極強 | 最強 |
| API 輸出價(離峰) | $0.87/M | ~$15/M | $50/M |
| 高峰輸出價 | $1.74/M | — | — |
| Agent | 強,支援多 Agent 編排 | 強 | 最強 |
| 資料隱私 | ✅ 可私有部署 | ❌ | ❌ |
5.2 場景選型矩陣
| 場景 | 推薦 | 原因 |
|---|---|---|
| 預算有限 / 高頻呼叫 / 私有部署 | V4-Pro / V4-Flash | 輸出 $0.87/M(Pro)或 $0.28/M(Flash),MIT 可自架 |
| 極致程式碼、不計成本 | Claude Fable 5 | SWE-bench Pro 80.3% 最高 |
| 複雜演算法 + 數學推理 | GPT-5.6 Sol / Ultra | Terminal-Bench 85.1%,生態嵌入深 |
| 超大規模日誌/文件(低成本) | V4-Flash | 快取命中輸入 $0.0028/M,近乎免費 |
06 · 峰谷計費:如何控管成本?
GA 最受關注的變化。DeepSeek 首次導入峰谷差異定價,類似電力分時電價。
6.1 完整價格表
| 模型 | 計費項 | 離峰(Off-Peak) | 高峰(Peak) |
|---|---|---|---|
| V4-Pro | 輸入(快取命中) | ¥0.025 / $0.0035 / 1M | 翻倍 |
| 輸入(快取未命中) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 | |
| 輸出 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 | |
| V4-Flash | 輸入(快取命中) | ¥0.02 / $0.0028 / 1M | 翻倍 |
| 輸入(快取未命中) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 | |
| 輸出 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
高峰時段(北京時間,UTC+8):工作日 09:00–12:00 與 14:00–18:00。
硬核數據 #3:即使高峰,V4-Pro 輸出($1.74/M)仍比 Claude Opus 4.8($15/M)便宜 8.6 倍。
6.2 四條省錢策略
- 非即時任務排離峰:文件批次、標註、程式審查安排在 18:00 後或 09:00 前
- 善用快取:重複 System Prompt 建 Prompt Cache,Flash 快取命中 $0.0028/M
- Flash 分流:簡單意圖用 Flash,複雜推理轉 Pro
- 訂閱帳單通知:DeepSeek 承諾計費變更 24 小時前發信
07 · API 遷移指南(7 月 24 日截止)⚠️
重要:deepseek-chat 與 deepseek-reasoner 將於 2026 年 7 月 24 日 15:59 UTC(台北 7 月 24 日 23:59) 永久停止。請在此之前完成遷移。
7.1 遷移對照
| 舊模型 | 新模型 | 備註 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(非思考) | 輕量、高速 |
deepseek-reasoner | deepseek-v4-flash(思考)或 deepseek-v4-pro | 升 Pro 獲更強推理 |
7.2 六步遷移清單
- 全域搜尋
deepseek-chat與deepseek-reasoner(含 CI/CD 與環境變數) - 依上表替換為
deepseek-v4-flash或deepseek-v4-pro - 原 reasoner 啟用思考:
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}} - Think Max 確認上下文 ≥ 384K tokens
- staging 跑回歸,對比品質與延遲
- 7 月 24 日 23:59 前切換生產,監控首週峰谷帳單
7.3 Python 範例(OpenAI SDK)
7.4 Anthropic SDK 相容
08 · 總結
DeepSeek V4 GA 是 2026 年開源大模型的重要里程碑。價值不在於能否打敗 Fable 5 或 GPT-5.6,而在於以閉源旗艦 1/10 乃至 1/100 的成本,提供開源陣營最強性能。對於資料不出境的企業、預算有限的獨立開發者、需要 1M 上下文的 Agent 工程師,V4-Pro 是目前最均衡的選擇。峰谷計費增加複雜度,但整體仍極具競爭力。
09 · 常見問題
Q: GA 與預覽版差異?
A: Agent、推理、程式碼提升,並首次峰谷計費。架構仍為 V4-Pro / V4-Flash。
Q: deepseek-chat 何時停用?
A: 7 月 24 日 23:59(台北)永久下線。
Q: 高峰時段?
A: 北京時間工作日 09:00–12:00、14:00–18:00,費率翻倍。
Q: V4-Pro vs Fable 5?
A: Fable 5 在 SWE-bench 系列領先;V4-Pro 開源最高 80.6%,成本僅 1/116。
Q: Pro vs Flash?
A: Pro 適合複雜推理;Flash 適合高頻輕量,快取 $0.0028/M。
Q: Mac 本機部署?
A: MIT 開源。Flash 可量化試跑;Pro 需多卡叢集。見 本機推理指南。
10 · 租用隔離 Mac:完成 V4 API 遷移驗收
7 月 24 日前,最穩妥做法不是在主力 MacBook 上全域替換 deepseek-chat,而是在隔離的 Apple Silicon 節點完成驗收:克隆生產倉庫子集、配置 API Key、分別用 deepseek-v4-flash 與 deepseek-v4-pro 跑回歸,對比峰谷帳單與輸出品質。主力機常見風險:舊模型名殘留 shell 設定、思考模式污染快取、多模型路由無法單獨驗證。
Windows 或 Linux 雖可透過 API 呼叫 V4,但無法完整驗證與 macOS 原生工具鏈、Keychain 與 Xcode 側車專案並存場景。按天租用的 M 系列 Mac mini 提供用完即毀隔離環境:驗收通過後銷毀節點,實驗設定不污染主力機。計費與 SSH 見 M 系列 Mac 算力租用定價。
雖可在現有筆電直接改 API 路由,但主力機更適合穩定交付;若追求可復現的遷移驗收與更低 Keychain 污染風險,隔離 Mac 試跑通常是更優解,租用可進一步降低前期硬體投入。
11 · 參考資料
- DeepSeek 官方文件:api-docs.deepseek.com
- arXiv:arXiv:2606.19348
- Hugging Face:huggingface.co/deepseek-ai
- Artificial Analysis:artificialanalysis.ai
資料截至 2026 年 7 月 20 日。請以官方文件為準。