適用讀者:AI 開發者、獨立開發者、負責 API 選型與遷移的企業技術負責人,以及關注開源大模型的 Agent 工程師。2026 年 7 月 20 日,DeepSeek V4 滿血版(GA 正式版)正式上線——在 4 月預覽版基礎上完成 Agent、數學推理與程式碼生成強化,並首次引入峰谷計費。你將獲得:完整時間線、V4-Pro / V4-Flash 規格、CSA / HCA / mHC / Muon 架構解讀、SWE-bench 基準、116 倍成本比分析、三模型對比矩陣、峰谷計費表與省錢策略、7 月 24 日 API 遷移映射與程式碼範例、六步 Runbook。結構:痛點 → 時間線 → 架構 → 基準 → 性價比 → 對比矩陣 → 峰谷計費 → 遷移 → Runbook → 收束轉化。本地推理決策請見DeepSeek V4 Flash 本地 vs 雲端租用。
TL;DR — 30 秒結論
deepseek-chat 與 deepseek-reasoner 永久下線,請在截止前完成 API 更新。DeepSeek V4 GA 發布後,工程團隊普遍卡在以下六個盲區——不是不知道它「便宜又強」,而是無法把新計費規則與遷移時限翻譯成可執行的生產方案:
deepseek-chat 與 deepseek-reasoner 永久下線,舊程式碼若未更新將直接中斷服務。下文用官方文件、arXiv:2606.19348 與 Artificial Analysis 資料,逐一填平上述盲區。
| 時間 | 事件 |
|---|---|
| 2026 年 4 月 24 日 | V4 預覽版上線並開源(MIT),含 V4-Pro(1.6T)與 V4-Flash(284B) |
| 2026 年 5 月 | 生產調優版本上線,API 正式可用 |
| 2026 年 6 月 | V4-Pro 輸出價永久降 75% 至 $0.87/M tokens |
| 2026 年 6 月 29 日 | DeepSeek 向 API 用戶發信,宣布 GA 將於 7 月中旬上線並披露峰谷計費 |
| 2026 年 7 月 19 日 | 多位開發者獲 GA 灰度內測資格,媒體報導「滿血版最快明日發布」 |
| 2026 年 7 月 20 日 | GA 正式版上線(本文發布日) |
| 2026 年 7 月 24 日 | 舊介面名 deepseek-chat / deepseek-reasoner 永久下線 |
一句話總結:架構未變,GA 是在預覽版基礎上完成 Agent 能力、數學推理與程式碼生成專項提升,並配套正式商業化計費體系。
| 規格 | V4-Pro | V4-Flash |
|---|---|---|
| 總參數量 | 1.6 萬億(1.6T) | 2,840 億(284B) |
| 每 Token 啟用參數 | 490 億(49B) | 130 億(13B) |
| Transformer 層數 | 61 層 | 43 層 |
| 上下文視窗 | 1,000,000 tokens | 1,000,000 tokens |
| 最大輸出 | 384K tokens | 384K tokens |
| 精度 | FP4(專家權重)+ FP8(其餘) | FP4 + FP8 混合 |
| 預訓練資料量 | 33T+ tokens | 32T+ tokens |
| 開源協議 | MIT | MIT |
傳統 Transformer 的 KV 快取記憶體隨上下文長度線性成長,1M token 幾乎不可行。DeepSeek V4 捨棄 V2/V3 的 MLA,改用兩種全新注意力機制的混合體:
綜合效果:1M token 場景下 KV 快取記憶體僅為 V3.2 的 10%(Flash 低至 7%)。
升級傳統殘差連接,引入 4 通道殘差流,透過滿足雙隨機矩陣約束(Birkhoff 多面體)的混合矩陣,確保 61 層深網路中訊號穩定傳播。
訓練採用 Muon 優化器(非 AdamW),透過牛頓-舒爾茨正交化處理梯度,收斂更快、訓練更穩定。
| 模式 | 特點 | 適用場景 |
|---|---|---|
| Non-think | 無思維鏈,極速回應 | 簡單問答、路由分發 |
| Think High | 顯式推理(<redacted_thinking> 標籤) | 中等複雜任務、程式碼除錯 |
| Think Max | 最大推理力度,需 384K+ 上下文 | 複雜數學、長鏈路 Agent |
官方推薦取樣參數:temperature=1.0, top_p=1.0(全模式通用)。
| 基準測試 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6%(開源最高) | 96.0% | 未單獨公布 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified 測試真實 GitHub 倉庫 Bug 修復,80.6% 為當前開源模型最高分,與 Gemini 3.1 Pro 並列。SWE-bench Pro 更嚴格,Claude Fable 5 以 80.3% 領先。
Artificial Analysis 在 Strategy & Ops 指數任務中測得:
Fable 5 成本是 V4-Pro 的 116 倍,得分僅高出約 12 分(31%)。對大多數生產場景,V4-Pro 性價比無可匹敵。OpenRouter 份額變化請見OpenRouter 6 月排行榜分析。
| 維度 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 開源 | MIT 協議 | 閉源 | 閉源 |
| 可自託管 | 支援 | 不支援 | 不支援 |
| 上下文視窗 | 1M tokens | 未公開 | 1M tokens |
| 程式碼能力 | 極強(接近 Fable 5) | 極強 | 最強 |
| API 輸出價(平時) | $0.87/M tokens | ~$15/M | $50/M |
| 峰值輸出價 | $1.74/M tokens | — | — |
| Agent 能力 | 強,支援多 Agent 編排 | 強 | 最強 |
| 資料隱私 | 可私有部署 | 不可 | 不可 |
場景選型:預算有限 / 高頻呼叫 / 私有部署 → V4-Pro 或 V4-Flash;極致程式碼能力 → Claude Fable 5;複雜演算法 + 數學推理 → GPT-5.6 Sol / Ultra;超大規模日誌處理 → V4-Flash(快取命中輸入僅 $0.0028/M)。程式設計助手對比請見AI 程式設計助手選型矩陣。
GA 版本最受關注的變化。DeepSeek 首次引入峰谷差異化定價,類似電網分時電價。高峰時段(北京時間):工作日 09:00–12:00 與 14:00–18:00,費率翻倍。
| 模型 | 計費項 | 平時(Off-Peak) | 高峰(Peak) |
|---|---|---|---|
| V4-Pro | 輸入(快取命中) | ¥0.025 / $0.0035 / 1M | 翻倍 |
| V4-Pro | 輸入(快取未命中) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 |
| V4-Pro | 輸出 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 |
| V4-Flash | 輸入(快取命中) | ¥0.02 / $0.0028 / 1M | 翻倍 |
| V4-Flash | 輸入(快取未命中) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 |
| V4-Flash | 輸出 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
四條省錢策略:
即使在高峰期,V4-Pro 輸出價($1.74/M)仍比 Claude Opus 4.8($15/M)便宜 8.6 倍。
舊模型名 deepseek-chat 和 deepseek-reasoner 將於 2026 年 7 月 24 日 15:59 UTC(北京時間 23:59) 永久停止存取。
| 舊模型名 | 新模型名 | 備註 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(非思考模式) | 速度快,適合輕量任務 |
deepseek-reasoner | deepseek-v4-flash(思考模式) | 或升級 deepseek-v4-pro 獲更強推理 |
OpenAI SDK 範例(Python):
# 舊寫法(7 月 24 日後失效)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
# 新寫法
client.chat.completions.create(
model="deepseek-v4-pro", # 或 deepseek-v4-flash
messages=[...],
# extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
Anthropic SDK 相容寫法:V4 同時支援 OpenAI ChatCompletions 與 Anthropic Messages 格式,base_url 不變,僅需更新 model 參數。
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
重要提醒:若生產環境仍使用 deepseek-chat 或 deepseek-reasoner,請在 7 月 24 日前完成 staging 測試並部署更新,否則服務將中斷。
deepseek-chat 與 deepseek-reasoner,列出所有呼叫點。deepseek-v4-flash;推理任務 → Flash 思考模式或 deepseek-v4-pro。DeepSeek V4 GA 正式版是 2026 年開源大模型領域最重要的里程碑之一。它的價值不在於能否擊敗 Claude Fable 5 或 GPT-5.6(暫時還不能),而在於以閉源旗艦 1/10 乃至 1/100 的成本,提供開源模型中無可爭議的最強性能。對不想資料出境的企業、預算有限的獨立開發者、需要 1M token 上下文的 Agent 工程師,V4-Pro 是目前最均衡的選擇。
但若要在生產環境穩定執行 DeepSeek V4 驅動的 Agent 工作流(OpenClaw Gateway 或多模型混合路由),本地 MacBook 仍會遇到三個結構性瓶頸:
若要穩定執行 DeepSeek V4 + 多模型 Agent 混合棧,MACCOME Mac 雲端主機提供真實 macOS、SSH 交接與隔離環境,讓 Agent 在專用節點 7×24 執行。公開方案請見Mac mini 雲端租用價格。
關注時間節點:7 月 24 日(舊 API 下線)→ 峰谷計費全面生效 → 持續關注 GA 後續優化公告。
資料來源:DeepSeek 官方文件、arXiv:2606.19348、Hugging Face 模型頁、Artificial Analysis、LLMReference。截止 2026 年 7 月 20 日。
常見問題
deepseek-chat 停用後該怎麼遷移?
將 deepseek-chat 改為 deepseek-v4-flash(非思考模式),deepseek-reasoner 改為 Flash 思考模式或 deepseek-v4-pro。舊介面名將於 2026 年 7 月 24 日 23:59(北京時間)永久下線。
DeepSeek V4 峰谷計費怎麼算?
工作日 09:00–12:00 與 14:00–18:00(北京時間)為高峰時段,費率翻倍。V4-Pro 平時輸出 $0.87/M tokens,高峰 $1.74/M。非即時任務排至非高峰可節省約 50%。
V4-Pro 和 V4-Flash 怎麼選?
V4-Pro(1.6T,49B 啟用)適合複雜推理、Agent 與程式碼生成;V4-Flash(284B,13B 啟用)適合高頻輕量任務與路由分流,快取命中輸入僅 $0.0028/M。
DeepSeek V4 和 GPT-5.6 比怎麼樣?
V4-Pro 在 LiveCodeBench 與 Codeforces 領先,GPT-5.6 Sol 在 Terminal-Bench 更優。成本上 V4-Pro 輸出 $0.87/M vs GPT-5.6 約 $15/M,差距約 17 倍。詳見上文三模型對比矩陣。
7 月 24 日截止後會怎樣?
使用 deepseek-chat 或 deepseek-reasoner 的 API 呼叫將返回錯誤。請在截止前更新為 deepseek-v4-flash 或 deepseek-v4-pro 並完成 staging 測試。
如何在生產環境 7×24 執行 DeepSeek V4 Agent?
建議在專用 Mac 雲端主機上部署 OpenClaw Gateway 或多模型路由,避免筆電睡眠中斷長會話。查看MACCOME Mac 雲端租用方案取得節點配置與定價。