適用讀者:AI 開發者、Agent 工程師、需 API 選型與成本控制的企業技術負責人。2026 年 7 月 31 日,DeepSeek 將 V4-Flash 升級為官方版 0731:參數規模不變,僅重訓後訓練,Agent 跑分反超自家更大的 V4-Pro 預覽版,價格僅為 Claude Opus 4.8 的幾十分之一。你將獲得:完整時間線、五方定價對比表、Harness 框架解讀、Artificial Analysis 橫向對比、跑分爭議邊界與六步落地 Runbook。結構:痛點 → 時間線 → 定價矩陣 → 架構拆解 → 競品混戰 → 爭議點 → Runbook → 收束轉化。7/20 GA 與峰谷計費見V4 滿血版發布文;Kimi K3 對比見K3 開源權重文。
TL;DR — 30 秒結論
7/31 官方版上線後,技術團隊普遍卡在以下六個盲區——每一項都直接影響 API 帳單與 Agent 落地品質:
| 時間 | 事件 |
|---|---|
| 2026-04-24 | V4 預覽版發布並開源:V4-Pro(1.6T / 49B 啟用)與 V4-Flash(284B / 13B 啟用),均支援 1M 上下文,MIT 協定 |
| 2026-07-24 | 舊介面 deepseek-chat 與 deepseek-reasoner 正式停用,全部流量切換至 V4 系列命名 |
| 2026-07-27 | 月之暗面 Kimi K3(2.8T)開源權重上線 Hugging Face,給 DeepSeek 製造競爭壓力 |
| 2026-07-31 | V4-Flash-0731 官方版進入 API 公測,開源權重同步上線;changelog 首次點名自研 Agent 框架「Harness」 |
| 2026-08-02 | 阿里 Qwen3.8-Max API GA(權重待放出),中國開源陣營競爭進一步加劇 |
| 2026-08-05(發稿時) | V4-Pro 官方版仍未發布;Harness 框架未公開;App / 網頁端未同步 0731 版本 |
以下定價均為廠商公開資料(截至 2026-08-05),屬於「廠商自報」資訊;GLM-5.2 部分欄位未在本文核實範圍內。
| 模型 | 狀態 | 總參數 / 啟用 | 上下文 | 輸入(未命中/命中,$/M) | 輸出($/M) | 協定 |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | 官方正式版 | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| V4-Pro | 預覽版 | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 權重開源 | 2.8T / ~104B(社群估算) | ~1.05M | $3.00 / $0.30 | $15.00 | Modified MIT |
| GLM-5.2 | 開源 | ~744B / ~40B | 1M | 未核實 | 未核實 | MIT |
| Qwen3.8-Max | API GA | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | 承諾開源 |
| GPT-5.6 Sol | 閉源 | 未公開 | — | — | — | 閉源 |
| Claude Fable 5 | 閉源 | 未公開 | 1M | — | ~$50 | 閉源 |
這次最容易被忽略、但其實最關鍵的一點:V4-Flash-0731 在參數規模與模型結構上與 4 月預覽版完全相同,性能提升完全來自重新進行的後訓練。284B 總參數、13B 啟用參數的 Flash 版本,在多項 Agent 基準上反而超過了參數量大好幾倍的 V4-Pro 預覽版——印證 2026 年下半年「後訓練品質」正在逼近甚至超過「單純堆參數」的產業趨勢。
根據技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列架構三處關鍵改動:
7/31 changelog 首次正式出現 DeepSeek Harness——自研 Agent 執行框架,用於讀寫檔案、呼叫工具、執行命令、完成端到端工程任務,對標 Claude Code。在此之前,DeepSeek 模型主要依賴 Claude Code、OpenCode 等第三方 Agent 工具。
官方公開的 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部基於 Harness「極簡模式」(minimal mode)測得,參數為 max 檔位、top_p=0.95、temperature=1.0。DeepSeek 在 changelog 中主動提示:「跑分對 harness 選擇非常敏感,不能簡單等同於模型本身能力的提升。」
| 模型 | 實驗室 | Intelligence Index(第三方) | 單任務平均成本(第三方) |
|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 50 | $0.03 |
| Kimi K3 | 月之暗面 | 57 | $0.86 |
| GLM-5.2 | 智譜/Z.ai | 比 Flash 高約 1 分 | 未核實 |
| GPT-5.6 Sol | OpenAI | 比 Flash 高 9+ 分 | $1.86 |
| Claude Fable 5 | Anthropic | 比 Flash 高 9+ 分 | $3.15 |
資料來源:Artificial Analysis 獨立評測,經財經媒體轉引;與 DeepSeek 廠商自報 Agent 跑分(Terminal Bench 2.0 等)方法論不同,不可直接相加比較。
有意思的反差:V4-Flash 智能分並非最高(落後於 Kimi K3、GLM-5.2),但單任務成本僅為 Kimi K3 的約 1/29、GPT-5.6 Sol 的約 1/62、Claude Fable 5 的約 1/105。DeepSeek 打的不是「跑分第一」,而是「夠用的智能 + 極致的價格」——這也解釋了預覽版為何能在 OpenRouter 連續七週穩坐調用量第一。
V4-Pro 跳票期間,中文 AI 社群曾把創辦人梁文鋒戲稱為「梁白開」(諧音「白等」);Flash-0731 超預期後,暱稱又翻回「梁聖」。更值得關注的是社群流傳的「斬殺線」概念:DeepSeek 以「夠用性能 + 極端低價」設下市場門檻——友商若性能無明顯超越、又拿不出更低價格,便可能失去存在感。這也解釋了同期 OpenAI GPT-5.6 Luna 一次性降價 80% 等密集調價動作(詳見OpenAI 降價文)。
7/31 上線當天,輝達、博通、AMD 等算力股未出現明顯波動——與 2025 年初 DeepSeek-R1 引發全球 AI 晶片股下跌形成鮮明對比,市場似乎已習慣「DeepSeek 式效率突破」敘事。
deepseek-v4-flash 會自動指向 0731 官方版;若仍用已停用的 deepseek-chat,立即切換(遷移細節見GA 遷移指南)。from openai import OpenAI
client = OpenAI(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
# deepseek-v4-flash 自動指向 0731 官方版
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "分析這段 Agent 日誌..."}],
)
DeepSeek V4-Flash-0731 的價值不在於擊敗 Claude Fable 5 或 GPT-5.6 Sol 的絕對智能上限,而在於以閉源旗艦 1/36 至 1/179 的價格,為大規模 Agent 與批次任務提供「夠用」的開源選擇。對預算敏感、需私有部署或高頻呼叫的團隊,Flash 正式版是目前性價比最突出的選項之一。
但若要在生產環境穩定執行 DeepSeek V4 驅動的 Agent 工作流(OpenClaw Gateway、Harness 未來接入或多模型混合路由),仍會遇到三個結構性瓶頸:
若要穩定執行 DeepSeek V4 + 多模型 Agent 混合棧,MACCOME Mac 雲主機提供真實 macOS、SSH 交接與隔離環境,讓 Agent 在專用節點 7×24 執行。公開方案請見Mac mini 雲租用價格。
資料來源:DeepSeek 官方 API 文件與 changelog、技術報告、Hugging Face 模型卡、Artificial Analysis(經財經媒體轉引)、21 世紀經濟報導、V2EX 社群討論。所有資料截至 2026 年 8 月 5 日,發布前請核實最新定價與 V4-Pro / Harness 上線狀態。
常見問題
DeepSeek V4 和 V3.2 相比最大的區別是什麼?
原生支援 100 萬 token 上下文,長上下文場景下 FLOPs 僅為 V3.2 的 27%、KV Cache 僅為 10%;V4 系列在 Agent 能力上做了專項優化,適配 Claude Code、OpenCode 等主流 Agent 工具。
日常使用應該選 V4 Flash 還是 V4 Pro?
普通對話、批次處理或 Agent 流水線優先 V4-Flash-0731 官方版(性價比更高,Agent 跑分已反超 Pro 預覽版);更深世界知識或複雜推理可暫用 V4-Pro 預覽版,等官方版上線後再評估。
現在能用上 V4 Pro 官方版嗎?
截至 2026 年 8 月 5 日不能。官方版僅有 V4-Flash-0731(API-only),App 與網頁端未同步。V4-Pro 官方版與 Harness 框架口徑為「盡快發布」,網上「8/10–20」等具體時間為未經證實的傳言。
DeepSeek 公布的跑分能直接相信嗎?
建議區分對待:SWE-bench Verified 等第三方基準可信度較高;Terminal Bench 2.0 等 Agent 跑分基於未公開的 Harness 測得,官方亦提示對框架選擇高度敏感,建議等社群用 Claude Code、Cursor 等獨立復現後再下結論。
如何在生產環境 7×24 執行 DeepSeek V4 Agent?
建議在專用 Mac 雲主機上部署 OpenClaw Gateway 或多模型路由,避免筆電睡眠中斷長 Agent 工作階段。查看MACCOME Mac 雲租用方案取得節點配置與定價。