DeepSeek V4 Flash 正式版評測:跑分逼近 Opus 4.8,價格卻只要幾十分之一

約 16 分鐘閱讀 · MACCOME · 最後更新:2026 年 8 月 5 日

適用讀者:AI 開發者、Agent 工程師、需 API 選型與成本控制的企業技術負責人。2026 年 7 月 31 日,DeepSeek 將 V4-Flash 升級為官方版 0731:參數規模不變,僅重訓後訓練,Agent 跑分反超自家更大的 V4-Pro 預覽版,價格僅為 Claude Opus 4.8 的幾十分之一你將獲得:完整時間線、五方定價對比表、Harness 框架解讀、Artificial Analysis 橫向對比、跑分爭議邊界與六步落地 Runbook。結構:痛點 → 時間線 → 定價矩陣 → 架構拆解 → 競品混戰 → 爭議點 → Runbook → 收束轉化。7/20 GA 與峰谷計費見V4 滿血版發布文;Kimi K3 對比見K3 開源權重文

bolt

TL;DR — 30 秒結論

  • 不是新模型:284B / 13B 啟用參數與 4 月預覽版完全相同,性能提升完全來自後訓練,而非擴大規模。
  • 價格碾壓:輸入 $0.14/M(快取未命中)、輸出 $0.28/M——約為 Opus 4.8 的 1/36 至 1/179(視快取命中而定)。
  • Harness 首次亮相:DeepSeek 自研 Agent 框架對標 Claude Code,但尚未公開發布;官方 Agent 跑分均基於其「極簡模式」測得。
  • V4-Pro 仍未 GA:截至 8/5 僅有 Flash-0731 官方版(API-only),Pro 官方版與 Harness 口徑為「盡快發布」。
  • 跑分需審慎:Terminal Bench 2.0 的 82.7 分為廠商自報 + 特定框架結果,不宜直接套用到 Claude Code / Cursor 等第三方 Agent 環境。

六大痛點:Flash 正式版來了,但決策盲區還在

7/31 官方版上線後,技術團隊普遍卡在以下六個盲區——每一項都直接影響 API 帳單與 Agent 落地品質:

  1. 跑分依賴 Harness,官方自己都在提醒:Terminal Bench 2.0 的 82.7 分基於未公開的 Harness「極簡模式」測得,不能簡單等同於在 Claude Code 或 Cursor 中的通用能力。
  2. V4-Pro 官方版仍跳票:旗艦 1.6T 模型官方版無確切日期;媒體流傳的「8/10–20 GA」均為未署名消息來源,DeepSeek changelog 僅寫「盡快發布」。
  3. API-only,App 未同步:0731 正式版僅限 API 公測,消費者 App 與網頁端仍是舊版本——團隊若混用多端,體驗會不一致。
  4. 快取命中率偏低:海外開發者社群回饋輸入快取命中率不理想,批次 Agent 循環的實際成本可能高於標價。
  5. 峰谷加價預告未生效:DeepSeek 已預告北京時間 9–12 點、14–18 點高峰時段 2 倍加價,但截至發稿未公布具體生效日期。
  6. 融資 IPO 傳聞未證實:多家財經媒體援引「消息人士」報導約 74 億美元融資與 IPO 籌備,尚無監管備案或官方聲明。

時間線:從 4 月預覽到 7 月 Flash 官方版

時間事件
2026-04-24V4 預覽版發布並開源:V4-Pro(1.6T / 49B 啟用)與 V4-Flash(284B / 13B 啟用),均支援 1M 上下文,MIT 協定
2026-07-24舊介面 deepseek-chatdeepseek-reasoner 正式停用,全部流量切換至 V4 系列命名
2026-07-27月之暗面 Kimi K3(2.8T)開源權重上線 Hugging Face,給 DeepSeek 製造競爭壓力
2026-07-31V4-Flash-0731 官方版進入 API 公測,開源權重同步上線;changelog 首次點名自研 Agent 框架「Harness」
2026-08-02阿里 Qwen3.8-Max API GA(權重待放出),中國開源陣營競爭進一步加劇
2026-08-05(發稿時)V4-Pro 官方版仍未發布;Harness 框架未公開;App / 網頁端未同步 0731 版本

核心定價對比:Flash 正式版 vs 中國開源六方混戰

以下定價均為廠商公開資料(截至 2026-08-05),屬於「廠商自報」資訊;GLM-5.2 部分欄位未在本文核實範圍內。

模型狀態總參數 / 啟用上下文輸入(未命中/命中,$/M)輸出($/M)協定
V4-Flash-0731官方正式版284B / 13B1M$0.14 / $0.0028$0.28MIT
V4-Pro預覽版1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3權重開源2.8T / ~104B(社群估算)~1.05M$3.00 / $0.30$15.00Modified MIT
GLM-5.2開源~744B / ~40B1M未核實未核實MIT
Qwen3.8-MaxAPI GA2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00承諾開源
GPT-5.6 Sol閉源未公開閉源
Claude Fable 5閉源未公開1M~$50閉源

架構沒變,後訓練變強:CSA + HCA + mHC + Muon

這次最容易被忽略、但其實最關鍵的一點:V4-Flash-0731 在參數規模與模型結構上與 4 月預覽版完全相同,性能提升完全來自重新進行的後訓練。284B 總參數、13B 啟用參數的 Flash 版本,在多項 Agent 基準上反而超過了參數量大好幾倍的 V4-Pro 預覽版——印證 2026 年下半年「後訓練品質」正在逼近甚至超過「單純堆參數」的產業趨勢。

根據技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列架構三處關鍵改動:

  • 混合注意力(CSA + HCA):對外統一稱為 DSA 稀疏注意力,在長上下文場景降低計算與顯存開銷;1M 上下文下 V4-Pro 單 token 推理 FLOPs 僅為 V3.2 的 27%,KV Cache 占用僅為 10%(廠商自報,尚未見獨立第三方復現)。
  • 流形約束超連接(mHC):對傳統殘差連接結構改進,確保深層網路訊號穩定傳播。
  • Muon 優化器:替換傳統 AdamW,提升訓練收斂速度與穩定性。

Harness 框架:DeepSeek 對標 Claude Code 的 Agent 執行層

7/31 changelog 首次正式出現 DeepSeek Harness——自研 Agent 執行框架,用於讀寫檔案、呼叫工具、執行命令、完成端到端工程任務,對標 Claude Code。在此之前,DeepSeek 模型主要依賴 Claude Code、OpenCode 等第三方 Agent 工具。

官方公開的 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部基於 Harness「極簡模式」(minimal mode)測得,參數為 max 檔位、top_p=0.95、temperature=1.0。DeepSeek 在 changelog 中主動提示:「跑分對 harness 選擇非常敏感,不能簡單等同於模型本身能力的提升。」

Artificial Analysis 橫向對比:智能分不是最高,成本卻最低

模型實驗室Intelligence Index(第三方)單任務平均成本(第三方)
V4-Flash-0731DeepSeek50$0.03
Kimi K3月之暗面57$0.86
GLM-5.2智譜/Z.ai比 Flash 高約 1 分未核實
GPT-5.6 SolOpenAI比 Flash 高 9+ 分$1.86
Claude Fable 5Anthropic比 Flash 高 9+ 分$3.15

資料來源:Artificial Analysis 獨立評測,經財經媒體轉引;與 DeepSeek 廠商自報 Agent 跑分(Terminal Bench 2.0 等)方法論不同,不可直接相加比較

有意思的反差:V4-Flash 智能分並非最高(落後於 Kimi K3、GLM-5.2),但單任務成本僅為 Kimi K3 的約 1/29、GPT-5.6 Sol 的約 1/62、Claude Fable 5 的約 1/105。DeepSeek 打的不是「跑分第一」,而是「夠用的智能 + 極致的價格」——這也解釋了預覽版為何能在 OpenRouter 連續七週穩坐調用量第一。

爭議點:跑分好看,不代表沒有水分

  • Agent 跑分為 Harness 依賴型:Terminal Bench 2.0 的 82.7 分(vs V4-Pro 預覽版 67.9 分)基於未公開框架測得,待社群用 Claude Code、Cursor 等獨立復現前,應視為「廠商自報 + 特定框架」結果。
  • 可用性問題存在:據 21 世紀經濟報導援引海外開發者回饋,正式版存在輸入快取命中率偏低、安全分類器偶發逾時等問題。
  • V4-Pro / Harness 上線時間未證實:中文媒體流傳的「8/10–20 GA」均為未署名消息來源,以 DeepSeek 官方「盡快發布」為準。
  • 融資傳聞需謹慎:約 74 億美元融資、487 億美元估值等數字目前主要來自財經媒體「據報導」,尚無監管備案直接確認。

「斬殺線」與社群情緒:從「梁白開」到「梁聖」

V4-Pro 跳票期間,中文 AI 社群曾把創辦人梁文鋒戲稱為「梁白開」(諧音「白等」);Flash-0731 超預期後,暱稱又翻回「梁聖」。更值得關注的是社群流傳的「斬殺線」概念:DeepSeek 以「夠用性能 + 極端低價」設下市場門檻——友商若性能無明顯超越、又拿不出更低價格,便可能失去存在感。這也解釋了同期 OpenAI GPT-5.6 Luna 一次性降價 80% 等密集調價動作(詳見OpenAI 降價文)。

7/31 上線當天,輝達、博通、AMD 等算力股未出現明顯波動——與 2025 年初 DeepSeek-R1 引發全球 AI 晶片股下跌形成鮮明對比,市場似乎已習慣「DeepSeek 式效率突破」敘事。

六步落地 Runbook:從評估到生產路由

  1. 確認模型指向:API 呼叫 deepseek-v4-flash 會自動指向 0731 官方版;若仍用已停用的 deepseek-chat,立即切換(遷移細節見GA 遷移指南)。
  2. Staging 對比品質:用真實 Prompt 子集對比 0731 與預覽版輸出,重點關注 Agent 工具呼叫格式與長上下文穩定性。
  3. 分層路由 Flash / Pro:批次處理、路由分發用 Flash($0.28/M 輸出);複雜推理暫用 V4-Pro 預覽版,等官方版 GA 後再評估切換。
  4. 監控快取命中率:固定 System Prompt 的 Agent 循環啟用 Prompt Cache;若命中率偏低,實際成本會顯著高於標價。
  5. 預留峰谷調度:非即時批次任務安排在預告的高峰時段(9–12、14–18 北京時間)之外執行。
  6. 本地 vs 雲端決策:128GB Mac 可透過 ds4 跑 Flash q2 量化版;生產 Agent 需 7×24 常駐節點——詳見ds4 本地 vs 雲租決策文
python
from openai import OpenAI

client = OpenAI(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)

# deepseek-v4-flash 自動指向 0731 官方版
response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "分析這段 Agent 日誌..."}],
)

三組值得引用的硬資料

  • 82.7 vs 67.9 — Terminal Bench 2.0:V4-Flash-0731 廠商自報得分反超 V4-Pro 預覽版(Harness 極簡模式,待獨立復現)
  • 27% / 10% — 1M 上下文下 V4-Pro 推理 FLOPs 與 KV Cache 相對 V3.2 的佔比(DeepSeek 技術報告自報)
  • 1/29 ~ 1/105 — V4-Flash 單任務成本相對 Kimi K3 / GPT-5.6 Sol / Claude Fable 5 的倍數(Artificial Analysis 第三方資料)

收束:夠用智能 + 極致價格,但生產 Agent 仍需穩定底座

DeepSeek V4-Flash-0731 的價值不在於擊敗 Claude Fable 5 或 GPT-5.6 Sol 的絕對智能上限,而在於以閉源旗艦 1/36 至 1/179 的價格,為大規模 Agent 與批次任務提供「夠用」的開源選擇。對預算敏感、需私有部署或高頻呼叫的團隊,Flash 正式版是目前性價比最突出的選項之一。

但若要在生產環境穩定執行 DeepSeek V4 驅動的 Agent 工作流(OpenClaw Gateway、Harness 未來接入或多模型混合路由),仍會遇到三個結構性瓶頸:

  • 筆電睡眠中斷:合蓋或 Wi-Fi 切換切斷長時間 Agent 工作階段,已消耗 Token 無法退還;
  • 快取與峰谷難落地:本地 Cron 受睡眠策略影響,非高峰批次任務無法可靠執行;
  • 無 7×24 路由中樞:Flash / Pro / Fable 5 混合策略需要常駐 Gateway 按任務類型分發,筆電不適合做調度節點。

若要穩定執行 DeepSeek V4 + 多模型 Agent 混合棧,MACCOME Mac 雲主機提供真實 macOS、SSH 交接與隔離環境,讓 Agent 在專用節點 7×24 執行。公開方案請見Mac mini 雲租用價格

資料來源:DeepSeek 官方 API 文件與 changelog、技術報告、Hugging Face 模型卡、Artificial Analysis(經財經媒體轉引)、21 世紀經濟報導、V2EX 社群討論。所有資料截至 2026 年 8 月 5 日,發布前請核實最新定價與 V4-Pro / Harness 上線狀態。

常見問題

DeepSeek V4 和 V3.2 相比最大的區別是什麼?

原生支援 100 萬 token 上下文,長上下文場景下 FLOPs 僅為 V3.2 的 27%、KV Cache 僅為 10%;V4 系列在 Agent 能力上做了專項優化,適配 Claude Code、OpenCode 等主流 Agent 工具。

日常使用應該選 V4 Flash 還是 V4 Pro?

普通對話、批次處理或 Agent 流水線優先 V4-Flash-0731 官方版(性價比更高,Agent 跑分已反超 Pro 預覽版);更深世界知識或複雜推理可暫用 V4-Pro 預覽版,等官方版上線後再評估。

現在能用上 V4 Pro 官方版嗎?

截至 2026 年 8 月 5 日不能。官方版僅有 V4-Flash-0731(API-only),App 與網頁端未同步。V4-Pro 官方版與 Harness 框架口徑為「盡快發布」,網上「8/10–20」等具體時間為未經證實的傳言。

DeepSeek 公布的跑分能直接相信嗎?

建議區分對待:SWE-bench Verified 等第三方基準可信度較高;Terminal Bench 2.0 等 Agent 跑分基於未公開的 Harness 測得,官方亦提示對框架選擇高度敏感,建議等社群用 Claude Code、Cursor 等獨立復現後再下結論。

如何在生產環境 7×24 執行 DeepSeek V4 Agent?

建議在專用 Mac 雲主機上部署 OpenClaw Gateway 或多模型路由,避免筆電睡眠中斷長 Agent 工作階段。查看MACCOME Mac 雲租用方案取得節點配置與定價。