DeepSeek V4 Flash 正式版评测:跑分逼近 Opus 4.8,价格却只要几十分之一

约 16 分钟阅读 · MACCOME · 最后更新:2026 年 8 月 5 日

适用读者:AI 开发者、Agent 工程师、需 API 选型与成本控制的企业技术负责人。2026 年 7 月 31 日,DeepSeek 将 V4-Flash 升级为官方版 0731:参数规模不变,仅重训后训练,Agent 跑分反超自家更大的 V4-Pro 预览版,价格仅为 Claude Opus 4.8 的几十分之一你将获得:完整时间线、五方定价对比表、Harness 框架解读、Artificial Analysis 横向对比、跑分争议边界与六步落地 Runbook。结构:痛点 → 时间线 → 定价矩阵 → 架构拆解 → 竞品混战 → 争议点 → Runbook → 收束转化。7/20 GA 与峰谷计费见V4 满血版发布文;Kimi K3 对比见K3 开源权重文

bolt

TL;DR — 30 秒结论

  • 不是新模型:284B / 13B 激活参数与 4 月预览版完全相同,性能提升完全来自后训练,而非扩大规模。
  • 价格碾压:输入 $0.14/M(缓存未命中)、输出 $0.28/M——约为 Opus 4.8 的 1/36 至 1/179(视缓存命中而定)。
  • Harness 首次亮相:DeepSeek 自研 Agent 框架对标 Claude Code,但尚未公开发布;官方 Agent 跑分均基于其「极简模式」测得。
  • V4-Pro 仍未 GA:截至 8/5 仅有 Flash-0731 官方版(API-only),Pro 官方版与 Harness 口径为「尽快发布」。
  • ⚠️ 跑分需审慎:Terminal Bench 2.0 的 82.7 分为厂商自报 + 特定框架结果,不宜直接套用到 Claude Code / Cursor 等第三方 Agent 环境。

六大痛点:Flash 正式版来了,但决策盲区还在

7/31 官方版上线后,技术团队普遍卡在以下六个盲区——每一项都直接影响 API 账单与 Agent 落地质量:

  1. 跑分依赖 Harness,官方自己都在提醒:Terminal Bench 2.0 的 82.7 分基于未公开的 Harness「极简模式」测得,不能简单等同于在 Claude Code 或 Cursor 中的通用能力。
  2. V4-Pro 官方版仍跳票:旗舰 1.6T 模型官方版无确切日期;媒体流传的「8/10–20 GA」均为未署名消息源,DeepSeek changelog 仅写「尽快发布」。
  3. API-only,App 未同步:0731 正式版仅限 API 公测,消费者 App 与网页端仍是旧版本——团队若混用多端,体验会不一致。
  4. 缓存命中率偏低:海外开发者社区反馈输入缓存命中率不理想,批量 Agent 循环的实际成本可能高于标价。
  5. 峰谷加价预告未生效:DeepSeek 已预告北京时间 9–12 点、14–18 点高峰时段 2 倍加价,但截至发稿未公布具体生效日期。
  6. 融资 IPO 传闻未证实:多家财经媒体援引「消息人士」报道约 74 亿美元融资与 IPO 筹备,尚无监管备案或官方声明。

时间线:从 4 月预览到 7 月 Flash 官方版

时间事件
2026-04-24V4 预览版发布并开源:V4-Pro(1.6T / 49B 激活)与 V4-Flash(284B / 13B 激活),均支持 1M 上下文,MIT 协议
2026-07-24旧接口 deepseek-chatdeepseek-reasoner 正式停用,全部流量切换至 V4 系列命名
2026-07-27月之暗面 Kimi K3(2.8T)开源权重上线 Hugging Face,给 DeepSeek 制造竞争压力
2026-07-31V4-Flash-0731 官方版进入 API 公测,开源权重同步上线;changelog 首次点名自研 Agent 框架「Harness」
2026-08-02阿里 Qwen3.8-Max API GA(权重待放出),中国开源阵营竞争进一步加剧
2026-08-05(发稿时)V4-Pro 官方版仍未发布;Harness 框架未公开;App / 网页端未同步 0731 版本

核心定价对比:Flash 正式版 vs 中国开源六方混战

以下定价均为厂商公开数据(截至 2026-08-05),属于「厂商自报」信息;GLM-5.2 部分字段未在本文核实范围内。

模型状态总参数 / 激活上下文输入(未命中/命中,$/M)输出($/M)协议
V4-Flash-0731官方正式版284B / 13B1M$0.14 / $0.0028$0.28MIT
V4-Pro预览版1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3权重开源2.8T / ~104B(社区估算)~1.05M$3.00 / $0.30$15.00Modified MIT
GLM-5.2开源~744B / ~40B1M未核实未核实MIT
Qwen3.8-MaxAPI GA2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00承诺开源
GPT-5.6 Sol闭源未公开闭源
Claude Fable 5闭源未公开1M~$50闭源

架构没变,后训练变强:CSA + HCA + mHC + Muon

这次最容易被忽略、但其实最关键的一点:V4-Flash-0731 在参数规模与模型结构上与 4 月预览版完全相同,性能提升完全来自重新进行的后训练。284B 总参数、13B 激活参数的 Flash 版本,在多项 Agent 基准上反而超过了参数量大好几倍的 V4-Pro 预览版——印证 2026 年下半年「后训练质量」正在逼近甚至超过「单纯堆参数」的行业趋势。

根据技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列架构三处关键改动:

  • 混合注意力(CSA + HCA):对外统一称为 DSA 稀疏注意力,在长上下文场景降低计算与显存开销;1M 上下文下 V4-Pro 单 token 推理 FLOPs 仅为 V3.2 的 27%,KV Cache 占用仅为 10%(厂商自报,尚未见独立第三方复现)。
  • 流形约束超连接(mHC):对传统残差连接结构改进,确保深层网络信号稳定传播。
  • Muon 优化器:替换传统 AdamW,提升训练收敛速度与稳定性。

Harness 框架:DeepSeek 对标 Claude Code 的 Agent 执行层

7/31 changelog 首次正式出现 DeepSeek Harness——自研 Agent 执行框架,用于读写文件、调用工具、执行命令、完成端到端工程任务,对标 Claude Code。在此之前,DeepSeek 模型主要依赖 Claude Code、OpenCode 等第三方 Agent 工具。

官方公开的 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部基于 Harness「极简模式」(minimal mode)测得,参数为 max 档位、top_p=0.95、temperature=1.0。DeepSeek 在 changelog 中主动提示:「跑分对 harness 选择非常敏感,不能简单等同于模型本身能力的提升。」

Artificial Analysis 横向对比:智能分不是最高,成本却最低

模型实验室Intelligence Index(第三方)单任务平均成本(第三方)
V4-Flash-0731DeepSeek50$0.03
Kimi K3月之暗面57$0.86
GLM-5.2智谱/Z.ai比 Flash 高约 1 分未核实
GPT-5.6 SolOpenAI比 Flash 高 9+ 分$1.86
Claude Fable 5Anthropic比 Flash 高 9+ 分$3.15

数据来源:Artificial Analysis 独立评测,经财经媒体转引;与 DeepSeek 厂商自报 Agent 跑分(Terminal Bench 2.0 等)方法论不同,不可直接相加比较

有意思的反差:V4-Flash 智能分并非最高(落后于 Kimi K3、GLM-5.2),但单任务成本仅为 Kimi K3 的约 1/29、GPT-5.6 Sol 的约 1/62、Claude Fable 5 的约 1/105。DeepSeek 打的不是「跑分第一」,而是「够用的智能 + 极致的价格」——这也解释了预览版为何能在 OpenRouter 连续七周稳坐调用量第一。

争议点:跑分好看,不代表没有水分

  • Agent 跑分为 Harness 依赖型:Terminal Bench 2.0 的 82.7 分(vs V4-Pro 预览版 67.9 分)基于未公开框架测得,待社区用 Claude Code、Cursor 等独立复现前,应视为「厂商自报 + 特定框架」结果。
  • 可用性问题存在:据 21 世纪经济报道援引海外开发者反馈,正式版存在输入缓存命中率偏低、安全分类器偶发超时等问题。
  • V4-Pro / Harness 上线时间未证实:中文媒体流传的「8/10–20 GA」均为未署名消息源,以 DeepSeek 官方「尽快发布」为准。
  • 融资传闻需谨慎:约 74 亿美元融资、487 亿美元估值等数字目前主要来自财经媒体「据报道」,尚无监管备案直接确认。

「斩杀线」与社区情绪:从「梁白开」到「梁圣」

V4-Pro 跳票期间,中文 AI 社区曾把创始人梁文锋戏称为「梁白开」(谐音「白等」);Flash-0731 超预期后,昵称又翻回「梁圣」。更值得关注的是社区流传的「斩杀线」概念:DeepSeek 以「够用性能 + 极端低价」设下市场门槛——友商若性能无明显超越、又拿不出更低价格,便可能失去存在感。这也解释了同期 OpenAI GPT-5.6 Luna 一次性降价 80% 等密集调价动作(详见OpenAI 降价文)。

7/31 上线当天,英伟达、博通、AMD 等算力股未出现明显波动——与 2025 年初 DeepSeek-R1 引发全球 AI 芯片股下跌形成鲜明对比,市场似乎已习惯「DeepSeek 式效率突破」叙事。

六步落地 Runbook:从评估到生产路由

  1. 确认模型指向:API 调用 deepseek-v4-flash 会自动指向 0731 官方版;若仍用已停用的 deepseek-chat,立即切换(迁移细节见GA 迁移指南)。
  2. Staging 对比质量:用真实 Prompt 子集对比 0731 与预览版输出,重点关注 Agent 工具调用格式与长上下文稳定性。
  3. 分层路由 Flash / Pro:批量处理、路由分发用 Flash($0.28/M 输出);复杂推理暂用 V4-Pro 预览版,等官方版 GA 后再评估切换。
  4. 监控缓存命中率:固定 System Prompt 的 Agent 循环启用 Prompt Cache;若命中率偏低,实际成本会显著高于标价。
  5. 预留峰谷调度:非实时批量任务安排在预告的高峰时段(9–12、14–18 北京时间)之外执行。
  6. 本地 vs 云端决策:128GB Mac 可通过 ds4 跑 Flash q2 量化版;生产 Agent 需 7×24 常驻节点——详见ds4 本地 vs 云租决策文
python
from openai import OpenAI

client = OpenAI(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)

# deepseek-v4-flash 自动指向 0731 官方版
response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "分析这段 Agent 日志..."}],
)

三组值得引用的硬数据

  • 82.7 vs 67.9 — Terminal Bench 2.0:V4-Flash-0731 厂商自报得分反超 V4-Pro 预览版(Harness 极简模式,待独立复现)
  • 27% / 10% — 1M 上下文下 V4-Pro 推理 FLOPs 与 KV Cache 相对 V3.2 的占比(DeepSeek 技术报告自报)
  • 1/29 ~ 1/105 — V4-Flash 单任务成本相对 Kimi K3 / GPT-5.6 Sol / Claude Fable 5 的倍数(Artificial Analysis 第三方数据)

收束:够用智能 + 极致价格,但生产 Agent 仍需稳定底座

DeepSeek V4-Flash-0731 的价值不在于击败 Claude Fable 5 或 GPT-5.6 Sol 的绝对智能上限,而在于以闭源旗舰 1/36 至 1/179 的价格,为大规模 Agent 与批量任务提供「够用」的开源选择。对预算敏感、需私有部署或高频调用的团队,Flash 正式版是目前性价比最突出的选项之一。

但若要在生产环境稳定运行 DeepSeek V4 驱动的 Agent 工作流(OpenClaw Gateway、Harness 未来接入或多模型混合路由),仍会遇到三个结构性瓶颈:

  • 笔记本睡眠中断:合盖或 Wi-Fi 切换切断长时间 Agent 会话,已消耗 Token 无法退还;
  • 缓存与峰谷难落地:本地 Cron 受睡眠策略影响,非高峰批量任务无法可靠执行;
  • 无 7×24 路由中枢:Flash / Pro / Fable 5 混合策略需要常驻 Gateway 按任务类型分发,笔记本不适合做调度节点。

若要稳定运行 DeepSeek V4 + 多模型 Agent 混合栈,MACCOME Mac 云主机提供真实 macOS、SSH 交接与隔离环境,让 Agent 在专用节点 7×24 运行。公开方案请见Mac mini 云租用价格

数据来源:DeepSeek 官方 API 文档与 changelog、技术报告、Hugging Face 模型卡、Artificial Analysis(经财经媒体转引)、21 世纪经济报道、V2EX 社区讨论。所有数据截至 2026 年 8 月 5 日,发布前请核实最新定价与 V4-Pro / Harness 上线状态。

常见问题

DeepSeek V4 和 V3.2 相比最大的区别是什么?

原生支持 100 万 token 上下文,长上下文场景下 FLOPs 仅为 V3.2 的 27%、KV Cache 仅为 10%;V4 系列在 Agent 能力上做了专项优化,适配 Claude Code、OpenCode 等主流 Agent 工具。

日常使用应该选 V4 Flash 还是 V4 Pro?

普通对话、批量处理或 Agent 流水线优先 V4-Flash-0731 官方版(性价比更高,Agent 跑分已反超 Pro 预览版);更深世界知识或复杂推理可暂用 V4-Pro 预览版,等官方版上线后再评估。

现在能用上 V4 Pro 官方版吗?

截至 2026 年 8 月 5 日不能。官方版仅有 V4-Flash-0731(API-only),App 与网页端未同步。V4-Pro 官方版与 Harness 框架口径为「尽快发布」,网上「8/10–20」等具体时间为未经证实的传言。

DeepSeek 公布的跑分能直接相信吗?

建议区分对待:SWE-bench Verified 等第三方基准可信度较高;Terminal Bench 2.0 等 Agent 跑分基于未公开的 Harness 测得,官方亦提示对框架选择高度敏感,建议等社区用 Claude Code、Cursor 等独立复现后再下结论。

如何在生产环境 7×24 运行 DeepSeek V4 Agent?

推荐在专用 Mac 云主机上部署 OpenClaw Gateway 或多模型路由,避免笔记本睡眠中断长 Agent 会话。查看MACCOME Mac 云租用方案获取节点配置与定价。