适用读者:AI 开发者、Agent 工程师、需 API 选型与成本控制的企业技术负责人。2026 年 7 月 31 日,DeepSeek 将 V4-Flash 升级为官方版 0731:参数规模不变,仅重训后训练,Agent 跑分反超自家更大的 V4-Pro 预览版,价格仅为 Claude Opus 4.8 的几十分之一。你将获得:完整时间线、五方定价对比表、Harness 框架解读、Artificial Analysis 横向对比、跑分争议边界与六步落地 Runbook。结构:痛点 → 时间线 → 定价矩阵 → 架构拆解 → 竞品混战 → 争议点 → Runbook → 收束转化。7/20 GA 与峰谷计费见V4 满血版发布文;Kimi K3 对比见K3 开源权重文。
TL;DR — 30 秒结论
7/31 官方版上线后,技术团队普遍卡在以下六个盲区——每一项都直接影响 API 账单与 Agent 落地质量:
| 时间 | 事件 |
|---|---|
| 2026-04-24 | V4 预览版发布并开源:V4-Pro(1.6T / 49B 激活)与 V4-Flash(284B / 13B 激活),均支持 1M 上下文,MIT 协议 |
| 2026-07-24 | 旧接口 deepseek-chat 与 deepseek-reasoner 正式停用,全部流量切换至 V4 系列命名 |
| 2026-07-27 | 月之暗面 Kimi K3(2.8T)开源权重上线 Hugging Face,给 DeepSeek 制造竞争压力 |
| 2026-07-31 | V4-Flash-0731 官方版进入 API 公测,开源权重同步上线;changelog 首次点名自研 Agent 框架「Harness」 |
| 2026-08-02 | 阿里 Qwen3.8-Max API GA(权重待放出),中国开源阵营竞争进一步加剧 |
| 2026-08-05(发稿时) | V4-Pro 官方版仍未发布;Harness 框架未公开;App / 网页端未同步 0731 版本 |
以下定价均为厂商公开数据(截至 2026-08-05),属于「厂商自报」信息;GLM-5.2 部分字段未在本文核实范围内。
| 模型 | 状态 | 总参数 / 激活 | 上下文 | 输入(未命中/命中,$/M) | 输出($/M) | 协议 |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | 官方正式版 | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| V4-Pro | 预览版 | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 权重开源 | 2.8T / ~104B(社区估算) | ~1.05M | $3.00 / $0.30 | $15.00 | Modified MIT |
| GLM-5.2 | 开源 | ~744B / ~40B | 1M | 未核实 | 未核实 | MIT |
| Qwen3.8-Max | API GA | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | 承诺开源 |
| GPT-5.6 Sol | 闭源 | 未公开 | — | — | — | 闭源 |
| Claude Fable 5 | 闭源 | 未公开 | 1M | — | ~$50 | 闭源 |
这次最容易被忽略、但其实最关键的一点:V4-Flash-0731 在参数规模与模型结构上与 4 月预览版完全相同,性能提升完全来自重新进行的后训练。284B 总参数、13B 激活参数的 Flash 版本,在多项 Agent 基准上反而超过了参数量大好几倍的 V4-Pro 预览版——印证 2026 年下半年「后训练质量」正在逼近甚至超过「单纯堆参数」的行业趋势。
根据技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列架构三处关键改动:
7/31 changelog 首次正式出现 DeepSeek Harness——自研 Agent 执行框架,用于读写文件、调用工具、执行命令、完成端到端工程任务,对标 Claude Code。在此之前,DeepSeek 模型主要依赖 Claude Code、OpenCode 等第三方 Agent 工具。
官方公开的 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部基于 Harness「极简模式」(minimal mode)测得,参数为 max 档位、top_p=0.95、temperature=1.0。DeepSeek 在 changelog 中主动提示:「跑分对 harness 选择非常敏感,不能简单等同于模型本身能力的提升。」
| 模型 | 实验室 | Intelligence Index(第三方) | 单任务平均成本(第三方) |
|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 50 | $0.03 |
| Kimi K3 | 月之暗面 | 57 | $0.86 |
| GLM-5.2 | 智谱/Z.ai | 比 Flash 高约 1 分 | 未核实 |
| GPT-5.6 Sol | OpenAI | 比 Flash 高 9+ 分 | $1.86 |
| Claude Fable 5 | Anthropic | 比 Flash 高 9+ 分 | $3.15 |
数据来源:Artificial Analysis 独立评测,经财经媒体转引;与 DeepSeek 厂商自报 Agent 跑分(Terminal Bench 2.0 等)方法论不同,不可直接相加比较。
有意思的反差:V4-Flash 智能分并非最高(落后于 Kimi K3、GLM-5.2),但单任务成本仅为 Kimi K3 的约 1/29、GPT-5.6 Sol 的约 1/62、Claude Fable 5 的约 1/105。DeepSeek 打的不是「跑分第一」,而是「够用的智能 + 极致的价格」——这也解释了预览版为何能在 OpenRouter 连续七周稳坐调用量第一。
V4-Pro 跳票期间,中文 AI 社区曾把创始人梁文锋戏称为「梁白开」(谐音「白等」);Flash-0731 超预期后,昵称又翻回「梁圣」。更值得关注的是社区流传的「斩杀线」概念:DeepSeek 以「够用性能 + 极端低价」设下市场门槛——友商若性能无明显超越、又拿不出更低价格,便可能失去存在感。这也解释了同期 OpenAI GPT-5.6 Luna 一次性降价 80% 等密集调价动作(详见OpenAI 降价文)。
7/31 上线当天,英伟达、博通、AMD 等算力股未出现明显波动——与 2025 年初 DeepSeek-R1 引发全球 AI 芯片股下跌形成鲜明对比,市场似乎已习惯「DeepSeek 式效率突破」叙事。
deepseek-v4-flash 会自动指向 0731 官方版;若仍用已停用的 deepseek-chat,立即切换(迁移细节见GA 迁移指南)。from openai import OpenAI
client = OpenAI(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
# deepseek-v4-flash 自动指向 0731 官方版
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "分析这段 Agent 日志..."}],
)
DeepSeek V4-Flash-0731 的价值不在于击败 Claude Fable 5 或 GPT-5.6 Sol 的绝对智能上限,而在于以闭源旗舰 1/36 至 1/179 的价格,为大规模 Agent 与批量任务提供「够用」的开源选择。对预算敏感、需私有部署或高频调用的团队,Flash 正式版是目前性价比最突出的选项之一。
但若要在生产环境稳定运行 DeepSeek V4 驱动的 Agent 工作流(OpenClaw Gateway、Harness 未来接入或多模型混合路由),仍会遇到三个结构性瓶颈:
若要稳定运行 DeepSeek V4 + 多模型 Agent 混合栈,MACCOME Mac 云主机提供真实 macOS、SSH 交接与隔离环境,让 Agent 在专用节点 7×24 运行。公开方案请见Mac mini 云租用价格。
数据来源:DeepSeek 官方 API 文档与 changelog、技术报告、Hugging Face 模型卡、Artificial Analysis(经财经媒体转引)、21 世纪经济报道、V2EX 社区讨论。所有数据截至 2026 年 8 月 5 日,发布前请核实最新定价与 V4-Pro / Harness 上线状态。
常见问题
DeepSeek V4 和 V3.2 相比最大的区别是什么?
原生支持 100 万 token 上下文,长上下文场景下 FLOPs 仅为 V3.2 的 27%、KV Cache 仅为 10%;V4 系列在 Agent 能力上做了专项优化,适配 Claude Code、OpenCode 等主流 Agent 工具。
日常使用应该选 V4 Flash 还是 V4 Pro?
普通对话、批量处理或 Agent 流水线优先 V4-Flash-0731 官方版(性价比更高,Agent 跑分已反超 Pro 预览版);更深世界知识或复杂推理可暂用 V4-Pro 预览版,等官方版上线后再评估。
现在能用上 V4 Pro 官方版吗?
截至 2026 年 8 月 5 日不能。官方版仅有 V4-Flash-0731(API-only),App 与网页端未同步。V4-Pro 官方版与 Harness 框架口径为「尽快发布」,网上「8/10–20」等具体时间为未经证实的传言。
DeepSeek 公布的跑分能直接相信吗?
建议区分对待:SWE-bench Verified 等第三方基准可信度较高;Terminal Bench 2.0 等 Agent 跑分基于未公开的 Harness 测得,官方亦提示对框架选择高度敏感,建议等社区用 Claude Code、Cursor 等独立复现后再下结论。
如何在生产环境 7×24 运行 DeepSeek V4 Agent?
推荐在专用 Mac 云主机上部署 OpenClaw Gateway 或多模型路由,避免笔记本睡眠中断长 Agent 会话。查看MACCOME Mac 云租用方案获取节点配置与定价。