适用读者:AI 开发者、独立开发者、需 API 选型与迁移的企业技术负责人,以及关注开源大模型的 Agent 工程师。📌 2026 年 7 月 20 日,DeepSeek V4 满血版(GA 正式版)正式上线——在 4 月预览版基础上完成 Agent、数学与代码专项调优,并首次引入峰谷计费。你将获得:完整时间线、V4-Pro / V4-Flash 架构表(CSA / HCA / mHC / Muon)、SWE-bench Verified 80.6% 基准对比、与 GPT-5.6 / Claude Fable 5 决策矩阵、峰谷价格表与四条省钱策略、7 月 24 日 API 迁移代码示例。结构:痛点 → 时间线 → 架构 → Benchmark → 对比 → 峰谷计费 → 迁移 → Runbook → 收束转化。6 月降价背景见AI 大模型降价盘点;编程助手选型见决策矩阵。
TL;DR — 30 秒结论
deepseek-chat → deepseek-v4-flash;deepseek-reasoner → Flash 思考模式或 deepseek-v4-pro。DeepSeek V4 预览版自 4 月上线以来已是开源标杆,但 GA 正式版引入峰谷计费与接口下线时间表后,技术团队普遍卡在以下六个盲区:
下文用官方文档、基准数据与定价算术,把上述六个盲区逐一填平。
等了整整三个月,V4 从 MIT 开源预览走向 GA 正式版。关键节点如下:
| 时间 | 事件 |
|---|---|
| 2026-04-24 | V4 预览版上线 + MIT 开源,含 V4-Pro(1.6T)与 V4-Flash(284B) |
| 2026-05 | 生产调优版本上线,API 正式可用 |
| 2026-06 | V4-Pro 永久降价 75%,输出定格 $0.87/M tokens(详见6 月降价盘点) |
| 2026-06-29 | DeepSeek 向全体 API 用户发邮件,宣布 GA 将于 7 月中旬上线,首次披露峰谷计费方案 |
| 2026-07-19 | 多位开发者获得 GA 灰度内测资格 |
| 2026-07-20 | GA 正式版上线(本文发布日) |
| 2026-07-24 | 旧接口 deepseek-chat 与 deepseek-reasoner 永久下线(15:59 UTC / 北京时间 23:59) |
一句话总结:预览版已经很强,满血版在此基础上做了 Agent 能力、数学推理和代码生成的专项提升,同时配套了正式的商业化计费体系。OpenRouter 上中国模型的份额变化,可参考6 月排行榜深度分析。
| 规格 | V4-Pro | V4-Flash |
|---|---|---|
| 总参数量 | 1.6 万亿(1.6T) | 2840 亿(284B) |
| 每 Token 激活参数 | 490 亿(49B) | 130 亿(13B) |
| Transformer 层数 | 61 层 | 43 层 |
| 上下文窗口 | 1,000,000 tokens | 1,000,000 tokens |
| 最大输出 | 384K tokens | 384K tokens |
| 精度 | FP4(专家权重)+ FP8(其余) | FP4 + FP8 混合 |
| 预训练数据量 | 33T+ tokens | 32T+ tokens |
| 开源协议 | MIT | MIT |
传统 Transformer 的 KV Cache 随上下文长度线性增长,1M token 在 V2/V3 时代几乎不可行。DeepSeek V4 抛弃 MLA,采用三项关键革新:
升级传统残差连接为 4 通道残差流,通过满足双随机矩阵约束(Birkhoff 多面体)的混合矩阵,确保 61 层深网络中信号稳定传播——更深的网络,更稳定的训练。
训练采用 Muon 优化器(非 AdamW),通过牛顿-舒尔茨正交化处理梯度,收敛更快、训练更稳定。
| 模式 | 特点 | 适用场景 |
|---|---|---|
| Non-think | 无思维链,极速响应 | 简单问答、路由分发、意图识别 |
| Think High | 显式推理(<redacted_thinking> 标签) | 中等复杂任务、代码调试 |
| Think Max | 最大推理力度,需 384K+ 上下文 | 复杂数学、长链路 Agent |
官方推荐采样参数(全模式通用):temperature=1.0,top_p=1.0。
V4-Pro 核心评测数据(与 Claude Fable 5、GPT-5.6 Ultra、Claude Opus 4.8 横向对比):
| 基准测试 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% ★ 开源最高 | 96.0% | 未单独公布 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
解读重点:SWE-bench Verified 测的是「真实 GitHub 仓库 Bug 修复」,80.6% 与 Gemini 3.1 Pro 并列开源最高;SWE-bench Pro 更严格,Fable 5 的 80.3% 目前领先。LiveCodeBench 与 Codeforces Elo 上 V4-Pro 全面第一。
根据 Artificial Analysis 评测数据:
Fable 5 成本是 V4-Pro 的 116 倍,得分仅高出约 12 分(31%)。对大多数生产场景,V4-Pro 的性价比无可匹敌。
| 维度 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 开源 | ✅ MIT 协议 | ❌ 闭源 | ❌ 闭源 |
| 可自托管 | ✅ 支持 | ❌ | ❌ |
| 上下文窗口 | 1M tokens | 未公开 | 1M tokens |
| 代码能力 | 极强(接近 Fable 5) | 极强 | 最强 |
| API 输出价(非高峰) | $0.87/M | ~$15/M | $50/M |
| 峰值输出价 | $1.74/M | — | — |
| Agent 能力 | 强,支持多 Agent 编排 | 强 | 最强 |
| 数据隐私 | ✅ 可私有部署 | ❌ | ❌ |
| 场景 | 推荐模型 | 原因 |
|---|---|---|
| 预算有限 / 高频调用 / 私有部署 | V4-Pro 或 V4-Flash | 输出 $0.87/M(Pro)或 $0.28/M(Flash),MIT 可自托管 |
| 极致代码能力、不在乎成本 | Claude Fable 5 | SWE-bench Pro 80.3% 最高分 |
| 复杂算法 + 数学推理 | GPT-5.6 Sol / Ultra | GPQA 与深度推理领先 |
| 超大规模日志/文档处理 | V4-Flash | 缓存命中输入仅 $0.0028/M,接近免费 |
| 终端密集型 Agent | GPT-5.6 Sol | Terminal-Bench 2.1 85.1% 领先 V4-Pro |
| 128GB Mac 本地推理 | V4-Flash(ds4) | 详见ds4 本地 vs 云租决策文 |
GA 版本最受关注的变化——DeepSeek 首次引入峰谷差异化定价,类似电网分时电价。高峰时段(北京时间):工作日 09:00–12:00 和 14:00–18:00,价格翻倍。
| 模型 | 计费项 | 非高峰(Off-Peak) | 高峰(Peak) |
|---|---|---|---|
| V4-Pro | 输入(缓存命中) | ¥0.025 / $0.0035 / 1M | 翻倍 |
| 输入(缓存未命中) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 / 1M | |
| 输出 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 / 1M | |
| V4-Flash | 输入(缓存命中) | ¥0.02 / $0.0028 / 1M | 翻倍 |
| 输入(缓存未命中) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 / 1M | |
| 输出 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 / 1M |
即使在高峰期,V4-Pro 输出 $1.74/M 仍比 Claude Opus 4.8($15/M)便宜 8.6 倍,比 GPT-5.6 Sol(约 $15/M)同等倍数。
旧模型名 deepseek-chat 和 deepseek-reasoner 将于 2026 年 7 月 24 日 15:59 UTC(北京时间 23:59) 永久停止访问。
| 旧模型名 | 新模型名 | 备注 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(Non-think) | 速度快,适合轻量任务 |
deepseek-reasoner | deepseek-v4-flash(Think High) | 或升级 deepseek-v4-pro 获取更强推理 |
Python OpenAI SDK 示例:
from openai import OpenAI
client = OpenAI(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
# ❌ 旧写法(7 月 24 日后失效)
# client.chat.completions.create(model="deepseek-chat", messages=[...])
# ✅ 新写法
response = client.chat.completions.create(
model="deepseek-v4-pro", # 或 deepseek-v4-flash
messages=[{"role": "user", "content": "分析这段代码..."}],
# 控制思考模式:
# extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
Anthropic SDK 兼容写法(base_url 不变,仅更新 model):
import anthropic
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
deepseek-chat 与 deepseek-reasoner,列出所有服务与 Cron 任务。deepseek-v4-flash(Non-think);推理任务 → Flash Think High 或 deepseek-v4-pro。DeepSeek V4 GA 正式版是 2026 年开源大模型领域最重要的里程碑之一。它的价值不在于能否击败 Claude Fable 5 或 GPT-5.6(暂时还不能),而在于以闭源旗舰 1/10 乃至 1/100 的成本,提供开源模型中无可争议的最强性能。对于不想数据出境的企业、预算有限的独立开发者、需要 1M token 上下文的 Agent 工程师,V4-Pro 是目前性价比最均衡的选择。
但若要在生产环境稳定运行 DeepSeek V4 驱动的 Agent 工作流(OpenClaw Gateway、多模型混合路由或 Kimi Code 混合栈),本地 MacBook 仍会遇到三个结构性瓶颈:
若要稳定运行 DeepSeek V4 + 多模型 Agent 混合栈,MACCOME Mac 云主机提供真实 macOS、SSH 交接与隔离环境,让 Agent 在专用节点 7×24 运行。公开方案请见Mac mini 云租用价格。
关注时间节点:7 月 20 日(GA 上线)→ 7 月 24 日 23:59(旧接口下线,务必完成迁移)。
数据来源:DeepSeek 官方文档、arXiv:2606.19348、HuggingFace 模型页、Artificial Analysis、LLMReference。基准为 DeepSeek 自报与第三方汇总数据,截止 2026 年 7 月 20 日。
常见问题
DeepSeek V4 满血版和 4 月预览版有什么区别?
架构不变(V4-Pro 1.6T / V4-Flash 284B,MIT 开源),GA 版在 Agent、数学推理与代码生成上做了生产调优,并首次引入峰谷计费。旧接口 deepseek-chat 与 deepseek-reasoner 将于 2026 年 7 月 24 日 23:59(北京时间)永久下线。
峰谷计费的高峰时段是几点?
北京时间工作日 09:00–12:00 与 14:00–18:00 为高峰时段,输入/输出价格翻倍。非高峰时段 V4-Pro 输出 $0.87/M tokens,V4-Flash 输出 $0.28/M tokens。
deepseek-chat 应该迁移到哪个新模型?
deepseek-chat 迁移至 deepseek-v4-flash(Non-think 模式);deepseek-reasoner 迁移至 deepseek-v4-flash 思考模式,或升级 deepseek-v4-pro 获取更强推理。请在 7 月 24 日前完成代码更新。
DeepSeek V4-Pro 和 Claude Fable 5 怎么选?
Fable 5 在 SWE-bench Pro(80.3%)与 Terminal-Bench 2.1 上领先,但输出约 $50/M;V4-Pro 输出 $0.87/M(非高峰),同类任务成本约为 Fable 5 的 1/116。预算敏感或需私有部署选 V4-Pro/Flash;极致代码能力选 Fable 5。
V4-Flash 能在 Mac 上本地跑吗?
可以。128GB 统一内存 Mac 可通过 antirez ds4 引擎跑 V4-Flash q2 量化版;V4-Pro 需 512GB 级硬件或多卡 GPU 集群。详见ds4 本地 vs 云租决策文。
如何在生产环境 7×24 运行 DeepSeek V4 Agent?
推荐在专用 Mac 云主机上部署 OpenClaw Gateway 或多模型路由,避免笔记本睡眠中断长 Agent 会话。查看MACCOME Mac 云租用方案获取节点配置与定价。