対象読者:AI 開発者、個人開発者、API 選定と移行を担当する企業の技術責任者、オープンソース大規模モデルに関心のある Agent エンジニアです。2026 年 7 月 20 日、DeepSeek V4 本番版(GA)が正式公開されました。4 月のプレビュー版から Agent・数学推論・コード生成が強化され、初めてピーク/オフピーク料金が導入されています。本記事で得られるもの:完全タイムライン、V4-Pro / V4-Flash 仕様、CSA / HCA / mHC / Muon アーキテクチャ解説、SWE-bench ベンチマーク、116 倍コスト比分析、3 モデル比較マトリクス、料金表と節約策、7 月 24 日 API 移行マッピングとコード例、6 ステップ Runbookです。構成:課題 → タイムライン → アーキテクチャ → ベンチマーク → コスパ → 比較マトリクス → ピーク/オフピーク → 移行 → Runbook → まとめ。ローカル推論の判断はDeepSeek V4 Flash ローカル vs クラウドレンタルをご参照ください。
TL;DR — 30 秒結論
deepseek-chat と deepseek-reasoner が永久停止。期限前に API を更新してください。DeepSeek V4 GA 公開後、エンジニアリングチームは次の 6 つの盲点に直面しています。「安くて強い」ことは分かっていても、新料金体系と移行期限を本番運用に落とし込めないのです。
deepseek-chat と deepseek-reasoner が永久停止。未更新のコードは即座にサービス中断につながります。以下では、公式ドキュメント、arXiv:2606.19348、Artificial Analysis のデータを用いて、上記 6 点を順に解消します。
| 時期 | 出来事 |
|---|---|
| 2026 年 4 月 24 日 | V4 プレビュー公開 + OSS(MIT)。V4-Pro(1.6T)と V4-Flash(284B)を含む |
| 2026 年 5 月 | 本番チューニング版公開、API 正式利用可能 |
| 2026 年 6 月 | V4-Pro 出力価格を 75% 永久値下げ($0.87/M tokens) |
| 2026 年 6 月 29 日 | DeepSeek が API ユーザーに GA(7 月中旬)とピーク/オフピーク料金をメール通知 |
| 2026 年 7 月 19 日 | 複数開発者が GA グレーンテスト資格を取得、メディアが「本番版は明日公開」と報道 |
| 2026 年 7 月 20 日 | GA 本番版公開(本記事公開日) |
| 2026 年 7 月 24 日 | 旧名 deepseek-chat / deepseek-reasoner 永久停止 |
一言まとめ:アーキテクチャは変更なし。GA はプレビュー版の Agent 能力・数学推論・コード生成を強化し、正式な商用料金体系を整備したリリースです。
| 仕様 | V4-Pro | V4-Flash |
|---|---|---|
| 総パラメータ数 | 1.6 兆(1.6T) | 2,840 億(284B) |
| トークンあたりアクティブ | 490 億(49B) | 130 億(13B) |
| Transformer 層数 | 61 層 | 43 層 |
| コンテキストウィンドウ | 1,000,000 tokens | 1,000,000 tokens |
| 最大出力 | 384K tokens | 384K tokens |
| 精度 | FP4(エキスパート)+ FP8(その他) | FP4 + FP8 混合 |
| 事前学習データ量 | 33T+ tokens | 32T+ tokens |
| ライセンス | MIT | MIT |
従来 Transformer の KV キャッシュメモリはコンテキスト長に比例して増加し、1M token は実質不可能でした。DeepSeek V4 は V2/V3 の MLA を廃止し、2 種類の新注意機構を組み合わせています。
総合効果:1M token 下で KV キャッシュメモリは V3.2 の 10%(Flash は 7%)。
標準残差接続をアップグレード。4 チャネル残差ストリームと双確率行列制約(Birkhoff 多面体)の混合行列により、61 層の深いネットワークでも信号が安定伝播します。
AdamW ではなく Muon で学習。Newton-Schulz 直交化で勾配を処理し、収束が速く、学習が安定します。
| モード | 特徴 | 適用シーン |
|---|---|---|
| Non-think | 思考チェーンなし、高速応答 | 単純 Q&A、ルーティング |
| Think High | 明示推論(<redacted_thinking> タグ) | 中程度の複雑タスク、デバッグ |
| Think Max | 最大推論強度、384K+ コンテキスト必要 | 複雑数学、長チェーン Agent |
公式推奨サンプリング:temperature=1.0, top_p=1.0(全モード共通)。
| ベンチマーク | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6%(OSS 最高) | 96.0% | 個別未公開 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified は実 GitHub リポジトリのバグ修正テストです。80.6% は現時点の OSS 最高で、Gemini 3.1 Pro と並びます。より厳しい SWE-bench Pro では Claude Fable 5 が 80.3% でリードしています。
Artificial Analysis の Strategy & Ops 指数タスクでは次の結果です。
Fable 5 のコストは V4-Pro の 116 倍ですが、スコア差は約 12 点(31%)です。多くの本番シーンでは V4-Pro のコスパが突出しています。OpenRouter シェア変化はOpenRouter 6 月ランキング分析をご参照ください。
| 次元 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| オープンソース | MIT | クローズド | クローズド |
| 自ホスト | 可能 | 不可 | 不可 |
| コンテキスト | 1M tokens | 未公開 | 1M tokens |
| コード能力 | 極めて高い(Fable 5 に近い) | 極めて高い | 最高 |
| API 出力(オフピーク) | $0.87/M tokens | ~$15/M | $50/M |
| API 出力(ピーク) | $1.74/M tokens | — | — |
| Agent 能力 | 強、マルチ Agent 対応 | 強 | 最強 |
| データプライバシー | プライベートデプロイ可 | 不可 | 不可 |
シーン別選定:予算重視 / 高頻度呼び出し / プライベートデプロイ → V4-Pro または V4-Flash。最高コード性能 → Claude Fable 5。複雑アルゴリズム + 数学 → GPT-5.6 Sol / Ultra。大規模ログ処理 → V4-Flash(キャッシュヒット入力 $0.0028/M)。コーディングアシスタント比較はAI コーディングアシスタント選定マトリクスをご覧ください。
GA 版で最も注目される変更です。DeepSeek は初めて時間帯別料金を導入しました。ピーク時間帯(北京時間):平日 09:00–12:00 と 14:00–18:00、料金 2 倍。
| モデル | 項目 | オフピーク | ピーク |
|---|---|---|---|
| V4-Pro | 入力(キャッシュヒット) | ¥0.025 / $0.0035 / 1M | 2 倍 |
| V4-Pro | 入力(キャッシュミス) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 |
| V4-Pro | 出力 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 |
| V4-Flash | 入力(キャッシュヒット) | ¥0.02 / $0.0028 / 1M | 2 倍 |
| V4-Flash | 入力(キャッシュミス) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 |
| V4-Flash | 出力 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
4 つの節約策:
ピーク時でも V4-Pro 出力($1.74/M)は Claude Opus 4.8($15/M)より 8.6 倍安価です。
旧モデル名 deepseek-chat と deepseek-reasoner は 2026 年 7 月 24 日 15:59 UTC(北京時間 23:59) に永久停止します。
| 旧モデル名 | 新モデル名 | 備考 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(非思考モード) | 高速、軽量タスク向け |
deepseek-reasoner | deepseek-v4-flash(思考モード) | または deepseek-v4-pro へアップグレード |
OpenAI SDK 例(Python):
# 旧写法(7 月 24 日以降失効)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
# 新写法
client.chat.completions.create(
model="deepseek-v4-pro", # または deepseek-v4-flash
messages=[...],
# extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
Anthropic SDK 互換:V4 は OpenAI ChatCompletions と Anthropic Messages の両形式に対応。base_url は変更せず、model のみ更新します。
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
重要:本番環境で deepseek-chat または deepseek-reasoner を使用している場合、7 月 24 日前にステージングテストとデプロイを完了してください。未更新のままではサービスが中断します。
deepseek-chat と deepseek-reasoner を全体検索し、呼び出し箇所をリスト化します。deepseek-v4-flash。推論タスク → Flash 思考モードまたは deepseek-v4-pro。DeepSeek V4 GA は 2026 年 OSS 大規模モデル分野で最も重要なマイルストーンの一つです。その価値は Claude Fable 5 や GPT-5.6 を上回ること(現時点ではまだ)ではなく、クローズド旗艦の 1/10 から 1/100 のコストで OSS 最高性能を提供することにあります。データ越境を避けたい企業、予算の限られた個人開発者、1M token コンテキストが必要な Agent エンジニアにとって、V4-Pro は現在最もバランスの取れた選択です。
ただし本番環境で DeepSeek V4 駆動の Agent ワークフロー(OpenClaw Gateway やマルチモデルハイブリッドルーティング)を安定稼働させる場合、ローカル MacBook では 3 つの構造的ボトルネックに直面します。
DeepSeek V4 + マルチモデル Agent スタックを安定稼働させるには、MACCOME Mac クラウドホストが本物の macOS、SSH 引き渡し、隔離環境を提供し、Agent を専用ノードで 7×24 実行できます。公開プランはMac mini クラウドレンタル料金をご覧ください。
注目タイムライン:7 月 24 日(旧 API 停止)→ ピーク/オフピーク料金全面適用 → GA 後続最適化の告知を継続監視。
データ出典:DeepSeek 公式ドキュメント、arXiv:2606.19348、Hugging Face モデルページ、Artificial Analysis、LLMReference。2026 年 7 月 20 日時点。
FAQ
deepseek-chat 停止後はどう移行すればよいですか?
deepseek-chat を deepseek-v4-flash(非思考モード)へ、deepseek-reasoner を Flash 思考モードまたは deepseek-v4-pro へ置き換えてください。旧名は 2026 年 7 月 24 日 23:59(北京時間)に永久停止します。
DeepSeek V4 のピーク/オフピーク料金はどう計算されますか?
平日 09:00–12:00 と 14:00–18:00(北京時間)がピークで料金 2 倍です。V4-Pro オフピーク出力は $0.87/M tokens、ピークは $1.74/M。非リアルタイムタスクをオフピークに回すと約 50% 節約できます。
V4-Pro と V4-Flash はどちらを選ぶべきですか?
V4-Pro(1.6T、49B アクティブ)は複雑推論・Agent・コード生成向けです。V4-Flash(284B、13B アクティブ)は高頻度軽量タスクとルーティング向けで、キャッシュヒット入力は $0.0028/M のみです。
DeepSeek V4 と GPT-5.6 はどう比較されますか?
V4-Pro は LiveCodeBench と Codeforces でリード、GPT-5.6 Sol は Terminal-Bench で優位です。コスト面では V4-Pro 出力 $0.87/M vs GPT-5.6 約 $15/M、約 17 倍差。詳細は上記 3 モデル比較マトリクスをご参照ください。
7 月 24 日以降はどうなりますか?
deepseek-chat または deepseek-reasoner を使った API 呼び出しはエラーを返します。期限前に deepseek-v4-flash または deepseek-v4-pro へ更新し、ステージングテストを完了してください。
本番環境で DeepSeek V4 Agent を 7×24 稼働させるには?
専用 Mac クラウドホストに OpenClaw Gateway またはマルチモデルルーターをデプロイし、ノート PC のスリープによる長セッション中断を避けることを推奨します。MACCOME Mac クラウドレンタルプランでノード構成と料金をご確認ください。