DeepSeek V4 Vollversion (Juli 2026): Preise, Benchmarks & Vergleich mit GPT-5.6

Ca. 18 Min. Lesezeit · MACCOME · Aktualisiert: 20. Juli 2026

Zielgruppe: KI-Entwickler, FinOps-Leads und Engineering-Teams, die DeepSeek V4 GA (20. Juli 2026) fuer Agent-Pipelines, Coding und 1M-Token-Kontext evaluieren. Sie erhalten: Zeitlinie Preview bis GA, Architektur (CSA/HCA/mHC/Muon), Benchmark-Tabellen vs. GPT-5.6 Sol und Claude Fable 5, Spitzen-/Nebenzeiten-Preise, API-Migrationsmapping bis 24. Juli, Datenschutz-Hinweise fuer DSGVO-Teams, sechs Entscheidungsmodule und ein Sechs-Schritte-Runbook. Kontext: ds4 lokale Inferenz auf Mac, OpenRouter Juni-Rankings.

bolt

TL;DR — 30 Sekunden

  • GA am 20. Juli 2026: V4-Pro (1,6T) und V4-Flash (284B) produktionsreif; erstmals Spitzen-/Nebenzeiten-Tarif.
  • Benchmark: SWE-bench Verified 80,6 % — Open-Weight-Rekord; LiveCodeBench 93,5 % fuehrt vor Fable 5 und GPT-5.6.
  • Preis Nebenzeit: V4-Pro Output 0,87 USD/M; V4-Flash Output 0,28 USD/M — auch in Spitzenzeiten 8,6x guenstiger als GPT-5.6 Sol (~15 USD/M).
  • Migration bis 24. Juli: deepseek-chatdeepseek-v4-flash; deepseek-reasoner → Flash (Think) oder V4-Pro.
  • Datenschutz: MIT + Self-Hosting moeglich; API-Direct-Calls nach China erfordern AVV-Pruefung unter DSGVO.

Sechs Entscheidungsmodule: Wo GA-Teams scheitern

Nach dem Go-Live von DeepSeek V4 GA bleiben die meisten Teams an denselben sechs blinden Flecken haengen — nicht wegen fehlender Dokumentation, sondern weil Preview-, GA- und Legacy-Endpunkte parallel existieren:

  1. Modul 1 — Legacy-Endpunkt-Falle: Wenn Ihr Code noch deepseek-chat nutzt, dann bricht die Produktion am 24. Juli 23:59 Peking-Zeit ab — unabhaengig von GA-Performance.
  2. Modul 2 — Spitzenzeit-Rechnung: Wenn Batch-Jobs werktags 09–12 oder 14–18 Uhr Peking laufen, dann verdoppeln sich Input- und Output-Saetze — FinOps muss Cron-Zeitplan anpassen.
  3. Modul 3 — Pro vs. Flash Routing: Wenn jede Anfrage an V4-Pro geht, dann zahlen Sie 3x mehr Output als noetig; Flash fuer Routing/Intent, Pro fuer Reasoning ist die korrekte Wenn/Dann-Logik.
  4. Modul 4 — Benchmark-Missmatch: Wenn Sie nach SWE-bench Pro (80,3 % Fable 5) entscheiden, dann ist V4 Pro (55,4 %) zweite Wahl; wenn Sie nach Kosten pro Aufgabe ($0,03 vs. $3,48) entscheiden, dann gewinnt V4 Pro klar.
  5. Modul 5 — Kontext vs. KV-Realitaet: Wenn 1M Token nur auf dem Papier steht, pruefen Sie CSA/HCA: KV-Cache nur 10 % von V3.2 — sonst unterschaetzen Sie echte Durchsatzkosten.
  6. Modul 6 — Datenschutz-Routing: Wenn personenbezogene Codebasen ueber die oeffentliche API laufen, dann fehlt oft AVV und Datenresidenz — Self-Hosting (MIT) oder isolierter Gateway-Knoten ist die DSGVO-sichere Alternative.

Zeitlinie: Preview bis Vollversion

DatumEreignis
24. Apr. 2026V4-Preview + Open Weights (MIT): V4-Pro (1,6T) und V4-Flash (284B)
Mai 2026Produktions-tuned API fuer Pro und Flash live
Juni 2026V4-Pro Output dauerhaft -75 % (0,87 USD/M Nebenzeit)
29. Juni 2026E-Mail an API-Nutzer: GA Mitte Juli + Spitzen-/Nebenzeiten-Tarif
19. Juli 2026GA-Grauzonen-Zugang fuer ausgewaehlte Entwickler
20. Juli 2026GA Vollversion live
24. Juli 2026deepseek-chat / deepseek-reasoner endgueltig abgeschaltet (15:59 UTC)

Architektur: Pro, Flash und die vier Kern-Innovationen

SpezifikationV4-ProV4-Flash
Gesamtparameter1,6T284B
Aktiv pro Token49B13B
Layer6143
Kontext1M Token1M Token
Max. Output384K384K
PraezisionFP4 (MoE-Experten) + FP8FP4 + FP8
LizenzMITMIT

CSA + HCA: 1M Kontext ohne KV-Kollaps

Compressed Sparse Attention (CSA): KV-Sequenz 4x via Softmax-Gating komprimiert; FP4 Lightning Indexer waehlt top-1024 (Pro) bzw. top-512 (Flash); plus 128-Token Sliding Window.

Heavily Compressed Attention (HCA): 128x Kompression, dann globale Dense Attention — ergaenzt CSA fuer Fernabhaengigkeiten. Ergebnis bei 1M Token: nur 27 % Inference-FLOPs vs. V3.2; KV-Cache 10 % (Flash: 7 %).

mHC (Manifold-Constrained Hyper-Connections)

Vier-Kanal-Residualstrom mit doppelt-stochastischer Mischmatrix — stabilere Gradienten ueber 61 Layer vs. klassisches x = x + f(x).

Muon Optimizer

Newton-Schulz-Orthogonalisierung statt AdamW — schnellere Konvergenz bei 33T+ Pretraining-Tokens.

Drei Inferenz-Modi

ModusVerhaltenWenn/Dann-Einsatz
Non-thinkKeine Chain-of-ThoughtWenn Latenz kritisch → Routing, FAQ, Klassifikation
Think HighExplizites ReasoningWenn Debugging/Code-Review → mittlere Komplexitaet
Think MaxMaximale Reasoning-TiefeWenn Mathe/Agent-Ketten → 384K+ Kontext noetig

Empfohlene Sampling-Parameter (offiziell): temperature=1.0, top_p=1.0 — alle Modi.

Benchmarks: Open-Weight-Rekord vs. Closed Frontier

BenchmarkV4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80,6 %96,0 %~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench Pass@193,5 %88,1 %87,4 %83,2 %
Codeforces Elo3.206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

Kosten-Nutzen (Artificial Analysis, Strategy & Ops): Fable 5 — 50 Punkte, $3,48/Aufgabe; V4-Pro — 38 Punkte, $0,03/Aufgabe (116x guenstiger bei 24 % Leistungsabstand).

Spitzen-/Nebenzeiten-Preise

ModellPostenNebenzeit (USD/M)Spitzenzeit (USD/M)
V4-ProInput Cache-Hit0,00352x
V4-ProInput Cache-Miss0,4350,87
V4-ProOutput0,871,74
V4-FlashInput Cache-Hit0,00282x
V4-FlashInput Cache-Miss0,140,28
V4-FlashOutput0,280,56

Spitzenzeiten (Peking, Werktags): 09:00–12:00 und 14:00–18:00. Vier Spar-Regeln:

  1. Batch-Jobs nach 18:00 oder vor 09:00 Peking schedulen
  2. Statische System-Prompts cachen (Flash Cache-Hit: 0,0028 USD/M)
  3. Flash fuer Intent-Routing, Pro fuer schwere Reasoning-Ketten
  4. DeepSeek-E-Mail fuer Preisaenderungen 24h vorher aktiv monitoren

Drei-Modell-Matrix: V4-Pro vs. GPT-5.6 Sol vs. Fable 5

DimensionV4-ProGPT-5.6 SolClaude Fable 5
Open Weights / Self-HostJa (MIT)NeinNein
1M KontextJaNicht bestaetigtJa
Bestes Repo-CodingZweite LigaZweite LigaSWE-bench Pro 80,3 %
Output Nebenzeit0,87 USD/M~15 USD/M~50 USD/M
Datenschutz / DSGVOSelf-Host moeglichCloud-onlyCloud-only

API-Migration (Deadline 24. Juli 2026)

Alter NameNeuer NameHinweis
deepseek-chatdeepseek-v4-flash (Non-think)Drop-in fuer Chat
deepseek-reasonerdeepseek-v4-flash (Think) oder deepseek-v4-proStaerkeres Reasoning mit Pro
python
from openai import OpenAI

client = OpenAI(api_key="YOUR_KEY", base_url="https://api.deepseek.com/v1")

# Neu (GA-kompatibel)
response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Analysiere dieses Repo..."}],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

Sechs-Schritte-Runbook

  1. Codebase scannen: grep -r "deepseek-chat\|deepseek-reasoner" — alle Treffer bis 23. Juli ersetzen.
  2. Routing-Matrix definieren: Flash fuer Bulk/Intent, Pro fuer Agent-Reasoning, GPT-5.6 nur fuer Terminal-lastige Pfade.
  3. Staging mit GA-Modellnamen testen: Latenz, Think-Modus und Cache-Hit-Rate messen.
  4. Cron auf Nebenzeit umstellen: Batch-Pipelines ausserhalb Peking-Spitzenzeiten.
  5. Datenschutz pruefen: Wenn DSGVO-relevant → Self-Host (vLLM/ds4) oder EU-Gateway auf dediziertem Mac-Knoten.
  6. Produktions-Cutover vor 24. Juli: Rollback-Plan mit Legacy-Alias in Staging behalten bis Verifikation abgeschlossen.

Abschluss und MACCOME-Bruecke

DeepSeek V4 GA ist kein neues Architektur-Experiment — es ist die Preview mit Agent-Tuning, Spitzen-/Nebenzeiten-Tarif und hartem Legacy-Sunset. Der Wert liegt in Open-Weight-SWE-bench 80,6 %, 1M Kontext mit 10 % KV-Overhead und Output ab 0,87 USD/M — nicht im Versprechen, Fable 5 auf SWE-bench Pro zu schlagen.

Produktive V4-Agent-Gateways (OpenClaw, Multi-Modell-Routing, ds4-Self-Host) scheitern auf Laptops an Schlaf, Unified-Memory-Konkurrenz und fehlendem 7x24-Scheduler. MACCOME Mac-Cloud-Hosts liefern echtes macOS, SSH-Uebergabe und isolierte Knoten fuer persistente Inferenz — relevant fuer DSGVO-Teams, die Prompts nicht direkt nach China routen wollen, aber ds4 lokal testen muessen.

Oeffentliche Plaene: Mac mini Cloud-Mietpreise.

Quellen: DeepSeek offizielle Docs, arXiv:2606.19348, Hugging Face, Artificial Analysis, LLMReference. Stand 20. Juli 2026.

FAQ

Wann endet deepseek-chat?

24. Juli 2026, 15:59 UTC (23:59 Peking). Migrieren Sie auf deepseek-v4-flash oder deepseek-v4-pro.

Was kostet V4-Pro zur Nebenzeit?

Output 0,87 USD/M, Input Cache-Miss 0,435 USD/M. Spitzenzeiten verdoppeln. Details und TCO-Vergleich: MACCOME Mietpreise fuer 7x24-Gateway-Knoten neben API-Kosten.

DeepSeek V4 oder GPT-5.6 Sol?

Wenn Budget und Self-Hosting zaehlen → V4-Pro. Wenn Terminal-Agent-Benchmarks fuehren → GPT-5.6 Sol (Terminal-Bench 85,1 %). Hybrid-Routing ist die datengetriebene Standardantwort.

DSGVO-konform mit DeepSeek V4?

API-Calls verarbeiten Prompts auf chinesischer Infrastruktur — AVV und Datenresidenz pruefen. MIT-Lizenz erlaubt Self-Hosting; ds4 auf isoliertem Mac-Cloud-Knoten eliminiert Drittanbieter-Datenfluss fuer Test und Staging.

V4-Pro oder V4-Flash?

Flash: hohes Volumen, Routing, Cache-Hit 0,0028 USD/M Input. Pro: schweres Reasoning, SWE-bench 80,6 %. Tiered Routing spart 60–80 % Inferenzkosten.

Wie betreibe ich V4-Agents 7x24?

OpenClaw Gateway oder ds4-Server auf dediziertem Mac-Cloud-Host — kein Laptop-Sleep. Siehe MACCOME Mac-Cloud-Mietplaene.