Zielgruppe: KI-Entwickler, FinOps-Leads und Engineering-Teams, die DeepSeek V4 GA (20. Juli 2026) fuer Agent-Pipelines, Coding und 1M-Token-Kontext evaluieren. Sie erhalten: Zeitlinie Preview bis GA, Architektur (CSA/HCA/mHC/Muon), Benchmark-Tabellen vs. GPT-5.6 Sol und Claude Fable 5, Spitzen-/Nebenzeiten-Preise, API-Migrationsmapping bis 24. Juli, Datenschutz-Hinweise fuer DSGVO-Teams, sechs Entscheidungsmodule und ein Sechs-Schritte-Runbook. Kontext: ds4 lokale Inferenz auf Mac, OpenRouter Juni-Rankings.
TL;DR — 30 Sekunden
deepseek-chat → deepseek-v4-flash; deepseek-reasoner → Flash (Think) oder V4-Pro.Nach dem Go-Live von DeepSeek V4 GA bleiben die meisten Teams an denselben sechs blinden Flecken haengen — nicht wegen fehlender Dokumentation, sondern weil Preview-, GA- und Legacy-Endpunkte parallel existieren:
deepseek-chat nutzt, dann bricht die Produktion am 24. Juli 23:59 Peking-Zeit ab — unabhaengig von GA-Performance.| Datum | Ereignis |
|---|---|
| 24. Apr. 2026 | V4-Preview + Open Weights (MIT): V4-Pro (1,6T) und V4-Flash (284B) |
| Mai 2026 | Produktions-tuned API fuer Pro und Flash live |
| Juni 2026 | V4-Pro Output dauerhaft -75 % (0,87 USD/M Nebenzeit) |
| 29. Juni 2026 | E-Mail an API-Nutzer: GA Mitte Juli + Spitzen-/Nebenzeiten-Tarif |
| 19. Juli 2026 | GA-Grauzonen-Zugang fuer ausgewaehlte Entwickler |
| 20. Juli 2026 | GA Vollversion live |
| 24. Juli 2026 | deepseek-chat / deepseek-reasoner endgueltig abgeschaltet (15:59 UTC) |
| Spezifikation | V4-Pro | V4-Flash |
|---|---|---|
| Gesamtparameter | 1,6T | 284B |
| Aktiv pro Token | 49B | 13B |
| Layer | 61 | 43 |
| Kontext | 1M Token | 1M Token |
| Max. Output | 384K | 384K |
| Praezision | FP4 (MoE-Experten) + FP8 | FP4 + FP8 |
| Lizenz | MIT | MIT |
Compressed Sparse Attention (CSA): KV-Sequenz 4x via Softmax-Gating komprimiert; FP4 Lightning Indexer waehlt top-1024 (Pro) bzw. top-512 (Flash); plus 128-Token Sliding Window.
Heavily Compressed Attention (HCA): 128x Kompression, dann globale Dense Attention — ergaenzt CSA fuer Fernabhaengigkeiten. Ergebnis bei 1M Token: nur 27 % Inference-FLOPs vs. V3.2; KV-Cache 10 % (Flash: 7 %).
Vier-Kanal-Residualstrom mit doppelt-stochastischer Mischmatrix — stabilere Gradienten ueber 61 Layer vs. klassisches x = x + f(x).
Newton-Schulz-Orthogonalisierung statt AdamW — schnellere Konvergenz bei 33T+ Pretraining-Tokens.
| Modus | Verhalten | Wenn/Dann-Einsatz |
|---|---|---|
| Non-think | Keine Chain-of-Thought | Wenn Latenz kritisch → Routing, FAQ, Klassifikation |
| Think High | Explizites Reasoning | Wenn Debugging/Code-Review → mittlere Komplexitaet |
| Think Max | Maximale Reasoning-Tiefe | Wenn Mathe/Agent-Ketten → 384K+ Kontext noetig |
Empfohlene Sampling-Parameter (offiziell): temperature=1.0, top_p=1.0 — alle Modi.
| Benchmark | V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % | 96,0 % | — | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench Pass@1 | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3.206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
Kosten-Nutzen (Artificial Analysis, Strategy & Ops): Fable 5 — 50 Punkte, $3,48/Aufgabe; V4-Pro — 38 Punkte, $0,03/Aufgabe (116x guenstiger bei 24 % Leistungsabstand).
| Modell | Posten | Nebenzeit (USD/M) | Spitzenzeit (USD/M) |
|---|---|---|---|
| V4-Pro | Input Cache-Hit | 0,0035 | 2x |
| V4-Pro | Input Cache-Miss | 0,435 | 0,87 |
| V4-Pro | Output | 0,87 | 1,74 |
| V4-Flash | Input Cache-Hit | 0,0028 | 2x |
| V4-Flash | Input Cache-Miss | 0,14 | 0,28 |
| V4-Flash | Output | 0,28 | 0,56 |
Spitzenzeiten (Peking, Werktags): 09:00–12:00 und 14:00–18:00. Vier Spar-Regeln:
| Dimension | V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open Weights / Self-Host | Ja (MIT) | Nein | Nein |
| 1M Kontext | Ja | Nicht bestaetigt | Ja |
| Bestes Repo-Coding | Zweite Liga | Zweite Liga | SWE-bench Pro 80,3 % |
| Output Nebenzeit | 0,87 USD/M | ~15 USD/M | ~50 USD/M |
| Datenschutz / DSGVO | Self-Host moeglich | Cloud-only | Cloud-only |
| Alter Name | Neuer Name | Hinweis |
|---|---|---|
deepseek-chat | deepseek-v4-flash (Non-think) | Drop-in fuer Chat |
deepseek-reasoner | deepseek-v4-flash (Think) oder deepseek-v4-pro | Staerkeres Reasoning mit Pro |
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.deepseek.com/v1")
# Neu (GA-kompatibel)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Analysiere dieses Repo..."}],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
grep -r "deepseek-chat\|deepseek-reasoner" — alle Treffer bis 23. Juli ersetzen.DeepSeek V4 GA ist kein neues Architektur-Experiment — es ist die Preview mit Agent-Tuning, Spitzen-/Nebenzeiten-Tarif und hartem Legacy-Sunset. Der Wert liegt in Open-Weight-SWE-bench 80,6 %, 1M Kontext mit 10 % KV-Overhead und Output ab 0,87 USD/M — nicht im Versprechen, Fable 5 auf SWE-bench Pro zu schlagen.
Produktive V4-Agent-Gateways (OpenClaw, Multi-Modell-Routing, ds4-Self-Host) scheitern auf Laptops an Schlaf, Unified-Memory-Konkurrenz und fehlendem 7x24-Scheduler. MACCOME Mac-Cloud-Hosts liefern echtes macOS, SSH-Uebergabe und isolierte Knoten fuer persistente Inferenz — relevant fuer DSGVO-Teams, die Prompts nicht direkt nach China routen wollen, aber ds4 lokal testen muessen.
Oeffentliche Plaene: Mac mini Cloud-Mietpreise.
Quellen: DeepSeek offizielle Docs, arXiv:2606.19348, Hugging Face, Artificial Analysis, LLMReference. Stand 20. Juli 2026.
FAQ
Wann endet deepseek-chat?
24. Juli 2026, 15:59 UTC (23:59 Peking). Migrieren Sie auf deepseek-v4-flash oder deepseek-v4-pro.
Was kostet V4-Pro zur Nebenzeit?
Output 0,87 USD/M, Input Cache-Miss 0,435 USD/M. Spitzenzeiten verdoppeln. Details und TCO-Vergleich: MACCOME Mietpreise fuer 7x24-Gateway-Knoten neben API-Kosten.
DeepSeek V4 oder GPT-5.6 Sol?
Wenn Budget und Self-Hosting zaehlen → V4-Pro. Wenn Terminal-Agent-Benchmarks fuehren → GPT-5.6 Sol (Terminal-Bench 85,1 %). Hybrid-Routing ist die datengetriebene Standardantwort.
DSGVO-konform mit DeepSeek V4?
API-Calls verarbeiten Prompts auf chinesischer Infrastruktur — AVV und Datenresidenz pruefen. MIT-Lizenz erlaubt Self-Hosting; ds4 auf isoliertem Mac-Cloud-Knoten eliminiert Drittanbieter-Datenfluss fuer Test und Staging.
V4-Pro oder V4-Flash?
Flash: hohes Volumen, Routing, Cache-Hit 0,0028 USD/M Input. Pro: schweres Reasoning, SWE-bench 80,6 %. Tiered Routing spart 60–80 % Inferenzkosten.
Wie betreibe ich V4-Agents 7x24?
OpenClaw Gateway oder ds4-Server auf dediziertem Mac-Cloud-Host — kein Laptop-Sleep. Siehe MACCOME Mac-Cloud-Mietplaene.