Zielgruppe: AI-Entwickler, Agent-Ingenieure und Tech-Leads unter API-Kostendruck. Kernereignis (31.07.2026): DeepSeek stuft V4-Flash auf offizielles Build 0731 hoch — gleiche Parameterzahl, nur Post-Training; Agent-Scores ueber V4-Pro-Preview, Preis ca. 1/36 bis 1/179 von Claude Opus 4.8 (Cache-abhaengig). Sie erhalten: vollstaendige Timeline, Sechs-Wege-Preismatrix, Harness-Framework-Kontext, Artificial-Analysis-Quercheck, Benchmark-Grenzen und 6-Schritte-Produktions-Runbook inkl. DSGVO-Hinweisen. Struktur: Schmerzpunkte, Timeline, Preistabelle, Architektur, Wettbewerbsmatrix, Kontroversen, Runbook, Abschluss. V4-GA und Spitzen-/Nebenzeiten-Tarife: V4-Vollfreigabe-Leitfaden; Kimi-K3-Kontext: Kimi K3 Open Weights.
Kurzfassung — 30 Sekunden
Nach dem offiziellen Release am 31. Juli bleiben die meisten Teams an sechs Punkten haengen. Jeder Punkt wirkt direkt auf API-Kosten, Agent-Qualitaet oder Datenschutz-Compliance:
| Datum | Ereignis |
|---|---|
| 2026-04-24 | V4-Vorschau Open Source: V4-Pro (1,6T / 49B aktiv) und V4-Flash (284B / 13B aktiv), beide 1M Kontext, MIT-Lizenz |
| 2026-07-24 | Legacy-Endpunkte deepseek-chat und deepseek-reasoner abgeschaltet; Traffic auf V4-Namensgebung |
| 2026-07-27 | Moonshot AI veroeffentlicht Kimi K3 (2,8T) Open Weights auf Hugging Face — Wettbewerbsdruck steigt |
| 2026-07-31 | V4-Flash-0731 offiziell in API-Public-Beta; Open Weights synchron; Changelog nennt erstmals Agent-Framework Harness |
| 2026-08-02 | Alibaba Qwen3.8-Max API GA (Gewichte ausstehend) — chinesisches Open-Model-Rennen verdichtet sich |
| 2026-08-05 (Redaktionsschluss) | V4-Pro offiziell weiterhin ausstehend; Harness nicht oeffentlich; App/Web nicht auf 0731 |
Alle Werte sind Herstellerangaben (Stand 5. August 2026). GLM-5.2-Felder mit unbestaetigt wurden fuer diesen Artikel nicht verifiziert. Wenn EU-Daten verarbeitet werden: vor Produktivstart AVV und Datenresidenz pruefen (siehe DSGVO-Abschnitt im Runbook).
| Modell | Status | Gesamt / aktiv | Kontext | Input (Miss/Hit, USD/M) | Output (USD/M) | Lizenz |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | Offiziell GA | 284B / 13B | 1M | 0,14 / 0,0028 | 0,28 | MIT |
| V4-Pro | Vorschau | 1,6T / 49B | 1M | 0,435 / 0,003625 | 0,87 | MIT |
| Kimi K3 | Open Weights | 2,8T / ~104B (Community-Schaetzung) | ~1,05M | 3,00 / 0,30 | 15,00 | Modified MIT |
| GLM-5.2 | Open Source | ~744B / ~40B | 1M | unbestaetigt | unbestaetigt | MIT |
| Qwen3.8-Max | API GA | 2,4T / 95B | 1M | 2,00 / ~0,17–0,25 | 6,00 | Open Source versprochen |
| GPT-5.6 Sol | Closed | nicht veroeffentlicht | — | — | — | proprietaer |
| Claude Fable 5 | Closed | nicht veroeffentlicht | 1M | — | ~50 | proprietaer |
Der Punkt, den die meisten Teams uebersehen: V4-Flash-0731 hat identische Parameterzahl und Modellstruktur wie die April-Vorschau. Leistungsgewinne stammen ausschliesslich aus erneutem Post-Training. Die 284B-/13B-Flash-Variante schlaegt die deutlich groessere V4-Pro-Vorschau auf mehreren Agent-Benchmarks — ein Signal, dass Post-Training-Qualitaet Ende 2026 reine Parameterskalierung ersetzen kann.
Laut Technical Report DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence definieren drei Architekturaenderungen die V4-Serie:
Der Changelog vom 31. Juli nennt erstmals DeepSeek Harness — interne Agent-Runtime fuer Datei-I/O, Tool-Aufrufe, Shell-Befehle und End-to-End-Engineering, positioniert gegen Claude Code. Zuvor liefen DeepSeek-Modelle primaer ueber Claude Code, OpenCode und andere Drittanbieter-Stacks.
Alle offiziellen Agent-Scores (Terminal Bench 2.0, Toolathlon u. a.) laufen im Harness-Minimalmodus mit max-Tier, top_p=0,95, temperature=1,0. DeepSeek warnt im Changelog: Ergebnisse sind stark harness-abhaengig und entsprechen keinem reinen Modellfaehigkeits-Sprung.
| Modell | Lab | Intelligence Index (Drittanbieter) | Ø Kosten/Task (Drittanbieter) |
|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 50 | 0,03 USD |
| Kimi K3 | Moonshot AI | 57 | 0,86 USD |
| GLM-5.2 | Zhipu / Z.ai | ~1 Pkt. ueber Flash | unbestaetigt |
| GPT-5.6 Sol | OpenAI | 9+ Pkt. ueber Flash | 1,86 USD |
| Claude Fable 5 | Anthropic | 9+ Pkt. ueber Flash | 3,15 USD |
Quelle: Artificial Analysis (unabhaengige Auswertung, via Finanzmedien zitiert). Methodik unterscheidet sich von DeepSeeks Harness-basierten Agent-Scores — Datensaetze nicht zusammenfuehren.
Der Kontrast ist beabsichtigt: V4-Flash fuehrt den Intelligence-Index nicht an (hinter Kimi K3 und GLM-5.2), aber Kosten pro Task liegen bei ca. 1/29 von Kimi K3, 1/62 von GPT-5.6 Sol und 1/105 von Claude Fable 5. DeepSeek zielt nicht auf Benchmark-Kronen, sondern auf ausreichende Intelligenz zu extremem Preis — passend zu sieben Wochen Spitzenposition bei OpenRouter-Call-Volumen.
Waehrend V4-Pro verzoegert wurde, nannte die chinesische AI-Community Gruender Liang Wenfeng scherzhaft Liang Baikai (Wortspiel fuer vergeblich warten). Flash-0731 drehte die Stimmung. Die Community spricht von einer Kill-Line: DeepSeek setzt eine Untergrenze — Wettbewerber brauchen klare Leistungsgewinne und niedrigeren Preis, sonst verlieren sie Relevanz. Das passt zu OpenAIs 80-%-Preissenkung bei GPT-5.6 Luna (siehe OpenAI-Preisanalyse).
Am Launch-Tag reagierten NVIDIA, Broadcom und AMD nicht signifikant — im Gegensatz zum DeepSeek-R1-Schock Anfang 2025. Maerkte scheinen DeepSeek-Effizienznarrative eingepreist zu haben.
deepseek-v4-flash zeigt auf 0731 offiziell. Deprecated deepseek-chat sofort abloesen — Migrationsdetails im V4-GA-Migrationsleitfaden.DSGVO / Datenschutz: Wenn Prompts personenbezogene EU-Daten enthalten, dann vor API-Nutzung AVV mit DeepSeek bzw. Reseller pruefen, Logging minimieren und Gateway auf isoliertem Knoten betreiben. Wenn Self-Hosting mit MIT-Gewichten geplant ist, dann Datenresidenz und Zugriffskontrolle dokumentieren.
from openai import OpenAI
client = OpenAI(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
# deepseek-v4-flash zeigt auf 0731 offiziell
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Analysiere dieses Agent-Log..."}],
)
V4-Flash-0731 will Claude Fable 5 oder GPT-5.6 Sol nicht bei absoluter Intelligenz schlagen. Es bietet eine MIT-lizenzierte Option bei ca. 1/36 bis 1/179 geschlossener Flaggschiff-Preise fuer Bulk-Agenten und hochfrequente API-Calls. Fuer budgetsensible Teams mit Private-Deploy oder hohem Volumen ist Flash offiziell eine der staerksten Value-Picks im August 2026.
DeepSeek-V4-Agent-Workflows in Produktion — OpenClaw Gateway, kuenftige Harness-Anbindung oder Multi-Modell-Routing — stossen auf dem Laptop an drei strukturelle Grenzen:
Fuer stabilere Verfuegbarkeit und AI-Agent-Automatisierung bieten MACCOME Mac-Cloud-Hosts echtes macOS, SSH-Uebergabe und isolierte Umgebungen fuer 7x24-Betrieb auf dedizierter Hardware. Plaene und Preise: Mac mini Cloud Mietpreise.
Quellen: DeepSeek API-Dokumentation und Changelog, Technical Report, Hugging-Face-Model-Cards, Artificial Analysis (via Finanzmedien), 21st Century Business Herald, V2EX-Community. Alle Daten Stand 5. August 2026 — vor Produktiv-Cutover aktuelle Preise und V4-Pro-/Harness-Status verifizieren.
Haeufige Fragen
Was ist der groesste Unterschied zwischen DeepSeek V4 und V3.2?
Native 1M-Token-Kontext. Bei diesem Fenster betragen V4-Pro-Inferenz-FLOPs 27 % von V3.2 und KV-Cache 10 % (Herstellerangabe). Die V4-Serie ist agentenoptimiert fuer Claude Code, OpenCode und aehnliche Tools.
Soll ich V4 Flash oder V4 Pro im Alltag nutzen?
Wenn Dialog, Batch oder Agent-Pipeline im Vordergrund stehen: V4-Flash-0731 offiziell — schlaegt V4-Pro-Vorschau bei Agent-Scores bei deutlich niedrigeren Kosten. Wenn komplexe Reasoning-Tiefe noetig ist: V4-Pro-Vorschau bis offizielles Pro-GA.
Ist V4 Pro offiziell verfuegbar?
Stand 5. August 2026 nein. Nur V4-Flash-0731 ist GA (API-only); App und Web nicht auf 0731. V4-Pro offiziell und Harness als bald verfuegbar — Geruechte zu 10.–20. August unbestaetigt.
Kann ich DeepSeek-Benchmarks direkt vertrauen?
Stufenweise bewerten: SWE-bench Verified und aehnliche Drittanbieter-Benchmarks haben hoeheres Gewicht. Terminal Bench 2.0 laeuft auf unveroeffentlichtem Harness-Minimalmodus — Hersteller warnt vor Harness-Abhaengigkeit. Auf unabhaengige Claude-Code- oder Cursor-Reproduktionen warten.
Wie betreibe ich DeepSeek-V4-Agenten 7x24 produktiv und DSGVO-konform?
OpenClaw Gateway oder Multi-Modell-Routing auf dediziertem Mac-Cloud-Host; keine personenbezogenen EU-Daten in unsicheren API-Tiers ohne AVV. Siehe MACCOME Mac mini Mietpreise fuer Knotenkonfiguration und Preise.