DeepSeek V4 Flash Offiziell (0731): Benchmarks nahe Opus 4.8, Preis Bruchteil — Spec-Tabellen und Runbook

Ca. 16 Min. Lesezeit · MACCOME · Zuletzt aktualisiert: 5. August 2026

Zielgruppe: AI-Entwickler, Agent-Ingenieure und Tech-Leads unter API-Kostendruck. Kernereignis (31.07.2026): DeepSeek stuft V4-Flash auf offizielles Build 0731 hoch — gleiche Parameterzahl, nur Post-Training; Agent-Scores ueber V4-Pro-Preview, Preis ca. 1/36 bis 1/179 von Claude Opus 4.8 (Cache-abhaengig). Sie erhalten: vollstaendige Timeline, Sechs-Wege-Preismatrix, Harness-Framework-Kontext, Artificial-Analysis-Quercheck, Benchmark-Grenzen und 6-Schritte-Produktions-Runbook inkl. DSGVO-Hinweisen. Struktur: Schmerzpunkte, Timeline, Preistabelle, Architektur, Wettbewerbsmatrix, Kontroversen, Runbook, Abschluss. V4-GA und Spitzen-/Nebenzeiten-Tarife: V4-Vollfreigabe-Leitfaden; Kimi-K3-Kontext: Kimi K3 Open Weights.

bolt

Kurzfassung — 30 Sekunden

  • Kein neues Modell: 284B gesamt / 13B aktiv — identisch zur April-Vorschau. Gewinne ausschliesslich durch Post-Training, nicht durch Skalierung.
  • Preisabstand: Input 0,14 USD/M (Cache-Miss), Output 0,28 USD/M — ca. 1/36 bis 1/179 von Opus 4.8 je nach Cache-Trefferquote.
  • Harness-Debuet: DeepSeeks internes Agent-Framework zielt auf Claude Code, ist aber noch nicht oeffentlich. Offizielle Agent-Scores laufen im Harness-Minimalmodus.
  • V4-Pro weiterhin nicht GA: Stand 5. August nur Flash-0731 offiziell (API-only). Pro offiziell und Harness als bald verfuegbar markiert.
  • Scores mit Vorsicht: Terminal Bench 2.0 mit 82,7 ist Herstellerangabe auf spezifischem Framework — kein direkter Indikator fuer Claude Code oder Cursor.

Sechs Entscheidungsluecken nach Flash-GA — und ihre Auswirkung auf Rechnung und Verfuegbarkeit

Nach dem offiziellen Release am 31. Juli bleiben die meisten Teams an sechs Punkten haengen. Jeder Punkt wirkt direkt auf API-Kosten, Agent-Qualitaet oder Datenschutz-Compliance:

  1. Harness-abhaengige Scores: Terminal Bench 2.0 mit 82,7 laeuft auf unveroeffentlichtem Harness-Minimalmodus. Wenn Ihr Stack Claude Code oder Cursor nutzt, gilt: Score nicht 1:1 uebertragbar.
  2. V4-Pro offiziell fehlt: Das 1,6T-Flaggschiff hat kein GA-Datum. Medienberichte zu 10.–20. August sind unbelegt; Changelog nennt nur bald verfuegbar.
  3. Nur API-Rollout: Build 0731 ist API-Public-Beta. Consumer-App und Web laufen auf aelteren Builds — gemischte Endpunkte bedeuten inkonsistentes Verhalten.
  4. Schwache Prompt-Cache-Treffer: Entwickler berichten niedrige Input-Cache-Hit-Raten. Agent-Schleifen koennen deutlich ueber Listenpreis liegen.
  5. Spitzenpreise noch nicht aktiv: DeepSeek kündigte 2x-Zuschlaege fuer Peking 9–12 und 14–18 Uhr an, ohne veroeffentlichtes Inkrafttreten (Stand Redaktionsschluss).
  6. Finanzierungs- und IPO-Geruechte unbestaetigt: Presse nennt ca. 7,4 Mrd. USD Finanzierung — ohne regulatorische Einreichung oder offizielle Stellungnahme.

Timeline: April-Vorschau bis Flash-0731 offiziell

DatumEreignis
2026-04-24V4-Vorschau Open Source: V4-Pro (1,6T / 49B aktiv) und V4-Flash (284B / 13B aktiv), beide 1M Kontext, MIT-Lizenz
2026-07-24Legacy-Endpunkte deepseek-chat und deepseek-reasoner abgeschaltet; Traffic auf V4-Namensgebung
2026-07-27Moonshot AI veroeffentlicht Kimi K3 (2,8T) Open Weights auf Hugging Face — Wettbewerbsdruck steigt
2026-07-31V4-Flash-0731 offiziell in API-Public-Beta; Open Weights synchron; Changelog nennt erstmals Agent-Framework Harness
2026-08-02Alibaba Qwen3.8-Max API GA (Gewichte ausstehend) — chinesisches Open-Model-Rennen verdichtet sich
2026-08-05 (Redaktionsschluss)V4-Pro offiziell weiterhin ausstehend; Harness nicht oeffentlich; App/Web nicht auf 0731

Preismatrix: Flash-0731 vs. sechs chinesische Open-Model-Anbieter

Alle Werte sind Herstellerangaben (Stand 5. August 2026). GLM-5.2-Felder mit unbestaetigt wurden fuer diesen Artikel nicht verifiziert. Wenn EU-Daten verarbeitet werden: vor Produktivstart AVV und Datenresidenz pruefen (siehe DSGVO-Abschnitt im Runbook).

ModellStatusGesamt / aktivKontextInput (Miss/Hit, USD/M)Output (USD/M)Lizenz
V4-Flash-0731Offiziell GA284B / 13B1M0,14 / 0,00280,28MIT
V4-ProVorschau1,6T / 49B1M0,435 / 0,0036250,87MIT
Kimi K3Open Weights2,8T / ~104B (Community-Schaetzung)~1,05M3,00 / 0,3015,00Modified MIT
GLM-5.2Open Source~744B / ~40B1MunbestaetigtunbestaetigtMIT
Qwen3.8-MaxAPI GA2,4T / 95B1M2,00 / ~0,17–0,256,00Open Source versprochen
GPT-5.6 SolClosednicht veroeffentlichtproprietaer
Claude Fable 5Closednicht veroeffentlicht1M~50proprietaer

Gleiche Architektur, staerkeres Post-Training: CSA + HCA + mHC + Muon

Der Punkt, den die meisten Teams uebersehen: V4-Flash-0731 hat identische Parameterzahl und Modellstruktur wie die April-Vorschau. Leistungsgewinne stammen ausschliesslich aus erneutem Post-Training. Die 284B-/13B-Flash-Variante schlaegt die deutlich groessere V4-Pro-Vorschau auf mehreren Agent-Benchmarks — ein Signal, dass Post-Training-Qualitaet Ende 2026 reine Parameterskalierung ersetzen kann.

Laut Technical Report DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence definieren drei Architekturaenderungen die V4-Serie:

  • Hybrid-Attention (CSA + HCA): als DSA-Sparse-Attention vermarktet; senkt Compute und Speicher bei langem Kontext. Bei 1M Token: V4-Pro-Inferenz-FLOPs 27 % von V3.2, KV-Cache 10 % (Herstellerangabe; unabhaengige Drittanbieter-Reproduktion ausstehend).
  • Manifold-Constrained Hyper-Connections (mHC): stabilisiert Signalfluss durch tiefe Residual-Stacks.
  • Muon-Optimierer: ersetzt AdamW fuer schnellere, stabilere Konvergenz.

Harness: DeepSeeks Agent-Ausfuehrungsschicht vs. Claude Code

Der Changelog vom 31. Juli nennt erstmals DeepSeek Harness — interne Agent-Runtime fuer Datei-I/O, Tool-Aufrufe, Shell-Befehle und End-to-End-Engineering, positioniert gegen Claude Code. Zuvor liefen DeepSeek-Modelle primaer ueber Claude Code, OpenCode und andere Drittanbieter-Stacks.

Alle offiziellen Agent-Scores (Terminal Bench 2.0, Toolathlon u. a.) laufen im Harness-Minimalmodus mit max-Tier, top_p=0,95, temperature=1,0. DeepSeek warnt im Changelog: Ergebnisse sind stark harness-abhaengig und entsprechen keinem reinen Modellfaehigkeits-Sprung.

Artificial-Analysis-Quercheck: nicht hoechster Intelligence-Index, niedrigste Kosten pro Task

ModellLabIntelligence Index (Drittanbieter)Ø Kosten/Task (Drittanbieter)
V4-Flash-0731DeepSeek500,03 USD
Kimi K3Moonshot AI570,86 USD
GLM-5.2Zhipu / Z.ai~1 Pkt. ueber Flashunbestaetigt
GPT-5.6 SolOpenAI9+ Pkt. ueber Flash1,86 USD
Claude Fable 5Anthropic9+ Pkt. ueber Flash3,15 USD

Quelle: Artificial Analysis (unabhaengige Auswertung, via Finanzmedien zitiert). Methodik unterscheidet sich von DeepSeeks Harness-basierten Agent-Scores — Datensaetze nicht zusammenfuehren.

Der Kontrast ist beabsichtigt: V4-Flash fuehrt den Intelligence-Index nicht an (hinter Kimi K3 und GLM-5.2), aber Kosten pro Task liegen bei ca. 1/29 von Kimi K3, 1/62 von GPT-5.6 Sol und 1/105 von Claude Fable 5. DeepSeek zielt nicht auf Benchmark-Kronen, sondern auf ausreichende Intelligenz zu extremem Preis — passend zu sieben Wochen Spitzenposition bei OpenRouter-Call-Volumen.

Kontroversen: starke Scores, reale Grenzen

  • Agent-Scores brauchen Harness: Terminal Bench 2.0 mit 82,7 (vs. V4-Pro-Vorschau 67,9) ist Herstellerangabe auf unveroeffentlichtem Framework. Als Richtwert behandeln, bis Claude-Code- oder Cursor-Reproduktionen vorliegen.
  • Operative Reibung gemeldet: Laut 21st Century Business Herald berichten Entwickler niedrige Prompt-Cache-Treffer und gelegentliche Safety-Classifier-Timeouts.
  • V4-Pro-/Harness-Daten unbestaetigt: Chinesische Medien nennen 10.–20. August als GA-Fenster ohne Quelle. Offizielle Formulierung: bald verfuegbar.
  • Finanzierungszahlen verifizieren: ca. 7,4 Mrd. USD und ~48,7 Mrd. USD Bewertung zirkulieren via Presse ohne direkte regulatorische Bestaetigung.

Marktreaktion: Preisdruck und die Kill-Line

Waehrend V4-Pro verzoegert wurde, nannte die chinesische AI-Community Gruender Liang Wenfeng scherzhaft Liang Baikai (Wortspiel fuer vergeblich warten). Flash-0731 drehte die Stimmung. Die Community spricht von einer Kill-Line: DeepSeek setzt eine Untergrenze — Wettbewerber brauchen klare Leistungsgewinne und niedrigeren Preis, sonst verlieren sie Relevanz. Das passt zu OpenAIs 80-%-Preissenkung bei GPT-5.6 Luna (siehe OpenAI-Preisanalyse).

Am Launch-Tag reagierten NVIDIA, Broadcom und AMD nicht signifikant — im Gegensatz zum DeepSeek-R1-Schock Anfang 2025. Maerkte scheinen DeepSeek-Effizienznarrative eingepreist zu haben.

6-Schritte-Runbook: evaluieren, routen, produktiv schalten

  1. API-Aufrufe korrekt adressieren: deepseek-v4-flash zeigt auf 0731 offiziell. Deprecated deepseek-chat sofort abloesen — Migrationsdetails im V4-GA-Migrationsleitfaden.
  2. Qualitaet in Staging gegen Vorschau: echtes Prompt-Subset auf 0731 vs. Vorschau. Fokus: Tool-Call-Format und Long-Context-Stabilitaet.
  3. Flash vs. Pro nach Tier routen: Batch und Router auf Flash (0,28 USD/M Output); schweres Reasoning auf V4-Pro-Vorschau bis offizielles Pro-GA.
  4. Cache-Trefferquote ueberwachen: feste System-Prompts in Agent-Schleifen mit Prompt Cache. Wenn Trefferquote niedrig, dann Rechnung deutlich ueber Listenpreis.
  5. Spitzenzuschlaege einplanen: nicht-echtzeit Batch ausserhalb Peking 9–12 und 14–18 Uhr schedulen, sobald 2x-Spitzenpreise aktiv sind.
  6. Lokal vs. Cloud entscheiden: Wenn 128 GB Mac vorhanden, dann Flash q2 via ds4 testen; wenn 7x24-Produktion noetig, dann dedizierter Cloud-Knoten — siehe ds4 Lokal-vs-Cloud-Entscheidungsmatrix.

DSGVO / Datenschutz: Wenn Prompts personenbezogene EU-Daten enthalten, dann vor API-Nutzung AVV mit DeepSeek bzw. Reseller pruefen, Logging minimieren und Gateway auf isoliertem Knoten betreiben. Wenn Self-Hosting mit MIT-Gewichten geplant ist, dann Datenresidenz und Zugriffskontrolle dokumentieren.

python
from openai import OpenAI

client = OpenAI(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)

# deepseek-v4-flash zeigt auf 0731 offiziell
response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Analysiere dieses Agent-Log..."}],
)

Drei harte Zahlen fuer Ihr Memo

  • 82,7 vs. 67,9 — Terminal Bench 2.0: V4-Flash-0731 Hersteller-Score schlaegt V4-Pro-Vorschau (Harness-Minimalmodus; unabhaengige Reproduktion ausstehend)
  • 27 % / 10 % — bei 1M Kontext: V4-Pro-Inferenz-FLOPs und KV-Cache vs. V3.2 (DeepSeek Technical Report, Herstellerangabe)
  • 1/29 bis 1/105 — V4-Flash-Kosten pro Task vs. Kimi K3 / GPT-5.6 Sol / Claude Fable 5 (Artificial Analysis, Drittanbieter)

Abschluss: ausreichende Intelligenz zum Bruchteilspreis — Produktions-Agenten brauchen stabile Knoten

V4-Flash-0731 will Claude Fable 5 oder GPT-5.6 Sol nicht bei absoluter Intelligenz schlagen. Es bietet eine MIT-lizenzierte Option bei ca. 1/36 bis 1/179 geschlossener Flaggschiff-Preise fuer Bulk-Agenten und hochfrequente API-Calls. Fuer budgetsensible Teams mit Private-Deploy oder hohem Volumen ist Flash offiziell eine der staerksten Value-Picks im August 2026.

DeepSeek-V4-Agent-Workflows in Produktion — OpenClaw Gateway, kuenftige Harness-Anbindung oder Multi-Modell-Routing — stossen auf dem Laptop an drei strukturelle Grenzen:

  • Deckel-zu-Sleep: Wi-Fi-Abbruch und Ruhezustand beenden lange Agent-Sessions; verbrauchte Token werden nicht erstattet.
  • Cache und Spitzenplanung: lokales Cron kann Off-Peak-Batch nicht zuverlaessig ausfuehren, wenn Sleep-Richtlinien greifen.
  • Kein 7x24-Router: Flash-/Pro-/Fable-5-Tiering braucht immer-aktives Gateway; Notebook ist schlechter Dispatch-Knoten.

Fuer stabilere Verfuegbarkeit und AI-Agent-Automatisierung bieten MACCOME Mac-Cloud-Hosts echtes macOS, SSH-Uebergabe und isolierte Umgebungen fuer 7x24-Betrieb auf dedizierter Hardware. Plaene und Preise: Mac mini Cloud Mietpreise.

Quellen: DeepSeek API-Dokumentation und Changelog, Technical Report, Hugging-Face-Model-Cards, Artificial Analysis (via Finanzmedien), 21st Century Business Herald, V2EX-Community. Alle Daten Stand 5. August 2026 — vor Produktiv-Cutover aktuelle Preise und V4-Pro-/Harness-Status verifizieren.

Haeufige Fragen

Was ist der groesste Unterschied zwischen DeepSeek V4 und V3.2?

Native 1M-Token-Kontext. Bei diesem Fenster betragen V4-Pro-Inferenz-FLOPs 27 % von V3.2 und KV-Cache 10 % (Herstellerangabe). Die V4-Serie ist agentenoptimiert fuer Claude Code, OpenCode und aehnliche Tools.

Soll ich V4 Flash oder V4 Pro im Alltag nutzen?

Wenn Dialog, Batch oder Agent-Pipeline im Vordergrund stehen: V4-Flash-0731 offiziell — schlaegt V4-Pro-Vorschau bei Agent-Scores bei deutlich niedrigeren Kosten. Wenn komplexe Reasoning-Tiefe noetig ist: V4-Pro-Vorschau bis offizielles Pro-GA.

Ist V4 Pro offiziell verfuegbar?

Stand 5. August 2026 nein. Nur V4-Flash-0731 ist GA (API-only); App und Web nicht auf 0731. V4-Pro offiziell und Harness als bald verfuegbar — Geruechte zu 10.–20. August unbestaetigt.

Kann ich DeepSeek-Benchmarks direkt vertrauen?

Stufenweise bewerten: SWE-bench Verified und aehnliche Drittanbieter-Benchmarks haben hoeheres Gewicht. Terminal Bench 2.0 laeuft auf unveroeffentlichtem Harness-Minimalmodus — Hersteller warnt vor Harness-Abhaengigkeit. Auf unabhaengige Claude-Code- oder Cursor-Reproduktionen warten.

Wie betreibe ich DeepSeek-V4-Agenten 7x24 produktiv und DSGVO-konform?

OpenClaw Gateway oder Multi-Modell-Routing auf dediziertem Mac-Cloud-Host; keine personenbezogenen EU-Daten in unsicheren API-Tiers ohne AVV. Siehe MACCOME Mac mini Mietpreise fuer Knotenkonfiguration und Preise.