DeepSeek V4 Flash officiel : benchmarks proches d'Opus 4.8, tarif divise par trente

Environ 16 min de lecture · MACCOME · Derniere mise a jour : 5 aout 2026

Public cible : developpeurs IA, ingenieurs agent et responsables techniques qui choisissent une API sous contrainte budget. Le 31 juillet 2026, DeepSeek passe V4-Flash en build officiel 0731 : memes parametres, gains post-entrainement uniquement — scores agent devant la preview V4-Pro, tarif environ 1/36 a 1/179 de Claude Opus 4.8 selon le cache. Vous obtenez : chronologie complete, matrice tarifaire a six acteurs, contexte Harness, verification Artificial Analysis, limites des benchmarks et runbook production en six etapes. Structure : angles morts, chronologie, tarifs, architecture, concurrence, controverses, runbook, conclusion. GA V4 et tarification heures pleines/creuses : guide de migration V4 ; comparaison Kimi K3 : publication des poids K3.

bolt

En bref — verdict en 30 secondes

  • Pas un nouveau modele : 284B total / 13B actifs — identique a la preview d'avril. Les gains viennent entierement du post-entrainement, pas de l'echelle.
  • Ecart tarifaire : entree 0,14 USD/M (cache miss), sortie 0,28 USD/M — environ 1/36 a 1/179 d'Opus 4.8 selon le taux de cache.
  • Premiere apparition de Harness : framework agent interne visant Claude Code, mais non public ; tous les scores agent officiels passent par le mode minimal Harness.
  • V4-Pro toujours absent en GA : au 5 aout, seul Flash-0731 est officiel (API uniquement). Pro officiel et Harness sont annonces bientot.
  • Benchmarks a nuancer : le 82,7 de Terminal Bench 2.0 est editeur + framework specifique — pas un reflet direct du comportement dans Claude Code ou Cursor.

Six angles morts apres la GA Flash — et leur impact sur la facture

Apres la sortie officielle du 31 juillet, la plupart des equipes — studios creatifs sur Mac, agences iOS, equipes agent — butent sur six zones de decision. Chacune touche directement la depense API ou la qualite agent en production :

  1. Scores dependants de Harness : le 82,7 de Terminal Bench 2.0 repose sur le mode minimal Harness non publie. Ce n'est pas un proxy direct de Claude Code ou Cursor.
  2. V4-Pro officiel toujours absent : le flagship 1,6T n'a pas de date GA. Les rumeurs mediatiques d'une fenetre 10–20 aout sont non sourcees ; le changelog indique seulement bientot.
  3. Deploiement API uniquement : le build 0731 est en beta publique API. L'app consommateur et le web restent sur d'anciennes versions — endpoints melanges, comportements incoherents.
  4. Faible taux de cache prompt : des developpeurs a l'etranger signalent un faible taux de hit sur le cache d'entree. Les boucles agent peuvent couter bien plus que le tarif affiche.
  5. Majoration heures pleines pas encore active : DeepSeek a annonce un surcout x2 entre 9h–12h et 14h–18h (heure de Pekin), sans date d'entree en vigueur publiee a ce jour.
  6. Rumeurs de financement et IPO non verifiees : la presse financiere cite environ 7,4 Md USD leves et une preparation IPO via des sources anonymes — aucun depot reglementaire ni declaration officielle.

Chronologie : de la preview d'avril a Flash officiel en juillet

DateEvenement
2026-04-24Preview V4 publiee en open source : V4-Pro (1,6T / 49B actifs) et V4-Flash (284B / 13B actifs), contexte 1M, licence MIT
2026-07-24Fin des endpoints legacy deepseek-chat et deepseek-reasoner ; tout le trafic bascule vers la nomenclature V4
2026-07-27Moonshot AI publie Kimi K3 (2,8T) en poids ouverts sur Hugging Face, renforcant la pression concurrentielle
2026-07-31V4-Flash-0731 officiel entre en beta publique API ; poids open source synchronises ; changelog nomme pour la premiere fois le framework agent Harness
2026-08-02API Qwen3.8-Max d'Alibaba en GA (poids en attente), intensifiant la course open source chinoise
2026-08-05 (date de publication)V4-Pro officiel toujours absent ; Harness non public ; app et web pas sur 0731

Matrice tarifaire : Flash officiel vs six acteurs open source chinois

Tous les chiffres sont publies par les editeurs au 5 aout 2026. Les champs GLM-5.2 marques non verifies n'ont pas ete confirmes pour cet article.

ModeleStatutTotal / actifsContexteEntree (miss/hit, USD/M)Sortie (USD/M)Licence
V4-Flash-0731GA officiel284B / 13B1M0,14 / 0,00280,28MIT
V4-ProPreview1,6T / 49B1M0,435 / 0,0036250,87MIT
Kimi K3Poids ouverts2,8T / ~104B (est. communaute)~1,05M3,00 / 0,3015,00MIT modifiee
GLM-5.2Open source~744B / ~40B1Mnon verifienon verifieMIT
Qwen3.8-MaxAPI GA2,4T / 95B1M2,00 / ~0,17–0,256,00open source promis
GPT-5.6 SolFermenon divulgueproprietaire
Claude Fable 5Fermenon divulgue1M~50proprietaire

Meme architecture, post-entrainement renforce : CSA + HCA + mHC + Muon

Le point que beaucoup d'equipes Mac oublient : V4-Flash-0731 conserve le meme nombre de parametres et la meme structure que la preview d'avril. Les gains viennent uniquement d'un post-entrainement relance. La variante Flash 284B / 13B depasse desormais la preview V4-Pro, bien plus volumineuse, sur plusieurs benchmarks agent — signal que la qualite du post-entrainement fin 2026 rivalise avec l'echelle brute.

Selon le rapport technique DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence, trois changements architecturaux definissent la serie V4 :

  • Attention hybride (CSA + HCA) : commercialisee sous DSA sparse attention ; reduit calcul et memoire en contexte long. A 1M tokens, les FLOPs d'inference V4-Pro representent 27 % de V3.2 et le KV Cache 10 % (donnees editeur ; pas encore de rerun tiers independant).
  • Hyper-connexions contraintes sur variete (mHC) : stabilise la propagation du signal dans les blocs residuels profonds.
  • Optimiseur Muon : remplace AdamW pour une convergence plus rapide et plus stable.

Harness : couche d'execution agent DeepSeek face a Claude Code

Le changelog du 31 juillet nomme pour la premiere fois DeepSeek Harness — runtime agent interne pour I/O fichiers, appels d'outils, commandes shell et taches d'ingenierie de bout en bout, positionne face a Claude Code. Jusqu'ici, les modeles DeepSeek s'appuyaient sur Claude Code, OpenCode et autres stacks agent tierces.

Chaque score agent officiel (Terminal Bench 2.0, Toolathlon, etc.) passe par le mode minimal de Harness, palier max, top_p=0,95, temperature=1,0. Le changelog DeepSeek avertit : les scores sont tres sensibles au choix du harness et ne constituent pas un saut de capacite brute du modele.

Verification Artificial Analysis : intelligence non maximale, cout par tache le plus bas

ModeleLaboratoireIntelligence Index (tiers)Cout moyen par tache (tiers)
V4-Flash-0731DeepSeek500,03 USD
Kimi K3Moonshot AI570,86 USD
GLM-5.2Zhipu / Z.ai~1 pt au-dessus de Flashnon verifie
GPT-5.6 SolOpenAI9+ pts au-dessus de Flash1,86 USD
Claude Fable 5Anthropic9+ pts au-dessus de Flash3,15 USD

Source : evaluation independante Artificial Analysis, citee via presse financiere. Methodologie differente des scores agent Harness de DeepSeek — ne pas fusionner les deux jeux de donnees.

Le contraste est deliberé : V4-Flash n'affiche pas le score d'intelligence le plus eleve (il reste derriere Kimi K3 et GLM-5.2), mais le cout par tache represente environ 1/29 de Kimi K3, 1/62 de GPT-5.6 Sol et 1/105 de Claude Fable 5. DeepSeek ne vise pas la couronne des benchmarks — il vend une intelligence suffisante a prix extreme, ce qui explique sept semaines consecutives en tete du volume OpenRouter.

Controverses : scores solides, reserves reelles

  • Scores agent lies a Harness : Terminal Bench 2.0 a 82,7 (vs 67,9 pour V4-Pro preview) est editeur + framework non publie. A traiter comme indicatif jusqu'aux reruns Claude Code ou Cursor.
  • Friction operationnelle signalee : selon 21st Century Business Herald citant des developpeurs a l'etranger, le build officiel affiche un faible taux de cache prompt et des timeouts occasionnels du classificateur de securite.
  • Dates V4-Pro / Harness non confirmees : la fenetre GA 10–20 aout des medias chinois est non sourcee. Formulation officielle : bientot.
  • Chiffres de financement a verifier : levee d'environ 7,4 Md USD et valorisation ~48,7 Md USD circulent via presse sans confirmation reglementaire directe.

Reaction marche : pression tarifaire et seuil de viabilite

Pendant le report de V4-Pro, la communaute IA chinoise avait surnomme le fondateur Liang Wenfeng « Liang Baikai » (attente en vain). Flash-0731 a renverse le sentiment. Le concept de seuil de viabilite decrit un plancher fixe par DeepSeek : les concurrents doivent montrer un gain de performance net et un prix inferieur — sinon ils perdent en visibilite. Ce cadre eclaire la baisse de 80 % de GPT-5.6 Luna et les ajustements connexes (voir analyse tarifaire OpenAI).

Le jour du lancement, NVIDIA, Broadcom et AMD n'ont pas bouge de facon notable — contrairement au choc DeepSeek-R1 de janvier 2025. Le marche semble habitue au recit d'efficacite DeepSeek.

Runbook en six etapes : evaluer, router, mettre en production

  1. Pointer correctement l'API : deepseek-v4-flash resout vers 0731 officiel. Retirez immediatement deepseek-chat deprecie — details dans le guide de migration V4 GA.
  2. Comparer en staging : sous-ensemble de prompts reels sur 0731 vs preview. Focus sur le format des appels d'outils et la stabilite en contexte long.
  3. Router Flash vs Pro par palier : batch et dispatch sur Flash (0,28 USD/M sortie) ; raisonnement complexe sur V4-Pro preview jusqu'a la GA Pro officielle.
  4. Surveiller le taux de cache : boucles agent avec system prompt fixe doivent activer le prompt cache. Faible hit rate = facture bien au-dessus du tarif affiche.
  5. Planifier hors heures pleines : batchs non temps reel en dehors de 9h–12h et 14h–18h (Pekin) une fois la majoration x2 activee.
  6. Decider local vs cloud : un Mac 128 Go peut faire tourner Flash q2 via ds4 ; la production agent exige des noeuds 24h/24 — voir le guide ds4 local vs location cloud.
python
from openai import OpenAI

client = OpenAI(
    api_key="votre-cle-deepseek",
    base_url="https://api.deepseek.com"
)

# deepseek-v4-flash resout vers 0731 officiel
response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Analysez ce journal agent..."}],
)

Trois chiffres pour votre note interne

  • 82,7 vs 67,9 — Terminal Bench 2.0 : score editeur V4-Flash-0731 devant V4-Pro preview (mode minimal Harness ; rerun independant en attente)
  • 27 % / 10 % — a 1M de contexte, FLOPs d'inference et KV Cache V4-Pro vs V3.2 (rapport technique DeepSeek, donnees editeur)
  • 1/29 a 1/105 — cout par tache V4-Flash vs Kimi K3 / GPT-5.6 Sol / Claude Fable 5 (donnees tiers Artificial Analysis)

Conclusion : intelligence suffisante a prix extreme — la production agent exige un socle stable

V4-Flash-0731 ne cherche pas a depasser Claude Fable 5 ou GPT-5.6 Sol en intelligence brute. Il propose une option open source sous licence MIT a environ 1/36 a 1/179 du tarif des flagsips fermes, pour agents massifs et appels a haute frequence. Pour les equipes sensibles au budget — studios creatifs sur Mac mini, agences iOS, pipelines Cursor — Flash officiel compte parmi les meilleurs rapports qualite-prix d'aout 2026.

Deployer des workflows agent DeepSeek V4 en production — OpenClaw Gateway, futurs hooks Harness ou routage multi-modeles — bute encore sur trois limites structurelles sur un MacBook :

  • Veille a la fermeture du capot : coupure Wi-Fi et veille interrompent les sessions agent longues ; les tokens consommes ne sont pas rembourses.
  • Cache et planification heures creuses : un cron local ne peut pas fiabiliser les batchs hors pointe si la politique de veille interfere.
  • Pas de routeur 24h/24 : un tiering Flash / Pro / Fable 5 exige un gateway toujours actif ; un portable n'est pas un bon noeud de dispatch.

Pour un environnement stable adapte aux agents IA, MACCOME Mac Cloud fournit un macOS reel, une passation SSH et des environnements isoles — vos agents tournent 24h/24 sur du materiel dedie, que ce soit pour ds4, OpenClaw ou un routage hybride V4-Flash et Kimi K3. Tarifs : location Mac mini cloud.

Sources : documentation API et changelog DeepSeek, rapport technique, fiches Hugging Face, Artificial Analysis (via presse financiere), 21st Century Business Herald, fils V2EX. Donnees au 5 aout 2026 — verifiez tarifs et statut V4-Pro / Harness avant bascule production.

FAQ

Quelle est la principale difference entre DeepSeek V4 et V3.2 ?

Contexte natif de 1 million de tokens. A cette fenetre, les FLOPs d'inference V4-Pro representent 27 % de V3.2 et le KV Cache 10 % (donnees editeur). La serie V4 ajoute un tuning agent pour Claude Code, OpenCode et outils similaires.

Faut-il choisir V4 Flash ou V4 Pro au quotidien ?

Par defaut V4-Flash-0731 officiel pour chat, batch et pipelines agent — meilleurs scores agent que V4-Pro preview a bien moindre cout. Reservez V4-Pro preview pour connaissances approfondies ou raisonnement complexe en attendant la GA officielle.

V4 Pro officiel est-il disponible ?

Non au 5 aout 2026. Seul V4-Flash-0731 est en GA (API uniquement) ; app et web pas sur 0731. V4-Pro officiel et Harness sont annonces bientot — rumeurs 10–20 aout non verifiees.

Peut-on faire confiance aux benchmarks publies par DeepSeek ?

Hierarchisez votre confiance. SWE-bench Verified et benchmarks tiers sont plus fiables. Terminal Bench 2.0 repose sur Harness minimal mode non public — DeepSeek avertit que le harness domine les resultats. Attendez des reruns independants Claude Code ou Cursor.

Comment faire tourner des agents DeepSeek V4 24h/24 en production ?

Deployez OpenClaw Gateway ou un routage multi-modeles sur un Mac cloud dedie. Consultez les tarifs MACCOME location Mac mini pour la configuration des noeuds.