Public cible : developpeurs IA, ingenieurs agent et responsables techniques qui choisissent une API sous contrainte budget. Le 31 juillet 2026, DeepSeek passe V4-Flash en build officiel 0731 : memes parametres, gains post-entrainement uniquement — scores agent devant la preview V4-Pro, tarif environ 1/36 a 1/179 de Claude Opus 4.8 selon le cache. Vous obtenez : chronologie complete, matrice tarifaire a six acteurs, contexte Harness, verification Artificial Analysis, limites des benchmarks et runbook production en six etapes. Structure : angles morts, chronologie, tarifs, architecture, concurrence, controverses, runbook, conclusion. GA V4 et tarification heures pleines/creuses : guide de migration V4 ; comparaison Kimi K3 : publication des poids K3.
En bref — verdict en 30 secondes
Apres la sortie officielle du 31 juillet, la plupart des equipes — studios creatifs sur Mac, agences iOS, equipes agent — butent sur six zones de decision. Chacune touche directement la depense API ou la qualite agent en production :
| Date | Evenement |
|---|---|
| 2026-04-24 | Preview V4 publiee en open source : V4-Pro (1,6T / 49B actifs) et V4-Flash (284B / 13B actifs), contexte 1M, licence MIT |
| 2026-07-24 | Fin des endpoints legacy deepseek-chat et deepseek-reasoner ; tout le trafic bascule vers la nomenclature V4 |
| 2026-07-27 | Moonshot AI publie Kimi K3 (2,8T) en poids ouverts sur Hugging Face, renforcant la pression concurrentielle |
| 2026-07-31 | V4-Flash-0731 officiel entre en beta publique API ; poids open source synchronises ; changelog nomme pour la premiere fois le framework agent Harness |
| 2026-08-02 | API Qwen3.8-Max d'Alibaba en GA (poids en attente), intensifiant la course open source chinoise |
| 2026-08-05 (date de publication) | V4-Pro officiel toujours absent ; Harness non public ; app et web pas sur 0731 |
Tous les chiffres sont publies par les editeurs au 5 aout 2026. Les champs GLM-5.2 marques non verifies n'ont pas ete confirmes pour cet article.
| Modele | Statut | Total / actifs | Contexte | Entree (miss/hit, USD/M) | Sortie (USD/M) | Licence |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | GA officiel | 284B / 13B | 1M | 0,14 / 0,0028 | 0,28 | MIT |
| V4-Pro | Preview | 1,6T / 49B | 1M | 0,435 / 0,003625 | 0,87 | MIT |
| Kimi K3 | Poids ouverts | 2,8T / ~104B (est. communaute) | ~1,05M | 3,00 / 0,30 | 15,00 | MIT modifiee |
| GLM-5.2 | Open source | ~744B / ~40B | 1M | non verifie | non verifie | MIT |
| Qwen3.8-Max | API GA | 2,4T / 95B | 1M | 2,00 / ~0,17–0,25 | 6,00 | open source promis |
| GPT-5.6 Sol | Ferme | non divulgue | — | — | — | proprietaire |
| Claude Fable 5 | Ferme | non divulgue | 1M | — | ~50 | proprietaire |
Le point que beaucoup d'equipes Mac oublient : V4-Flash-0731 conserve le meme nombre de parametres et la meme structure que la preview d'avril. Les gains viennent uniquement d'un post-entrainement relance. La variante Flash 284B / 13B depasse desormais la preview V4-Pro, bien plus volumineuse, sur plusieurs benchmarks agent — signal que la qualite du post-entrainement fin 2026 rivalise avec l'echelle brute.
Selon le rapport technique DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence, trois changements architecturaux definissent la serie V4 :
Le changelog du 31 juillet nomme pour la premiere fois DeepSeek Harness — runtime agent interne pour I/O fichiers, appels d'outils, commandes shell et taches d'ingenierie de bout en bout, positionne face a Claude Code. Jusqu'ici, les modeles DeepSeek s'appuyaient sur Claude Code, OpenCode et autres stacks agent tierces.
Chaque score agent officiel (Terminal Bench 2.0, Toolathlon, etc.) passe par le mode minimal de Harness, palier max, top_p=0,95, temperature=1,0. Le changelog DeepSeek avertit : les scores sont tres sensibles au choix du harness et ne constituent pas un saut de capacite brute du modele.
| Modele | Laboratoire | Intelligence Index (tiers) | Cout moyen par tache (tiers) |
|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 50 | 0,03 USD |
| Kimi K3 | Moonshot AI | 57 | 0,86 USD |
| GLM-5.2 | Zhipu / Z.ai | ~1 pt au-dessus de Flash | non verifie |
| GPT-5.6 Sol | OpenAI | 9+ pts au-dessus de Flash | 1,86 USD |
| Claude Fable 5 | Anthropic | 9+ pts au-dessus de Flash | 3,15 USD |
Source : evaluation independante Artificial Analysis, citee via presse financiere. Methodologie differente des scores agent Harness de DeepSeek — ne pas fusionner les deux jeux de donnees.
Le contraste est deliberé : V4-Flash n'affiche pas le score d'intelligence le plus eleve (il reste derriere Kimi K3 et GLM-5.2), mais le cout par tache represente environ 1/29 de Kimi K3, 1/62 de GPT-5.6 Sol et 1/105 de Claude Fable 5. DeepSeek ne vise pas la couronne des benchmarks — il vend une intelligence suffisante a prix extreme, ce qui explique sept semaines consecutives en tete du volume OpenRouter.
Pendant le report de V4-Pro, la communaute IA chinoise avait surnomme le fondateur Liang Wenfeng « Liang Baikai » (attente en vain). Flash-0731 a renverse le sentiment. Le concept de seuil de viabilite decrit un plancher fixe par DeepSeek : les concurrents doivent montrer un gain de performance net et un prix inferieur — sinon ils perdent en visibilite. Ce cadre eclaire la baisse de 80 % de GPT-5.6 Luna et les ajustements connexes (voir analyse tarifaire OpenAI).
Le jour du lancement, NVIDIA, Broadcom et AMD n'ont pas bouge de facon notable — contrairement au choc DeepSeek-R1 de janvier 2025. Le marche semble habitue au recit d'efficacite DeepSeek.
deepseek-v4-flash resout vers 0731 officiel. Retirez immediatement deepseek-chat deprecie — details dans le guide de migration V4 GA.from openai import OpenAI
client = OpenAI(
api_key="votre-cle-deepseek",
base_url="https://api.deepseek.com"
)
# deepseek-v4-flash resout vers 0731 officiel
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Analysez ce journal agent..."}],
)
V4-Flash-0731 ne cherche pas a depasser Claude Fable 5 ou GPT-5.6 Sol en intelligence brute. Il propose une option open source sous licence MIT a environ 1/36 a 1/179 du tarif des flagsips fermes, pour agents massifs et appels a haute frequence. Pour les equipes sensibles au budget — studios creatifs sur Mac mini, agences iOS, pipelines Cursor — Flash officiel compte parmi les meilleurs rapports qualite-prix d'aout 2026.
Deployer des workflows agent DeepSeek V4 en production — OpenClaw Gateway, futurs hooks Harness ou routage multi-modeles — bute encore sur trois limites structurelles sur un MacBook :
Pour un environnement stable adapte aux agents IA, MACCOME Mac Cloud fournit un macOS reel, une passation SSH et des environnements isoles — vos agents tournent 24h/24 sur du materiel dedie, que ce soit pour ds4, OpenClaw ou un routage hybride V4-Flash et Kimi K3. Tarifs : location Mac mini cloud.
Sources : documentation API et changelog DeepSeek, rapport technique, fiches Hugging Face, Artificial Analysis (via presse financiere), 21st Century Business Herald, fils V2EX. Donnees au 5 aout 2026 — verifiez tarifs et statut V4-Pro / Harness avant bascule production.
FAQ
Quelle est la principale difference entre DeepSeek V4 et V3.2 ?
Contexte natif de 1 million de tokens. A cette fenetre, les FLOPs d'inference V4-Pro representent 27 % de V3.2 et le KV Cache 10 % (donnees editeur). La serie V4 ajoute un tuning agent pour Claude Code, OpenCode et outils similaires.
Faut-il choisir V4 Flash ou V4 Pro au quotidien ?
Par defaut V4-Flash-0731 officiel pour chat, batch et pipelines agent — meilleurs scores agent que V4-Pro preview a bien moindre cout. Reservez V4-Pro preview pour connaissances approfondies ou raisonnement complexe en attendant la GA officielle.
V4 Pro officiel est-il disponible ?
Non au 5 aout 2026. Seul V4-Flash-0731 est en GA (API uniquement) ; app et web pas sur 0731. V4-Pro officiel et Harness sont annonces bientot — rumeurs 10–20 aout non verifiees.
Peut-on faire confiance aux benchmarks publies par DeepSeek ?
Hierarchisez votre confiance. SWE-bench Verified et benchmarks tiers sont plus fiables. Terminal Bench 2.0 repose sur Harness minimal mode non public — DeepSeek avertit que le harness domine les resultats. Attendez des reruns independants Claude Code ou Cursor.
Comment faire tourner des agents DeepSeek V4 24h/24 en production ?
Deployez OpenClaw Gateway ou un routage multi-modeles sur un Mac cloud dedie. Consultez les tarifs MACCOME location Mac mini pour la configuration des noeuds.