Public cible : developpeurs, studios creatifs et equipes produit qui orchestrent des agents IA depuis un Mac (Cursor, Xcode, pipelines creatifs). Le 20 juillet 2026, DeepSeek passe en disponibilite generale (GA) avec tarification heures pleines/creuses et coupure des anciens endpoints le 24 juillet. Vous obtenez : chronologie, architecture CSA/HCA/mHC/Muon, tableaux de benchmarks vs GPT-5.6 Sol et Claude Fable 5, grille tarifaire, guide de migration API, six modules decisionnels et un runbook en six etapes. Voir aussi ds4 sur Mac local.
TL;DR — 30 secondes
deepseek-chat → deepseek-v4-flash.La version complete ne change pas l'architecture d'avril — elle ajoute stabilite, tarification structuree et une date limite de migration. Six angles bloquent souvent les equipes Apple-first :
deepseek-chat casse le 24 juillet ; les pipelines Cursor/Xcode doivent pointer vers deepseek-v4-flash ou deepseek-v4-pro.| Date | Evenement |
|---|---|
| 24 avr. 2026 | Preview + poids ouverts MIT (V4-Pro 1,6T, V4-Flash 284B) |
| Mai 2026 | API production tunees pour Pro et Flash |
| Juin 2026 | Baisse permanente -75 % sur la sortie V4-Pro (0,87 USD/M heures creuses) |
| 29 juin 2026 | Email API : GA mi-juillet + tarification heures pleines/creuses |
| 19 juil. 2026 | Acces grise GA pour developpeurs selectionnes |
| 20 juil. 2026 | Version complete GA en ligne |
| 24 juil. 2026 | Fin de deepseek-chat et deepseek-reasoner (15:59 UTC) |
| Specification | V4-Pro | V4-Flash |
|---|---|---|
| Parametres totaux | 1,6T | 284B |
| Actifs par token | 49B | 13B |
| Couches | 61 | 43 |
| Contexte | 1M tokens | 1M tokens |
| Sortie max | 384K | 384K |
| Precision | FP4 + FP8 | FP4 + FP8 |
| Licence | MIT | MIT |
Compressed Sparse Attention (CSA) : compression KV 4x, indexeur FP4 top-1024 (Pro) / top-512 (Flash), fenetre glissante 128 tokens.
Heavily Compressed Attention (HCA) : compression 128x puis attention dense globale. A 1M tokens : 27 % des FLOPs de V3.2 ; KV cache 10 % (Flash : 7 %).
Connexions hyper-residuelles a matrice bi-stochastique pour 61 couches stables ; entrainement Muon (orthogonalisation Newton-Schulz) sur 33T+ tokens.
| Mode | Usage | Cas creatif / dev Mac |
|---|---|---|
| Non-think | Reponse rapide | Classification d'assets, routage FAQ plugin |
| Think High | Raisonnement explicite | Debug Swift, revue script automation |
| Think Max | Raisonnement maximal | Agents multi-etapes, docs longues (384K+) |
Parametres recommandes : temperature=1.0, top_p=1.0.
| Benchmark | V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % | 96,0 % | — | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench Pass@1 | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
| Modele | Poste | Heures creuses (USD/M) | Heures pleines (USD/M) |
|---|---|---|---|
| V4-Pro | Entree cache hit | 0,0035 | 2x |
| V4-Pro | Entree cache miss | 0,435 | 0,87 |
| V4-Pro | Sortie | 0,87 | 1,74 |
| V4-Flash | Entree cache hit | 0,0028 | 2x |
| V4-Flash | Entree cache miss | 0,14 | 0,28 |
| V4-Flash | Sortie | 0,28 | 0,56 |
Heures pleines (Pekin, lun-ven) : 09h–12h et 14h–18h. Quatre leviers d'economie : batch nocturne, prompt cache, routage Flash→Pro, alertes email DeepSeek 24h avant changement tarifaire.
| Dimension | V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open weights | Oui (MIT) | Non | Non |
| Contexte 1M | Oui | Non confirme | Oui |
| Sortie heures creuses | 0,87 USD/M | ~15 USD/M | ~50 USD/M |
| Meilleur pour agents terminal | — | Terminal-Bench 85,1 % | 88,0 % |
| Auto-hebergement Mac | ds4 / vLLM | Non | Non |
| Ancien nom | Nouveau nom | Notes |
|---|---|---|
deepseek-chat | deepseek-v4-flash | Mode non-think |
deepseek-reasoner | deepseek-v4-flash ou deepseek-v4-pro | Mode think ; Pro plus puissant |
from openai import OpenAI
client = OpenAI(api_key="VOTRE_CLE", base_url="https://api.deepseek.com/v1")
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Analyse ce projet Xcode..."}],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
deepseek-chat et deepseek-reasoner dans Cursor, CI et scripts.DeepSeek V4 GA consacre le modele open weights le plus performant sur SWE-bench Verified (80,6 %) a un cadre tarifaire mature. Pour les equipes qui developpent sur Mac — apps iOS, plugins creatifs, agents Cursor — l'enjeu n'est pas seulement le benchmark : c'est un gateway stable, un contexte 1M utilisable et une migration API sans interruption.
Un MacBook en fermeture interrompt les sessions agent ; un Mac cloud MACCOME (macOS natif, SSH, isolation) heberge ds4, OpenClaw et le routage hybride V4 + GPT-5.6 en 7x24. Tarifs : location Mac mini cloud.
Sources : documentation DeepSeek, arXiv:2606.19348, Hugging Face, Artificial Analysis. 20 juillet 2026.
FAQ
Quand deepseek-chat sera-t-il desactive ?
24 juillet 2026, 15:59 UTC. Migrez vers deepseek-v4-flash ou deepseek-v4-pro.
Quel est le tarif V4-Pro en heures creuses ?
Sortie 0,87 USD/M. Comparez avec le cout d'un nœud Mac dedie pour agents 7x24 : tarifs MACCOME.
DeepSeek V4 ou GPT-5.6 pour un workflow creatif sur Mac ?
V4-Pro pour volume, contexte 1M et auto-hebergement. GPT-5.6 Sol pour agents terminal. Hybride sur Mac cloud : ds4 local + API cloud selon la sensibilite des assets.
V4-Pro ou V4-Flash ?
Flash pour routage et taches legeres (cache hit 0,0028 USD/M entree). Pro pour raisonnement complexe et SWE-bench 80,6 %.
Comment heberger ds4 pour Cursor ?
Mac mini 128 Go+ avec ds4-server ; acces via SSH ou Tailscale depuis Cursor. Location : MACCOME tarifs location.
Agents V4 en production 7x24 ?
Gateway OpenClaw sur Mac cloud dedie — pas de sommeil portable. Voir plans MACCOME.