Pourquoi DeepSeek vient-il d’augmenter ses API jusqu’à 1 100 % — juste après l’offensive open-weight chinoise ?

Environ 20 min de lecture · MACCOME · Dernière mise à jour : 17 août 2026

En bref : entre le 12 et le 17 août, trois gestes chinois se sont répondus sans se ressembler. DeepSeek a relevé ses API jusqu’à plus de 1 100 %. Alibaba a, pour la première fois, publié les poids d’un fleuron de classe Max — Qwen3.8-Max, 2,4 billions de paramètres. Zhipu a fait bondir GLM-5.3 sur le même socle de 743 milliards, uniquement par post-entraînement. Cet article aligne la chronologie, les grilles, la licence et les autotests, pour montrer le basculement : on ne se bat plus seulement sur le prix affiché, mais sur le droit de le fixer. Contexte V4 et facturation heures de pointe : guide de migration DeepSeek V4 GA. Fenêtre Qwen : lecture de la sortie Qwen3.8-Max.

warning

En une phrase : trois sociétés, trois leviers, un même signal — les grands modèles chinois passent de la guerre des tarifs à la guerre du pouvoir de tarifer. Prix, licence et scores ont été recoupés sur des annonces publiques. Le service sur puce Zhenwu, la faille Cursor et la rumeur MOFCOM sont signalés plus bas comme non vérifiés.

Six points à trancher avant de croire au « +1 100 % »

Le chiffre du titre claque. Pour une équipe qui fait tourner des agents, pèse des poids ouverts et décortique une facture API, les vrais angles morts sont ailleurs :

  1. Les pourcentages ne parlent pas de la même ligne : « multiplié par 11 », « plus de 1 100 % » et « +350 % » sont tous exacts — entrée avec cache, sortie, entrée hors cache. Les mélanger fausse le budget.
  2. La fenêtre de pointe est trop souvent oubliée : à Pékin, 9 h–12 h et 14 h–18 h deviennent les heures chères. Le même volume, décalé ou non, peut doubler la note.
  3. « L’officiel est le moins cher » ne tient plus : aux heures de pointe, le tarif DeepSeek officiel dépasse déjà certaines reventes, notamment GMI Cloud et Novita.
  4. Poids ouverts n’égale pas Apache 2.0 : Qwen3.8-Max porte une licence sur mesure. Un MaaS ou un assistant de travail IA au-delà de 50 millions de dollars de revenus sur 12 mois doit négocier à part.
  5. La rumeur d’interdiction géographique a précédé le texte : la licence officielle n’interdit pas le téléchargement depuis les États-Unis, l’Union européenne, le Royaume-Uni ou la Corée. S’y fier, c’est mal juger la conformité.
  6. Un autotest n’est pas un feu vert de production : le saut de GLM-5.3 sur Terminal-Bench n’a pas encore de contre-mesure tierce, et le modèle reste derrière GPT-5.6 Sol et Claude Fable 5.

Ce qui s’est passé : deux semaines sur une seule ligne de temps

Reculons d’un cran. Le 30 juillet, OpenAI a déjà baissé de 80 % son étage le moins cher, GPT-5.6 Luna ; les 6 et 7 août, Luna est devenu le modèle par défaut des comptes gratuits, avec un dialogue texte illimité. Pendant que les acteurs chinois ajoutent de l’ouverture et des hausses, les acteurs américains ajoutent de la gratuité et des baisses. Ce n’est pas un hasard : ce sont les deux faces d’une même négociation sur le prix. Détail Luna : décryptage de la baisse GPT-5.6.

DateÉvénement
16 juilletMoonshot ouvre Kimi K3 (2,8 billions de paramètres), déjà sous le regard des autorités américaines
2–3 aoûtAlibaba annonce Qwen3.8-Max, puis ouvre l’API cloud
10 aoûtMeta publie Muse Glimmer (30 milliards, Apache 2.0) et annonce que les poids du fleuron Muse Spark 1.2 « seront bientôt ouverts »
12 aoûtAlibaba dépose les poids ouverts Qwen3.8-2.4T-A95B sur ModelScope et Hugging Face ; le même jour, xAI lance Grok 4.6
13 aoûtDeepSeek-V4-Pro passe en version définitive et annonce la hausse au 17 août ; Google publie Gemini 3.7 Flash à tarif réduit de moitié
14 aoûtZhipu lance GLM-5.3, sur le même socle de 743 milliards que GLM-5.2
17 août, 00:00 (Pékin)La nouvelle grille DeepSeek entre en vigueur

Les chiffres : grille DeepSeek, fiche Qwen, bancs GLM

Détail de la hausse DeepSeek (effet au 17 août 2026, 00:00 heure de Pékin ; pointe 9 h–12 h et 14 h–18 h)

Unité : yuan par million de tokens. L’entrée avec cache affiche la plus forte hausse (jusqu’à environ 12 fois, soit plus de 1 100 %), mais le montant absolu reste faible. Pour un usage intensif, ce sont surtout la sortie (+350 %) et l’entrée hors cache qui pèsent.

Poste (par million de tokens)AvantHeures creuses (nouveau)Heures de pointe (nouveau)Hausse (pointe)
V4-Flash, entrée avec cache¥0,02¥0,05¥0,10environ 400 %
V4-Flash, entrée hors cache¥1,0¥1,5¥3,0200 %
V4-Flash, sortie¥2,0¥4,5¥9,0350 %
V4-Pro, entrée avec cache¥0,025¥0,15¥0,30environ 1 100 %
V4-Pro, entrée hors cache¥3,0¥4,5¥9,0200 %
V4-Pro, sortie¥6,0¥13,5¥27,0350 %
info

Sources : annonce officielle DeepSeek, recoupée notamment via Wall Street CN, IT Home et V2EX. Le « 1 100 % » des titres ne concerne que l’entrée avec cache aux heures de pointe. La sortie à +350 % reste le poste dominant de la plupart des factures réelles.

Qwen3.8-2.4T-A95B (poids ouverts de Qwen3.8-Max) : fiche essentielle

C’est la première fois qu’Alibaba ouvre un modèle de classe Max. Jusqu’ici, Qwen3.5, 3.6 et 3.7 Max restaient des API fermées.

RubriqueDonnée
Échelle2,4 T de paramètres au total, 95 B actifs (MoE, 512 experts, 10 routés + 1 partagé)
Fenêtre de contextePoids ouverts : 262 144 tokens natifs, extensible à environ 1,01 M ; version hébergée Max : 1 M par défaut
CalendrierAnnonce le 2 août → API le 3 août → poids ouverts le 12 août
Tarif API (site international)Entrée 2 $ / M tokens, sortie 6 $ / M tokens
LicenceHors Apache 2.0 : licence personnalisée « Qwen3.8-Max License »
PortéePremier fleuron de classe Max ouvert par Alibaba

GLM-5.3 contre GLM-5.2 : même socle, post-entraînement seul

Les scores ci-dessous sont des autotests Zhipu ; aucune contre-mesure tierce indépendante n’a encore été publiée. Sur Terminal-Bench 3.0, GLM-5.3 reste derrière GPT-5.6 Sol (34,6 %) et Claude Fable 5 (33,7 %). Ce n’est pas un sacre général, plutôt une place dans le premier peloton des modèles ouverts.

Banc d’essaiGLM-5.2GLM-5.3Écart
Terminal-Bench 3.04,6 %28,3 %+23,7
DeepSWE v1.146,2 %66,9 %+20,7
Agents' Last Exam (CLI)23,8 %28,5 %+4,7
CyberGym77,2 %84,5 %+7,3
AutomationBench26,2 %48,2 %+22,0

Trois stratégies, trois logiques

1. DeepSeek : du tarif unique au prix selon l’heure — la tension compute devenue visible

On lit trop vite cette hausse comme un simple « alignement ». La structure dit autre chose : DeepSeek rend enfin lisible une facture de calcul qui, jusqu’ici, était lissée. Le tarif bas, sans distinction d’heure, servait à gagner de la masse, puis à diluer le coût grâce au cache et au décalage. Quand le volume d’appels explose et que les GPU ne suivent plus, le modèle casse. La phrase de l’annonce qui « encourage une planification plus souple des charges » se traduit sans détour : la capacité ne suffit plus, à vous de décaler.

Un détail change la donne. Après la hausse, le tarif officiel DeepSeek aux heures de pointe dépasse déjà certaines reventes — GMI Cloud et Novita, notamment, restent sous le prix de pointe officiel. L’hypothèse « l’officiel est le moins cher », qui soutenait longtemps le fossé concurrentiel de DeepSeek, est rompue pour la première fois.

2. Alibaba : ouvrir les poids pour l’écosystème, garder la licence pour le chiffre d’affaires

L’ouverture de Qwen3.8-Max n’est pas un don. Alibaba fait deux choses à la fois : les poids de 2,4 T deviennent téléchargeables, et cette archive porte une licence qui n’est plus Apache 2.0. Un service de modèle ou un assistant de travail IA dont le chiffre d’affaires dépasse 50 millions de dollars sur 12 mois doit négocier une autorisation commerciale. Un produit au-delà de 100 millions d’utilisateurs actifs mensuels, ou de 20 millions de dollars de revenus par mois, doit afficher le nom du modèle de façon visible.

La logique est claire : l’ouverture achète l’écosystème et la réputation — surtout hors de Chine, où l’idée qu’un modèle chinois « n’est pas présentable » reste tenace — tout en conservant un levier de prix sur les comptes qui génèrent vraiment du cash. C’est aussi pourquoi ce geste n’est pas du même ordre que Muse Glimmer de Meta, entièrement sous Apache 2.0, sans clause additionnelle. Pour le seuil d’ouverture de Kimi K3 : lecture de l’ouverture complète de Kimi K3.

Une rumeur a circulé plus vite que le texte : la licence interdirait le téléchargement aux utilisateurs des États-Unis, de l’Union européenne, du Royaume-Uni et de la Corée. C’est faux. L’original n’a aucune clause territoriale. Mérite d’être relu à la source, pas via un fil de commentaires.

3. Zhipu GLM-5.3 : ne pas changer le socle, seulement la recette de post-entraînement

Ce qui compte chez GLM-5.3 n’est pas seulement le score, c’est la manière de l’obtenir. Le socle est identique à GLM-5.2 — 743 milliards de paramètres, sans nouveau pré-entraînement. En élargissant seulement l’échelle des environnements d’apprentissage par renforcement, Terminal-Bench 3.0 passe de 4,6 % à 28,3 %, soit près de six fois. Cela confirme une tendance devenue nette depuis six mois : quand le rendement marginal du pré-entraînement s’essouffle, le post-entraînement par renforcement à grande échelle devient le nouveau levier — et ce levier coûte nettement moins cher que de réentraîner un socle à centaines de milliards. Des acteurs plus petits peuvent, eux aussi, « finir » un modèle déjà là.

Comparatif : après la hausse, DeepSeek reste-t-il le fleuron le moins cher ?

Conversion indicative à environ 7,15 yuans pour 1 dollar ; les annonces officielles font foi. En heures creuses, V4-Pro reste nettement sous Claude Opus 5, mais ce n’est plus le plancher du marché : Qwen3.8-Max sur le site international d’Alibaba et Luna d’OpenAI sont moins chers que le tarif creux DeepSeek. L’équation « chinois = le moins cher » se défait. La concurrence des prix entre dans une phase stratifiée.

ModèleEntrée (par million de tokens)Sortie (par million de tokens)Degré d’ouverture
DeepSeek V4-Pro (pointe)¥9,0 (environ 1,26 $)¥27,0 (environ 3,78 $)Poids non ouverts
DeepSeek V4-Pro (creux)¥4,5 (environ 0,63 $)¥13,5 (environ 1,89 $)Poids non ouverts
Qwen3.8-Max (site international)2 $6 $Ouvert (licence personnalisée)
OpenAI GPT-5.6 Luna0,20 $1,20 $Fermé
Claude Opus 5 (ordre de grandeur d’après les multiples publiés par Alibaba)environ 5 $environ 25 $Fermé

Litiges et détails à garder en vue

  • Le flou des pourcentages : « multiplié par 11 », « plus de 1 100 % », « +350 % » — tout est juste, mais chaque chiffre désigne un poste différent (entrée avec cache, sortie, entrée hors cache). Lire la ligne, pas seulement le titre.
  • Le service « Zhenwu M890 » : plusieurs médias financiers chinois affirment qu’une partie de l’inférence Qwen3.8-Max tournerait sur la puce maison Zhenwu M890 et le supernœud « Pangu AL128 ». On n’en trouve, à ce jour, ni document technique Alibaba autonome ni banc tierce. À traiter comme non vérifié.
  • La « faille grave Cursor » attribuée à GLM-5.3 : reprise par VentureBeat et par Zhipu ; le détail n’a pas été publié. Authenticité et périmètre restent à confirmer par un organisme de sécurité indépendant. Divulgation unilatérale du vendeur.
  • Une riposte export du ministère chinois du Commerce (MOFCOM) : certains articles évoquent des mesures de rétorsion sur l’IA et les semi-conducteurs. Aucune confirmation officielle à ce jour : conjecture ou rumeur, utile seulement comme toile de fond.

Contexte : ce n’est pas un accident isolé, c’est une guerre sur deux fronts

Remises dans un récit plus large, ces cinq journées s’inscrivent dans un rythme chinois de « trois mises à jour par semaine ». Outre DeepSeek, Alibaba et Zhipu, Moonshot a ouvert Kimi K3 le 16 juillet (2,8 T) et MiniMax a enchaîné avec H3. La presse économique intérieure y voit surtout une pression : les modèles ouverts chinois forcent le secteur mondial à revoir ses prix.

Les laboratoires américains prennent l’autre voie. OpenAI baisse fortement le 30 juillet (Luna −80 %), puis, les 6 et 7 août, place cette Luna soldée en modèle par défaut des comptes gratuits, avec un dialogue texte illimité. Google, le 13 août, publie Gemini 3.7 Flash à tarif réduit de moitié. D’un côté, fleuron ouvert et hausse par paliers ; de l’autre, gratuité grand public et défense par la baisse. Les deux mouvements se superposent et font d’août 2026 un nœud où la logique de prix des grands modèles se réécrit.

S’y ajoute la géopolitique. L’ouverture de Kimi K3 avait déjà attiré l’attention des autorités américaines. Qu’Alibaba choisisse cette fenêtre pour ouvrir un fleuron de 2,4 T a été lu, par certains analystes, comme une manière de figer l’influence internationale et le récit d’une parité technique avant un éventuel durcissement réglementaire. C’est en partie une lecture, mais c’est aussi un arrière-plan qu’on ne peut pas écarter pour comprendre le calendrier de cette vague.

Six étapes : passer de la hausse à une décision de facture et de routage

Ne vous laissez pas conduire par le pourcentage du titre. Ces six étapes transforment « est-ce que ça va coûter plus cher ? » en arbitrage exécutable :

  1. Marquer d’abord les fenêtres de pointe : découper les appels existants selon l’heure de Pékin — 9 h–12 h, 14 h–18 h, et le reste en creux — puis mesurer la part de tokens de chaque tranche.
  2. Séparer ensuite les postes : entrée avec cache, entrée hors cache, sortie. Le 1 100 % des titres ne frappe que le premier ; la sortie à +350 % porte la plupart des factures.
  3. Comparer officiel, revente et modèles de substitution : aux heures de pointe, DeepSeek officiel n’est pas forcément le moins cher. Contrôler en parallèle Qwen3.8-Max international (2 $ / 6 $) et GPT-5.6 Luna (0,20 $ / 1,20 $).
  4. Lire la licence originale, pas un résumé : usage personnel et interne peu touché. Seuls un MaaS ou un assistant de travail IA dont le chiffre d’affaires de cette activité dépasse 50 millions de dollars sur 12 mois doivent négocier une licence commerciale.
  5. Traiter GLM-5.3 comme un premier peloton ouvert, pas comme un ordre de bascule : autotest encore sans contre-mesure tierce ; Terminal-Bench 3.0 reste derrière Sol et Fable 5. Petit trafic de comparaison, pas de bascule totale d’un coup.
  6. Installer le décalage et l’inférence de poids ouverts sur un nœud permanent : un portable qui s’endort coupe la fenêtre creuse de nuit. Pour un ordonnancement 7×24, il faut une machine dédiée — traitements par lots, poids locaux, journaux d’audit.
python
# DeepSeek V4-Pro rough bill: peak vs off-peak on the output line only
# Prices from the 2026-08-17 schedule (CNY / million tokens)
PEAK_OUT, OFF_OUT = 27.0, 13.5

def monthly_output_bill(out_tokens_m, peak_share):
    peak = out_tokens_m * peak_share * PEAK_OUT
    off = out_tokens_m * (1 - peak_share) * OFF_OUT
    return round(peak + off, 2)

print(monthly_output_bill(10, 0.8))  # 80% peak → ¥243.0
print(monthly_output_bill(10, 0.2))  # 20% peak → ¥162.0

Trois faits durs à citer

  • Environ 1 100 % : entrée V4-Pro avec cache aux heures de pointe, de ¥0,025 à ¥0,30 par million de tokens. Le montant absolu reste petit ; c’est le plus grand titre.
  • 2,4 T / 95 B : Qwen3.8-2.4T-A95B totalise 2,4 billions de paramètres, 95 milliards actifs ; les poids ouverts naissent à 262 144 tokens, extensibles à environ 1,01 M.
  • 4,6 % → 28,3 % : sur le même socle de 743 milliards, GLM-5.3 multiplie presque par six Terminal-Bench 3.0, tout en restant derrière Sol (34,6 %) et Fable 5 (33,7 %).

Clôture : le pouvoir de tarifer s’est stratifié ; la capacité permanente, elle, se garde

Ces cinq jours d’août ont empilé trois gestes sur la même grille. DeepSeek inscrit la pénurie de calcul dans la facture, via le prix de pointe et de creux. Alibaba échange des poids ouverts contre un écosystème, et une licence sur mesure contre un levier de prix. Zhipu montre qu’une « finition » de post-entraînement peut rattraper le premier peloton. Pour les équipes qui font tourner des agents et des poids ouverts, trois goulets structurels restent :

  • La veille du portable coupe la fenêtre creuse : fermer le couvercle, c’est renoncer au tarif de nuit à Pékin ; la hausse du titre se reporte telle quelle sur la facture ;
  • Une machine de développement partagée est trop permise : clés API, fichiers de poids et files de lots sur le même ordinateur qui s’endort — on ne sait plus ni compter les heures, ni auditer la licence ;
  • Il manque un pivot d’ordonnancement 7×24 : décalage, inférence locale de poids ouverts et journaux d’appels exigent un nœud dédié, pas une fonction cloud provisoire.

Si vous voulez poser le décalage, l’inférence de poids ouverts et l’audit de facture API sur une topologie stable et isolable, les hôtes Mac cloud MACCOME offrent un macOS réel, une passation SSH et des frontières réseau maîtrisables, adaptés à une présence 7×24. Offre publique : tarifs de location Mac mini.

Sources : annonce officielle de hausse DeepSeek, recoupée via Wall Street CN, IT Home, des guides d’outils AIGC et des fils V2EX ; dépôts officiels Qwen (Hugging Face / ModelScope) et couverture SCMP sur les clauses de licence ; page technique officielle GLM-5.3 de Zhipu (Z.ai) ainsi que VentureBeat et StableLearn ; blog officiel Meta AI Research et VentureBeat sur Muse Glimmer ; synthèses Yicai et Sohu Finance sur le rythme de publication des grands modèles chinois. Compilation à partir d’informations publiques au moment de la rédaction. Prix, licence et scores sont à revérifier sur les dernières annonces officielles avant toute décision. Certains détails (service sur puce, découverte de faille, rumeur de contrôle à l’export) sont signalés dans le corps comme non vérifiés.

Questions fréquentes

Après cette hausse, DeepSeek va-t-il vraiment coûter plus cher ?

Cela dépend du profil d’usage. Si la plupart des appels tombent hors des fenêtres de pointe de Pékin (9 h–12 h et 14 h–18 h) et que le taux de cache reste élevé, la facture réelle d’un utilisateur intensif augmente souvent d’environ 1,8 fois — nettement moins que les 350 % ou 1 100 % des titres. En revanche, un trafic concentré aux heures de pointe, avec peu de cache, se rapproche des pourcentages affichés. Pour poser le décalage et l’audit de facture sur un nœud permanent : tarifs de location Mac mini MACCOME.

Un développeur indépendant peut-il commercialiser Qwen3.8-Max gratuitement ?

L’usage personnel et interne n’est en pratique pas touché. Si votre activité est un service de modèle (MaaS) ou un assistant de travail IA dont le chiffre d’affaires cumulé dépasse 50 millions de dollars sur les 12 derniers mois, une licence commerciale distincte doit être négociée avec Alibaba. Au-delà de 100 millions d’utilisateurs actifs mensuels, ou de 20 millions de dollars de revenus mensuels, le nom du modèle doit être affiché de façon visible.

GLM-5.3 et GLM-5.2 sont-ils le même modèle ? Pourquoi ce saut soudain ?

Le socle est identique : 743 milliards de paramètres. Zhipu n’a pas relancé le pré-entraînement. Le bond vient d’un post-entraînement qui a fortement élargi l’échelle des environnements d’apprentissage par renforcement. Les scores restent des autotests vendeur, encore sans contre-mesure tierce. Cela montre que, à ce stade, le post-entraînement à grande échelle est déjà un levier autonome : il n’est pas forcément nécessaire de réentraîner un socle plus grand.

La licence Qwen3.8-Max interdit-elle le téléchargement depuis les États-Unis ou l’Union européenne ?

Non. Cette interdiction géographique est fausse. Le texte officiel ne contient aucune clause territoriale ; les restrictions portent sur les services commercialisés au-delà de certains seuils de revenus, indépendamment du pays de l’utilisateur.

L’ouverture de Muse Glimmer par Meta annonce-t-elle le retour de l’esprit Llama ?

Pour l’instant, ce n’est qu’un retour partiel. Muse Glimmer est un modèle distillé de 30 milliards de paramètres sous Apache 2.0. Le fleuron fermé Muse Spark 1.2 n’est pas encore ouvert ; Mark Zuckerberg n’a fait qu’annoncer que ses poids le seraient plus tard. Si cette étape aboutit vraiment, ce serait la première fois qu’un laboratoire américain ouvre un fleuron jusqu’ici fermé — il faudra suivre la suite.