En bref : entre le 12 et le 17 août, trois gestes chinois se sont répondus sans se ressembler. DeepSeek a relevé ses API jusqu’à plus de 1 100 %. Alibaba a, pour la première fois, publié les poids d’un fleuron de classe Max — Qwen3.8-Max, 2,4 billions de paramètres. Zhipu a fait bondir GLM-5.3 sur le même socle de 743 milliards, uniquement par post-entraînement. Cet article aligne la chronologie, les grilles, la licence et les autotests, pour montrer le basculement : on ne se bat plus seulement sur le prix affiché, mais sur le droit de le fixer. Contexte V4 et facturation heures de pointe : guide de migration DeepSeek V4 GA. Fenêtre Qwen : lecture de la sortie Qwen3.8-Max.
En une phrase : trois sociétés, trois leviers, un même signal — les grands modèles chinois passent de la guerre des tarifs à la guerre du pouvoir de tarifer. Prix, licence et scores ont été recoupés sur des annonces publiques. Le service sur puce Zhenwu, la faille Cursor et la rumeur MOFCOM sont signalés plus bas comme non vérifiés.
Le chiffre du titre claque. Pour une équipe qui fait tourner des agents, pèse des poids ouverts et décortique une facture API, les vrais angles morts sont ailleurs :
Reculons d’un cran. Le 30 juillet, OpenAI a déjà baissé de 80 % son étage le moins cher, GPT-5.6 Luna ; les 6 et 7 août, Luna est devenu le modèle par défaut des comptes gratuits, avec un dialogue texte illimité. Pendant que les acteurs chinois ajoutent de l’ouverture et des hausses, les acteurs américains ajoutent de la gratuité et des baisses. Ce n’est pas un hasard : ce sont les deux faces d’une même négociation sur le prix. Détail Luna : décryptage de la baisse GPT-5.6.
| Date | Événement |
|---|---|
| 16 juillet | Moonshot ouvre Kimi K3 (2,8 billions de paramètres), déjà sous le regard des autorités américaines |
| 2–3 août | Alibaba annonce Qwen3.8-Max, puis ouvre l’API cloud |
| 10 août | Meta publie Muse Glimmer (30 milliards, Apache 2.0) et annonce que les poids du fleuron Muse Spark 1.2 « seront bientôt ouverts » |
| 12 août | Alibaba dépose les poids ouverts Qwen3.8-2.4T-A95B sur ModelScope et Hugging Face ; le même jour, xAI lance Grok 4.6 |
| 13 août | DeepSeek-V4-Pro passe en version définitive et annonce la hausse au 17 août ; Google publie Gemini 3.7 Flash à tarif réduit de moitié |
| 14 août | Zhipu lance GLM-5.3, sur le même socle de 743 milliards que GLM-5.2 |
| 17 août, 00:00 (Pékin) | La nouvelle grille DeepSeek entre en vigueur |
Unité : yuan par million de tokens. L’entrée avec cache affiche la plus forte hausse (jusqu’à environ 12 fois, soit plus de 1 100 %), mais le montant absolu reste faible. Pour un usage intensif, ce sont surtout la sortie (+350 %) et l’entrée hors cache qui pèsent.
| Poste (par million de tokens) | Avant | Heures creuses (nouveau) | Heures de pointe (nouveau) | Hausse (pointe) |
|---|---|---|---|---|
| V4-Flash, entrée avec cache | ¥0,02 | ¥0,05 | ¥0,10 | environ 400 % |
| V4-Flash, entrée hors cache | ¥1,0 | ¥1,5 | ¥3,0 | 200 % |
| V4-Flash, sortie | ¥2,0 | ¥4,5 | ¥9,0 | 350 % |
| V4-Pro, entrée avec cache | ¥0,025 | ¥0,15 | ¥0,30 | environ 1 100 % |
| V4-Pro, entrée hors cache | ¥3,0 | ¥4,5 | ¥9,0 | 200 % |
| V4-Pro, sortie | ¥6,0 | ¥13,5 | ¥27,0 | 350 % |
Sources : annonce officielle DeepSeek, recoupée notamment via Wall Street CN, IT Home et V2EX. Le « 1 100 % » des titres ne concerne que l’entrée avec cache aux heures de pointe. La sortie à +350 % reste le poste dominant de la plupart des factures réelles.
C’est la première fois qu’Alibaba ouvre un modèle de classe Max. Jusqu’ici, Qwen3.5, 3.6 et 3.7 Max restaient des API fermées.
| Rubrique | Donnée |
|---|---|
| Échelle | 2,4 T de paramètres au total, 95 B actifs (MoE, 512 experts, 10 routés + 1 partagé) |
| Fenêtre de contexte | Poids ouverts : 262 144 tokens natifs, extensible à environ 1,01 M ; version hébergée Max : 1 M par défaut |
| Calendrier | Annonce le 2 août → API le 3 août → poids ouverts le 12 août |
| Tarif API (site international) | Entrée 2 $ / M tokens, sortie 6 $ / M tokens |
| Licence | Hors Apache 2.0 : licence personnalisée « Qwen3.8-Max License » |
| Portée | Premier fleuron de classe Max ouvert par Alibaba |
Les scores ci-dessous sont des autotests Zhipu ; aucune contre-mesure tierce indépendante n’a encore été publiée. Sur Terminal-Bench 3.0, GLM-5.3 reste derrière GPT-5.6 Sol (34,6 %) et Claude Fable 5 (33,7 %). Ce n’est pas un sacre général, plutôt une place dans le premier peloton des modèles ouverts.
| Banc d’essai | GLM-5.2 | GLM-5.3 | Écart |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | +23,7 |
| DeepSWE v1.1 | 46,2 % | 66,9 % | +20,7 |
| Agents' Last Exam (CLI) | 23,8 % | 28,5 % | +4,7 |
| CyberGym | 77,2 % | 84,5 % | +7,3 |
| AutomationBench | 26,2 % | 48,2 % | +22,0 |
On lit trop vite cette hausse comme un simple « alignement ». La structure dit autre chose : DeepSeek rend enfin lisible une facture de calcul qui, jusqu’ici, était lissée. Le tarif bas, sans distinction d’heure, servait à gagner de la masse, puis à diluer le coût grâce au cache et au décalage. Quand le volume d’appels explose et que les GPU ne suivent plus, le modèle casse. La phrase de l’annonce qui « encourage une planification plus souple des charges » se traduit sans détour : la capacité ne suffit plus, à vous de décaler.
Un détail change la donne. Après la hausse, le tarif officiel DeepSeek aux heures de pointe dépasse déjà certaines reventes — GMI Cloud et Novita, notamment, restent sous le prix de pointe officiel. L’hypothèse « l’officiel est le moins cher », qui soutenait longtemps le fossé concurrentiel de DeepSeek, est rompue pour la première fois.
L’ouverture de Qwen3.8-Max n’est pas un don. Alibaba fait deux choses à la fois : les poids de 2,4 T deviennent téléchargeables, et cette archive porte une licence qui n’est plus Apache 2.0. Un service de modèle ou un assistant de travail IA dont le chiffre d’affaires dépasse 50 millions de dollars sur 12 mois doit négocier une autorisation commerciale. Un produit au-delà de 100 millions d’utilisateurs actifs mensuels, ou de 20 millions de dollars de revenus par mois, doit afficher le nom du modèle de façon visible.
La logique est claire : l’ouverture achète l’écosystème et la réputation — surtout hors de Chine, où l’idée qu’un modèle chinois « n’est pas présentable » reste tenace — tout en conservant un levier de prix sur les comptes qui génèrent vraiment du cash. C’est aussi pourquoi ce geste n’est pas du même ordre que Muse Glimmer de Meta, entièrement sous Apache 2.0, sans clause additionnelle. Pour le seuil d’ouverture de Kimi K3 : lecture de l’ouverture complète de Kimi K3.
Une rumeur a circulé plus vite que le texte : la licence interdirait le téléchargement aux utilisateurs des États-Unis, de l’Union européenne, du Royaume-Uni et de la Corée. C’est faux. L’original n’a aucune clause territoriale. Mérite d’être relu à la source, pas via un fil de commentaires.
Ce qui compte chez GLM-5.3 n’est pas seulement le score, c’est la manière de l’obtenir. Le socle est identique à GLM-5.2 — 743 milliards de paramètres, sans nouveau pré-entraînement. En élargissant seulement l’échelle des environnements d’apprentissage par renforcement, Terminal-Bench 3.0 passe de 4,6 % à 28,3 %, soit près de six fois. Cela confirme une tendance devenue nette depuis six mois : quand le rendement marginal du pré-entraînement s’essouffle, le post-entraînement par renforcement à grande échelle devient le nouveau levier — et ce levier coûte nettement moins cher que de réentraîner un socle à centaines de milliards. Des acteurs plus petits peuvent, eux aussi, « finir » un modèle déjà là.
Conversion indicative à environ 7,15 yuans pour 1 dollar ; les annonces officielles font foi. En heures creuses, V4-Pro reste nettement sous Claude Opus 5, mais ce n’est plus le plancher du marché : Qwen3.8-Max sur le site international d’Alibaba et Luna d’OpenAI sont moins chers que le tarif creux DeepSeek. L’équation « chinois = le moins cher » se défait. La concurrence des prix entre dans une phase stratifiée.
| Modèle | Entrée (par million de tokens) | Sortie (par million de tokens) | Degré d’ouverture |
|---|---|---|---|
| DeepSeek V4-Pro (pointe) | ¥9,0 (environ 1,26 $) | ¥27,0 (environ 3,78 $) | Poids non ouverts |
| DeepSeek V4-Pro (creux) | ¥4,5 (environ 0,63 $) | ¥13,5 (environ 1,89 $) | Poids non ouverts |
| Qwen3.8-Max (site international) | 2 $ | 6 $ | Ouvert (licence personnalisée) |
| OpenAI GPT-5.6 Luna | 0,20 $ | 1,20 $ | Fermé |
| Claude Opus 5 (ordre de grandeur d’après les multiples publiés par Alibaba) | environ 5 $ | environ 25 $ | Fermé |
Remises dans un récit plus large, ces cinq journées s’inscrivent dans un rythme chinois de « trois mises à jour par semaine ». Outre DeepSeek, Alibaba et Zhipu, Moonshot a ouvert Kimi K3 le 16 juillet (2,8 T) et MiniMax a enchaîné avec H3. La presse économique intérieure y voit surtout une pression : les modèles ouverts chinois forcent le secteur mondial à revoir ses prix.
Les laboratoires américains prennent l’autre voie. OpenAI baisse fortement le 30 juillet (Luna −80 %), puis, les 6 et 7 août, place cette Luna soldée en modèle par défaut des comptes gratuits, avec un dialogue texte illimité. Google, le 13 août, publie Gemini 3.7 Flash à tarif réduit de moitié. D’un côté, fleuron ouvert et hausse par paliers ; de l’autre, gratuité grand public et défense par la baisse. Les deux mouvements se superposent et font d’août 2026 un nœud où la logique de prix des grands modèles se réécrit.
S’y ajoute la géopolitique. L’ouverture de Kimi K3 avait déjà attiré l’attention des autorités américaines. Qu’Alibaba choisisse cette fenêtre pour ouvrir un fleuron de 2,4 T a été lu, par certains analystes, comme une manière de figer l’influence internationale et le récit d’une parité technique avant un éventuel durcissement réglementaire. C’est en partie une lecture, mais c’est aussi un arrière-plan qu’on ne peut pas écarter pour comprendre le calendrier de cette vague.
Ne vous laissez pas conduire par le pourcentage du titre. Ces six étapes transforment « est-ce que ça va coûter plus cher ? » en arbitrage exécutable :
# DeepSeek V4-Pro rough bill: peak vs off-peak on the output line only
# Prices from the 2026-08-17 schedule (CNY / million tokens)
PEAK_OUT, OFF_OUT = 27.0, 13.5
def monthly_output_bill(out_tokens_m, peak_share):
peak = out_tokens_m * peak_share * PEAK_OUT
off = out_tokens_m * (1 - peak_share) * OFF_OUT
return round(peak + off, 2)
print(monthly_output_bill(10, 0.8)) # 80% peak → ¥243.0
print(monthly_output_bill(10, 0.2)) # 20% peak → ¥162.0
Ces cinq jours d’août ont empilé trois gestes sur la même grille. DeepSeek inscrit la pénurie de calcul dans la facture, via le prix de pointe et de creux. Alibaba échange des poids ouverts contre un écosystème, et une licence sur mesure contre un levier de prix. Zhipu montre qu’une « finition » de post-entraînement peut rattraper le premier peloton. Pour les équipes qui font tourner des agents et des poids ouverts, trois goulets structurels restent :
Si vous voulez poser le décalage, l’inférence de poids ouverts et l’audit de facture API sur une topologie stable et isolable, les hôtes Mac cloud MACCOME offrent un macOS réel, une passation SSH et des frontières réseau maîtrisables, adaptés à une présence 7×24. Offre publique : tarifs de location Mac mini.
Sources : annonce officielle de hausse DeepSeek, recoupée via Wall Street CN, IT Home, des guides d’outils AIGC et des fils V2EX ; dépôts officiels Qwen (Hugging Face / ModelScope) et couverture SCMP sur les clauses de licence ; page technique officielle GLM-5.3 de Zhipu (Z.ai) ainsi que VentureBeat et StableLearn ; blog officiel Meta AI Research et VentureBeat sur Muse Glimmer ; synthèses Yicai et Sohu Finance sur le rythme de publication des grands modèles chinois. Compilation à partir d’informations publiques au moment de la rédaction. Prix, licence et scores sont à revérifier sur les dernières annonces officielles avant toute décision. Certains détails (service sur puce, découverte de faille, rumeur de contrôle à l’export) sont signalés dans le corps comme non vérifiés.
Questions fréquentes
Après cette hausse, DeepSeek va-t-il vraiment coûter plus cher ?
Cela dépend du profil d’usage. Si la plupart des appels tombent hors des fenêtres de pointe de Pékin (9 h–12 h et 14 h–18 h) et que le taux de cache reste élevé, la facture réelle d’un utilisateur intensif augmente souvent d’environ 1,8 fois — nettement moins que les 350 % ou 1 100 % des titres. En revanche, un trafic concentré aux heures de pointe, avec peu de cache, se rapproche des pourcentages affichés. Pour poser le décalage et l’audit de facture sur un nœud permanent : tarifs de location Mac mini MACCOME.
Un développeur indépendant peut-il commercialiser Qwen3.8-Max gratuitement ?
L’usage personnel et interne n’est en pratique pas touché. Si votre activité est un service de modèle (MaaS) ou un assistant de travail IA dont le chiffre d’affaires cumulé dépasse 50 millions de dollars sur les 12 derniers mois, une licence commerciale distincte doit être négociée avec Alibaba. Au-delà de 100 millions d’utilisateurs actifs mensuels, ou de 20 millions de dollars de revenus mensuels, le nom du modèle doit être affiché de façon visible.
GLM-5.3 et GLM-5.2 sont-ils le même modèle ? Pourquoi ce saut soudain ?
Le socle est identique : 743 milliards de paramètres. Zhipu n’a pas relancé le pré-entraînement. Le bond vient d’un post-entraînement qui a fortement élargi l’échelle des environnements d’apprentissage par renforcement. Les scores restent des autotests vendeur, encore sans contre-mesure tierce. Cela montre que, à ce stade, le post-entraînement à grande échelle est déjà un levier autonome : il n’est pas forcément nécessaire de réentraîner un socle plus grand.
La licence Qwen3.8-Max interdit-elle le téléchargement depuis les États-Unis ou l’Union européenne ?
Non. Cette interdiction géographique est fausse. Le texte officiel ne contient aucune clause territoriale ; les restrictions portent sur les services commercialisés au-delà de certains seuils de revenus, indépendamment du pays de l’utilisateur.
L’ouverture de Muse Glimmer par Meta annonce-t-elle le retour de l’esprit Llama ?
Pour l’instant, ce n’est qu’un retour partiel. Muse Glimmer est un modèle distillé de 30 milliards de paramètres sous Apache 2.0. Le fleuron fermé Muse Spark 1.2 n’est pas encore ouvert ; Mark Zuckerberg n’a fait qu’annoncer que ses poids le seraient plus tard. Si cette étape aboutit vraiment, ce serait la première fois qu’un laboratoire américain ouvre un fleuron jusqu’ici fermé — il faudra suivre la suite.