Alibaba Qwen3.8-Max : 2,4T parametres, top 5 Arena — l'etiquette open source precede les poids
Environ 16 min de lecture·MACCOME·Derniere mise a jour : 4 aout 2026
Public cible : developpeurs et responsables techniques qui evaluent les modeles frontier chinois, le cout des agents et la credibilite open source. Le 3 aout 2026, Alibaba a annonce la GA de Qwen3.8-Max (2,4T total / 950B actifs, 1M de contexte), avec le produit agent « Qwen Office » — 5e place Arena texte, mais tous les benchmarks sont internes Alibaba, et le label open source est affiche sans poids publies. Vous obtiendrez : chronologie, tableau de donnees, matrice Kimi K3 / DeepSeek V4, analyse de la controverse open source, runbook en six etapes et FAQ. Structure : risques → timeline → architecture → concurrence → controverse → runbook → conclusion. Contexte Kimi K3 : liberation Kimi K3.
bolt
TL;DR — 30 secondes
03.08. GA : API Qwen3.8-Max disponible, 2/6 USD par 1M (entree/sortie) — sous Claude Opus 5 et Fable 5 ; « Qwen Office » face a Tencent WorkBuddy et Kimi Work.
Arena 5e : Texte 1496 points (Preliminary), seul non-Anthropic du top 8 ; vision 2e derriere Fable 5.
Open source en attente : qwen.ai affiche « Open-Source », Hugging Face / ModelScope vides — poids prevus vers le 10 aout (Qwen3.8-Max + Qwen3.8-27B).
Concurrence : test aveugle Kimi K3 83 vs Qwen preview 80 — segment equivalent, pas de domination claire.
Six pieges frequents la semaine du lancement
Confondre le label « Open-Source » avec des poids disponibles : qwen.ai etiquete des le jour GA, mais au 4 aout aucun depot HF ni licence — intention, pas livrable.
Traiter les scores Alibaba comme verdict independant : PaperBench 93,0, OSWorld 86,1 proviennent de frameworks internes ; Artificial Analysis n'a pas reproduit la GA.
Sous-estimer le decalage de transparence preview : le 19 juillet, pas de parametres actifs ; 950B annonces seulement a la GA — critique des evaluateurs independants.
Estimer le deploiement local sur 2,4T total : en MoE, le cout suit ~950B actifs ; deploiement complet exige un datacenter multi-noeuds.
Ignorer l'interdiction production en preview : ToS du 19.07. interdisait l'automatisation prod, sans model card — A/B post-GA recommande.
Evaluer des agents longue duree sur MacBook : showcases 16 jours ou 500+ etapes exigent un noeud 24h/24 ; pour workflows creatifs Apple (Final Cut, Xcode, pipelines agentiques), la veille du portable coupe les sessions.
Chronologie : de la preview a la GA en deux semaines
16 juil. : Moonshot publie Kimi K3 (2,8T, 16/896 experts actifs) avec rapport technique.
19 juil. : Preview Qwen3.8-Max sur Token Plan / Qoder / QoderWork — 10 % du prix final, sans benchmarks.
27 juil. : Poids Kimi K3 sur Hugging Face.
31 juil. : DeepSeek V4-Flash GA — 9 benchmarks agent/code au-dessus de V4-Pro preview sans inflation parametrique.
3 aout : GA Qwen3.8-Max, table complete de benchmarks, « Qwen Office » ; action Alibaba +7 % HK / +4,5 % US.
vers 10 aout : Poids Qwen3.8-Max et Qwen3.8-27B prevus sur Hugging Face / ModelScope — date et licence a confirmer.
Champ
Qwen3.8-Max
Date
2026-08-03 (GA)
Total / actifs
2,4T / 950B
Architecture
MoE sparse sur Qwen3.5 + attention hybride
Contexte
1M tokens (thinking ~983k, sortie max ~131k)
API (international)
Entree 2 USD / sortie 6 USD par 1M
Arena texte (01.08.)
5e, 1496 (Preliminary)
PaperBench (Alibaba)
93,0 (+28,2 vs generation precedente)
SWE-bench Pro (Alibaba)
67,7 (Fable 5 : 80,0)
Open weight
Promis, non publie au 4 aout
Architecture : efficacite MoE plutot que course aux parametres
Pourquoi MoE + attention hybride
2,4T total avec 950B actives — cout d'inference proche d'un modele centaines de milliards, pas de materialiser 2,4T. Base des tarifs API 2/6 USD vs Claude Opus 5 (5/25) et Fable 5 (10/50) : l'efficacite comme levier prix.
reasoning_effort : low / medium / xhigh
Controle via enable_thinking ou reasoning.effort (compatibilite Anthropic) — adapter la profondeur de raisonnement au cout token.
Codage autonome 16 jours, optimisation puce 500+ etapes, RecreationBench — traces partielles sur GitHub qwen-code-dev-bot/oh-my-cli, sans audit tiers complet.
Ecosysteme : du modele au produit agent
« Qwen Office » plus API OpenAI/Anthropic — chaine Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw. Pour equipes creatives sur Mac : Qwen alimente deja Apple Intelligence en Chine ; un gateway agent stable sur Mac mini dedie evite la coupure de session a la fermeture du clapet.
Modele
Editeur
Total/actifs
Prix in/out par 1M
Open weight
Evaluation tierce
Qwen3.8-Max
Alibaba
2,4T / 950B
2 / 6 USD
En attente
Pas de repro GA
Kimi K3
Moonshot
2,8T / ~500B
3 / 15 USD
Oui (27 juil.)
Artificial Analysis ~57,11
DeepSeek V4-Flash
DeepSeek
comme V4-Pro
non publie entierement
Oui
9 benchmarks > V4-Pro
Claude Fable 5
Anthropic
inconnu
10 / 50 USD
Non
Arena texte #1
Claude Opus 5
Anthropic
inconnu
5 / 25 USD
Non
Arena elite
Controverse : open source affiche avant les poids
Label vs artefact : « Open-Source » des le GA, aucun depot HF/ModelScope — promesse « semaine prochaine ».
Origine des benchmarks : QwenSWEBench, RecreationBench — frameworks Alibaba ; plateformes neutres sans replique GA.
Notes de bas de page : « Fable 5 possible fallback » sans methodologie equivalente publiee.
Preview opaque : interdiction automation prod le 19.07., pas de model card — A/B conseille avant migration.
Cela n'invalide pas Qwen3.8-Max — test aveugle (269 fichiers architecture) : K3 83, Qwen preview 80. Les affirmations de domination sur GPT-5.6 Sol et Fable 5 restent a confirmer par poids et reproduction tierce.
Contexte marche : course aux parametres et a l'efficacite
Echelle trillion : DeepSeek V4-Pro (1,6T) → Qwen3.8-Max (2,4T) → Kimi K3 (2,8T) ; V4-Flash montre des gains agent sans scaling pur.
Alibaba revient a l'open weight : premiere promesse au tier Max — aux cotes de K3 et DeepSeek.
Grand public : Qwen via Apple Intelligence China — rayon commercial au-dela de l'API.
Regulation : 4 aout, Maison Blanche avec OpenAI, Anthropic, Google, Meta sur tests securite agents — contraste avec acceleration open weight en Chine.
Runbook en six etapes apres la GA
Separer essai API et migration prod : preview interdisait l'automation — post-GA, A/B sur trafic non critique vs Kimi K3 ou Opus 5.
reasoning_effort par tache : low/medium pour routine ; xhigh pour agents longs — baseline tokens.
Niveaux de preuve : interne Alibaba → Arena Preliminary → test aveugle — apres le 10 aout, repro identite et benchmarks.
Agent longue duree sur noeud dedie : OpenClaw Gateway + API Qwen3.8-Max — pas de veille portable ; ideal pour pipelines creatifs 7j/7 sur Mac cloud.
Apres le 10 aout : verifier depot HF, licence, Qwen3.8-27B pour besoins on-prem — mettre a jour la table de routage interne.
Trois chiffres pour la revue technique
Ecart tarifaire : 2/6 USD vs Opus 5 (5/25) ~40 % en entree, vs Fable 5 (10/50) ~20 % — 950B actifs comme base.
Arena texte #5 / vision #2 : 1496 (Preliminary), seul non-Anthropic top 8 — classements provisoires.
Test aveugle : K3 83 vs Qwen preview 80 — 3 points, meme segment.
Conclusion : verifier d'abord, migrer ensuite
Qwen3.8-Max replace Alibaba au centre du recit frontier : MoE 2,4T, top 5 Arena, Qwen Office integre — mais label open source en avance sur les poids et absence de repro tierce imposent essai API → niveaux de preuve → migration prod.
Sur MacBook portable, Qwen3.8-Max + OpenClaw + fallback multi-fournisseurs souffrent de veille, jitter reseau et cles dispersees — incompatible avec agents autonomes 16 jours ou workflows creatifs Apple 24h/24 (rendu, export, CI Xcode). MACCOME Mac Cloud fournit macOS reel, passation SSH et isolation — OpenClaw et Qoder CLI stables sur instance dediee. Tarifs : location Mac mini.
Qwen3.8-Max est-il utilisable maintenant ? Open source ?
API via QwenCloud, compatible OpenAI et Anthropic. Poids non publies — Hugging Face / ModelScope vers le 10 aout, annonce officielle faisant foi.
Qwen3.8-Max ou Kimi K3 — lequel est le plus fort ?
Pas de benchmark unifie. Test aveugle : K3 83, Qwen preview 80. K3 : open weight + tierces parties ; Qwen : API moins chere, multimodal plus riche. Voir analyse Kimi K3.
2,4T est-ce inabordable pour une equipe normale ?
L'API suit 950B actifs — cout proche centaines de milliards. Deploiement complet exige datacenter ; option realiste : Qwen3.8-27B apres open weight.
Peut-on faire confiance aux benchmarks Alibaba ?
Reference oui, verdict non — frameworks internes, pas de repro GA neutre. A/B metier ou evaluations tierces a suivre.
Comment faire tourner des agents Qwen3.8-Max 24h/24 en prod ?