Public cible : developpeurs et responsables techniques qui choisissent leurs modeles via les classements OpenRouter, et non via des slides de benchmarks. Constat cle (donnees au 25 juillet 2026) : le Mimo V2.5 de Xiaomi mene avec 1,4T tokens/jour ; les laboratoires chinois representent environ 46 % du volume de la plateforme ; les Etats-Unis sont passes de ~70 % a 30–36 % en un an. Ce que vous obtenez : tableau Top 12, parts fournisseurs et applications, comparaison tarifaire, analyse volume vs qualite, previsions aout, exemple Python de routage et runbook en six etapes. Suite logique de notre analyse de juin et du guide API OpenRouter.
Synthese — 30 secondes
Source : OpenRouter, au 25 juillet 2026. Les classements evoluent chaque jour — verifiez avant de les citer en production.
| Rang | Modele | Fournisseur | Tokens/jour | Total 30 j | Note |
|---|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4T | 31,2T | Leader volume |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9B | 23,6T | Reference prix-performance |
| 3 | Hy3 | Tencent | 590B | 23,4T | Volume 30 j proche de DeepSeek |
| 4 | Nemotron 3 Ultra (free) | NVIDIA | 428,6B | 9T | Tier gratuit comme aimant |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7B | 11,6T | Branche Pro |
| 6 | GLM 5.2 | Z.ai | 316,7B | 13,3T | — |
| 7 | MiniMax M3 | MiniMax | 262,5B | 15,1T | — |
| 8 | Step 3.7 Flash | StepFun | 204,8B | 5,9T | — |
| 9 | Kimi K3 | Moonshot AI | 157,6B | 1,6T | Entree la plus rapide |
| 10 | Ling 3.0 Flash | InclusionAI | 128,3B | 417,3B | — |
| 11 | Gemini 3 Flash Preview | 106,3B | 4T | Representant US | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5B | 3,6T | Ancre qualite |
Lecture : neuf places sur douze reviennent a des modeles chinois. Nemotron 3 Ultra (free) demontre la force du prix zero — a reserver aux experiences non sensibles en production.
Fenetre glissante de sept jours. La part de marche et la depense sur taches difficiles racontent deux histoires distinctes.
| Fournisseur | Origine | Part (approx.) | Fait cle de juillet |
|---|---|---|---|
| DeepSeek | Chine | 16–18 % | V4 Flash + V4 Pro dans le Top 5 |
| Xiaomi | Chine | 8–18 % | Mimo V2.5 en tete |
| Anthropic | Etats-Unis | 10–15 % | Claude Opus 5 (24/07) |
| Tencent | Chine | 8–13 % | Hy3 stable Top 3 |
| Etats-Unis | 8–13 % | Gemini 3 Flash au Top 12 | |
| Z.ai | Chine | 4–7 % | GLM 5.2 regulier |
| OpenAI | Etats-Unis | 6–8 % | GPT-5.5 sur taches lourdes |
| NVIDIA | Etats-Unis | ~5 % | Nemotron tier gratuit |
| MiniMax | Chine | 4–8 % | M3 long contexte |
| Moonshot AI | Chine | 3–4 % | Explosion Kimi K3 |
| Alibaba Qwen | Chine | 1–4 % | Tiers Flash en concurrence |
| Chine total ~46 % · Etats-Unis total 30–36 % (il y a un an ~70 %) | |||
Classification difficile : Claude Sonnet 4.6 et Opus 4.7 a 13,5 % chacun ; GPT-5.5 a 11,6 %. Les leaders de volume y sont quasi absents.
Le classement modeles indique quel cerveau est appele. Le tableau applications montre qui ecrit le prompt.
| Rang | Application | Type | Part (approx.) |
|---|---|---|---|
| 1 | Hermes Agent | Agent CLI (Nous Research) | ~45 % |
| 2 | Kilo Code | Agent de code | ~13 % |
| 3 | OpenClaw | Gateway multi-modeles | ~9 % |
| 4 | Claude Code | Agent code (Anthropic) | ~6 % |
| 5 | Descript | Production de contenu | ~4,5 % |
| 6 | pi | Agent | ~3,3 % |
| 7 | Lemonade | Companion / gaming | ~2,1 % |
| 8 | ISEKAI ZERO | Roleplay | ~2,0 % |
| 9 | Janitor AI | Roleplay / dialogue | ~1,8 % |
| 10 | Cline | Agent code IDE | ~1,7 % |
La lignee Cline → Roo Code → Kilo Code illustre la vitesse d'iteration des outils open source. Si vous utilisez Kilo Code ou OpenClaw, auditez le modele par defaut — voir le guide des outils CLI OpenRouter.
| Modele | Entree / 1M | Sortie / 1M | Contexte | Positionnement |
|---|---|---|---|---|
| DeepSeek V4 Flash | ~0,05–0,14 USD | ~0,24–0,28 USD | 1M | API bulk la moins chere pour le code |
| Nemotron 3 Ultra | 0,42 USD (free dispo) | 2,61 USD | — | Open-weight US |
| MiniMax M3 | 0,10 USD | 1,21 USD | Long | Multimodal budget |
| GLM 5.2 | 0,45 USD | 3,31 USD | — | Planning open-weight renforce |
| Kimi K3 | ~3 USD | ~15 USD | 1M | 1,4TB de poids ouverts ; plus forte hausse |
| Claude Opus 5 | 5 USD (10 fast) | 25 USD (50 fast) | 1M | Frontier fermee |
Exemple : 1M entree + 3M sortie dans une boucle agent — DeepSeek V4 Flash environ 0,90–1,50 USD, Kimi K3 environ 48 USD, Claude Opus 5 environ 80 USD. Le routage par paliers est la reponse rationnelle, pas le choix d'un seul « meilleur LLM ».
# Routage OpenRouter par paliers — leaderboard juillet 2026
import os
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key=os.environ["OPENROUTER_API_KEY"],
)
ROUTES = {
"bulk": {
"model": "deepseek/deepseek-v4-flash",
"fallback": ["xiaomi/mimo-v2.5", "tencent/hy3"],
},
"code": {
"model": "deepseek/deepseek-v4-flash",
"fallback": ["z-ai/glm-5.2", "anthropic/claude-sonnet-5"],
},
"agent": {
"model": "moonshotai/kimi-k3",
"fallback": ["deepseek/deepseek-v4-pro", "minimax/minimax-m3"],
},
"critical": {
"model": "anthropic/claude-opus-5",
"fallback": ["google/gemini-3-flash-preview"],
},
}
def chat(task: str, messages: list) -> str:
route = ROUTES[task]
models = [route["model"], *route["fallback"]]
resp = client.chat.completions.create(
model=models[0],
extra_body={"models": models},
messages=messages,
)
return resp.choices[0].message.content
Production : externalisez la table de routage (JSON ou variables d'environnement) et bloquez les tiers gratuits sur les chemins critiques contenant des donnees sensibles.
Juillet 2026 n'est pas un recit « la Chine gagne tout », mais une compression des marges sur la couche volume tandis que les labs frontier defendent le premium. Hermes, Kilo Code ou OpenClaw sur un portable imposent sommeil et instabilite. Les noeuds Mac cloud MACCOME offrent un macOS reel, transfert SSH et isolation d'environnement pour un routage stable 24h/24 — tarifs et configuration.
Sources : classements et leaderboard applications OpenRouter, release Anthropic Opus 5. Chiffres au 25 juillet 2026 sauf mention contraire.
FAQ
Quel modele domine OpenRouter en juillet 2026 ?
Au 25/07 : Xiaomi Mimo V2.5 (1,4T/jour), puis DeepSeek V4 Flash (943,9B) et Tencent Hy3 (590B). Sur sept jours, DeepSeek reste le fournisseur le plus stable a 16–18 %. Donnees live : openrouter.ai/rankings.
Que signifie 46 % de part pour les modeles chinois ?
Les laboratoires chinois representent ~46 % du volume identifie ; les americains 30–36 %. Il y a un an : ~70 % pour les Etats-Unis. Volume et depense premium sur taches difficiles divergent.
Quelle est l'API LLM la moins chere pour le code ?
DeepSeek V4 Flash a environ 0,05–0,14 USD en entree et 0,24–0,28 USD en sortie par million de tokens, 1M de contexte. Pour un planning plus solide : GLM 5.2 ; escalade : Claude Opus 5 uniquement si les paliers inferieurs echouent.
Les classements OpenRouter mesurent-ils la qualite ?
Non. Ils classent le debit de tokens payes. Pour le meilleur LLM sur taches difficiles, regardez la depense en classification (Sonnet 4.6, Opus 4.7, GPT-5.5) et les benchmarks frontier, pas le volume seul.
Comment deployer un routage 24h/24 en production ?
Deployez un Gateway avec primaires et fallbacks tagues par tache sur un Mac cloud dedie. Voir les tarifs de location Mac mini MACCOME pour les noeuds M4/M4 Pro.
Qu'est-ce qui a change depuis juin ?
Mimo V2.5 a depasse DeepSeek V4 Flash en #1 quotidien ; Kimi K3 avec la plus forte hausse sur 30 jours ; Claude Opus 5 le 24/07. Comparaison : analyse juin 2026.