Zielgruppe: Entwickler und Tech-Leads, die Modelle ueber OpenRouter-Rankings statt Benchmark-Slides waehlen. Kernzahl (Stand 25.07.2026): Xiaomi Mimo V2.5 fuehrt mit 1,4T Tokens/Tag; chinesische Anbieter halten ~46 % des Plattformvolumens; US-Labs sanken von ~70 % auf 30–36 %. Sie erhalten: Top-12-Modelltabelle, Anbieter- und App-Rankings, Preisvergleich, Volumen-vs.-Qualitaet-Analyse, August-Ausblick, Python-Routing-Beispiel und 6-Schritte-Runbook inkl. DSGVO-Hinweisen. Ergaenzt die Juni-Analyse und den OpenRouter-API-Guide.
Kurzfassung — 30 Sekunden
Quelle: OpenRouter, Stand 25. Juli 2026. Rankings aktualisieren taeglich — vor Produktionsdokumentation verifizieren.
| Rang | Modell | Anbieter | Tokens/Tag | 30-Tage-Summe | Anmerkung |
|---|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4T | 31,2T | Volumenfuehrer |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9B | 23,6T | Preis-Leistungs-Benchmark |
| 3 | Hy3 | Tencent | 590B | 23,4T | 30-Tage-Volumen nahe DeepSeek |
| 4 | Nemotron 3 Ultra (free) | NVIDIA | 428,6B | 9T | Gratis-Tier als Traffic-Magnet |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7B | 11,6T | Pro-Abzweig |
| 6 | GLM 5.2 | Z.ai | 316,7B | 13,3T | — |
| 7 | MiniMax M3 | MiniMax | 262,5B | 15,1T | — |
| 8 | Step 3.7 Flash | StepFun | 204,8B | 5,9T | — |
| 9 | Kimi K3 | Moonshot AI | 157,6B | 1,6T | Schnellster Neuzugang |
| 10 | Ling 3.0 Flash | InclusionAI | 128,3B | 417,3B | — |
| 11 | Gemini 3 Flash Preview | 106,3B | 4T | US-Vertreter | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5B | 3,6T | Qualitaetsanker |
Signal: Neun von zwölf Plaetzen gehen an chinesische Modelle. Nemotron 3 Ultra (free) beweist: Nullpreis zieht Traffic — wenn jedoch EU-Personendaten im Prompt liegen, dann ist ein Gratis-Tier ohne AVV-Pruefung kein Produktionspfad.
Die folgende Tabelle fasst den 7-Tage-Fenster-Anteil zusammen. Wenn Sie Einkaufsentscheidungen treffen, dann trennen Sie Volumenfuehrer von Qualitaetsfuehrern.
| Anbieter | Herkunft | Anteil (ca.) | Juli-Schluesselereignis |
|---|---|---|---|
| DeepSeek | China | 16–18 % | V4 Flash + V4 Pro doppelt in Top 5 |
| Xiaomi | China | 8–18 % | Mimo V2.5 Spitzenreiter |
| Anthropic | USA | 10–15 % | Claude Opus 5 (24.07.) |
| Tencent | China | 8–13 % | Hy3 stabil Top 3 |
| USA | 8–13 % | Gemini 3 Flash im Top 12 | |
| Z.ai | China | 4–7 % | GLM 5.2 konstant |
| OpenAI | USA | 6–8 % | GPT-5.5 bei schweren Tasks |
| NVIDIA | USA | ~5 % | Nemotron free-Tier |
| MiniMax | China | 4–8 % | M3 Long-Context |
| Moonshot AI | China | 3–4 % | Kimi K3 Explosion |
| Alibaba Qwen | China | 1–4 % | Flash-Tiers verdraengen |
| China gesamt ~46 % · USA gesamt 30–36 % (vor einem Jahr USA ~70 %) | |||
Bei schwerer Klassifikation: Claude Sonnet 4.6 und Opus 4.7 je 13,5 %; GPT-5.5 11,6 %. Wenn Fehlertoleranz niedrig ist, dann routen Sie zu Opus 5 — unabhaengig vom Tagesvolumen.
Das Modell-Ranking zeigt, welches Gehirn aufgerufen wird. Die App-Tabelle zeigt, wer den Prompt schreibt.
| Rang | App | Typ | Anteil (ca.) |
|---|---|---|---|
| 1 | Hermes Agent | CLI-Agent (Nous Research) | ~45 % |
| 2 | Kilo Code | Coding-Agent | ~13 % |
| 3 | OpenClaw | Multi-Model-Gateway | ~9 % |
| 4 | Claude Code | Coding-Agent (Anthropic) | ~6 % |
| 5 | Descript | Content-Produktion | ~4,5 % |
| 6 | pi | Agent | ~3,3 % |
| 7 | Lemonade | Companion / Gaming | ~2,1 % |
| 8 | ISEKAI ZERO | Roleplay | ~2,0 % |
| 9 | Janitor AI | Roleplay / Dialog | ~1,8 % |
| 10 | Cline | IDE-Coding-Agent | ~1,7 % |
Die Fork-Kette Cline → Roo Code → Kilo Code zeigt: Der juengste Fork schlaegt die Vorgaenger im Volumen. Wenn Sie Kilo Code oder OpenClaw nutzen, dann pruefen Sie die Default-Model-ID — Details im CLI-Tools-Ranking-Guide.
| Modell | Input / 1M | Output / 1M | Kontext | Positionierung |
|---|---|---|---|---|
| DeepSeek V4 Flash | ~0,05–0,14 USD | ~0,24–0,28 USD | 1M | Guenstigste Bulk-API fuer Code |
| Nemotron 3 Ultra | 0,42 USD (free verfuegbar) | 2,61 USD | — | US Open-Weight; Datenschutz pruefen |
| MiniMax M3 | 0,10 USD | 1,21 USD | Lang | Budget-Multimodal |
| GLM 5.2 | 0,45 USD | 3,31 USD | — | Staerkeres Open-Weight-Planning |
| Kimi K3 | ~3 USD | ~15 USD | 1M | 1,4TB Open Weights; schnellster Steigerer |
| Claude Opus 5 | 5 USD (10 Fast) | 25 USD (50 Fast) | 1M | Geschlossene Frontier-Klasse |
Rechenbeispiel: 1M Input + 3M Output in einem Agent-Loop — DeepSeek V4 Flash ca. 0,90–1,50 USD, Kimi K3 ca. 48 USD, Claude Opus 5 ca. 80 USD. Wenn die Aufgabe kritisch ist, dann ist Opus 5 gerechtfertigt; wenn Bulk-Code generiert wird, dann ist Flash die rationale Wahl.
# Gestaffeltes OpenRouter-Routing — Juli-2026-Leaderboard
import os
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key=os.environ["OPENROUTER_API_KEY"],
)
ROUTES = {
"bulk": {
"model": "deepseek/deepseek-v4-flash",
"fallback": ["xiaomi/mimo-v2.5", "tencent/hy3"],
},
"code": {
"model": "deepseek/deepseek-v4-flash",
"fallback": ["z-ai/glm-5.2", "anthropic/claude-sonnet-5"],
},
"agent": {
"model": "moonshotai/kimi-k3",
"fallback": ["deepseek/deepseek-v4-pro", "minimax/minimax-m3"],
},
"critical": {
"model": "anthropic/claude-opus-5",
"fallback": ["google/gemini-3-flash-preview"],
},
}
def chat(task: str, messages: list) -> str:
route = ROUTES[task]
models = [route["model"], *route["fallback"]]
resp = client.chat.completions.create(
model=models[0],
extra_body={"models": models},
messages=messages,
)
return resp.choices[0].message.content
Produktionshinweis: Wenn Flash-Tier 429 oder Timeout liefert, dann greift die Fallback-Kette. Wenn personenbezogene Daten im Prompt sind, dann blockieren Sie Gratis-Modelle auf dem kritischen Pfad — unabhaengig vom Ranking.
Juli 2026 ist kein „China gewinnt alles“-Narrativ, sondern Margin Compression auf der Volumenschicht bei verteidigter Premium-Qualitaet. Wenn Sie Hermes, Kilo Code oder OpenClaw auf einem Laptop betreiben, dann zahlen Sie Sleep und Jitter. MACCOME Mac-Cloud-Knoten liefern echtes macOS, SSH-Uebergabe und Umgebungsisolation fuer stabiles 7x24-Routing — Mietpreise und Konfiguration.
Quellen: OpenRouter Rankings und Apps-Leaderboard, Anthropic Opus-5-Release. Alle Zahlen Stand 25.07.2026, sofern nicht anders angegeben.
FAQ
Welches Modell fuehrt OpenRouter im Juli 2026?
Stand 25.07.: Xiaomi Mimo V2.5 (1,4T/Tag), dann DeepSeek V4 Flash (943,9B) und Tencent Hy3 (590B). Woechentlich stabil #1: DeepSeek mit 16–18 %. Live: openrouter.ai/rankings.
Was bedeutet 46 % chinesischer Marktanteil?
Chinesische Labs halten ~46 % des identifizierten Token-Volumens; US-Labs 30–36 %. Vor einem Jahr: USA ~70 %. Wenn Sie nur Volumen sehen, dann unterschaetzen Sie die Premium-Ausgaben bei Claude und GPT auf schweren Tasks.
Welches ist die guenstigste LLM-API fuer Code?
DeepSeek V4 Flash bei ~0,05–0,14 USD Input und ~0,24–0,28 USD Output pro 1M Tokens, 1M Kontext. Fuer staerkeres Planning: GLM 5.2; Eskalation: Claude Opus 5 nur bei Fehlern der guenstigen Stufe.
Welche DSGVO-Risiken hat OpenRouter-Routing?
Wenn EU-Personendaten in Prompts landen, dann pruefen Sie Datenresidenz, AVV und Subprocessor-Liste je Provider. Gratis-Tiers (z. B. Nemotron free) nur fuer nicht-sensitive Experimente. Details im API-Guide mit DSGVO-Abschnitt.
Wie betreibe ich gestaffeltes Routing 7x24?
Gateway mit task-getaggten Primaries und Fallbacks auf einem dedizierten Mac-Cloud-Host deployen. Siehe MACCOME Mac-mini-Mietpreise fuer M4/M4-Pro-Knoten.
Was hat sich seit Juni geaendert?
Mimo V2.5 ueberholte DeepSeek V4 Flash als Tages-#1; Kimi K3 mit schnellstem 30-Tage-Anstieg; Claude Opus 5 am 24.07. Vergleich: Juni-2026-Analyse.