OpenRouter Juli 2026: Chinesische Modelle bei 46 % — Wer gewinnt den KI-Traffic wirklich?

Ca. 20 Min. Lesezeit · MACCOME · Zuletzt aktualisiert: 27. Juli 2026

Zielgruppe: Entwickler und Tech-Leads, die Modelle ueber OpenRouter-Rankings statt Benchmark-Slides waehlen. Kernzahl (Stand 25.07.2026): Xiaomi Mimo V2.5 fuehrt mit 1,4T Tokens/Tag; chinesische Anbieter halten ~46 % des Plattformvolumens; US-Labs sanken von ~70 % auf 30–36 %. Sie erhalten: Top-12-Modelltabelle, Anbieter- und App-Rankings, Preisvergleich, Volumen-vs.-Qualitaet-Analyse, August-Ausblick, Python-Routing-Beispiel und 6-Schritte-Runbook inkl. DSGVO-Hinweisen. Ergaenzt die Juni-Analyse und den OpenRouter-API-Guide.

insights

Kurzfassung — 30 Sekunden

  • Tages-#1 (25.07.): Mimo V2.5 (Xiaomi) mit 1,4T Tokens/Tag. DeepSeek V4 Flash zweitens (943,9B). Neun von zwölf Top-Modellen stammen aus China.
  • Stabiler Anbieter-#1: DeepSeek haelt 16–18 % woechentlichen Anteil; das Monatsmodell rotiert innerhalb des chinesischen Lagers.
  • Haengematten-Markt: Guenstige Open-Modelle dominieren Volumen; Claude und GPT halten schwere Aufgaben. Opus 5 (24.07.) verteidigt die Premium-Seite bei 5/25 USD pro 1M Tokens.
  • Versteckte Haelfte: Hermes Agent (~45 % App-Anteil) lenkt enormes Volumen, das Enterprise-Berichte selten abbilden.

Sechs Fehlinterpretationen: Was Teams bei den Juli-Rankings falsch lesen

  1. Wenn Tages-#1 gleich Qualitaets-#1 gesetzt wird, dann unterschaetzt man die Preislogik. Mimo V2.5 fuehrt am 25.07., doch bei schwerer Klassifikation teilen sich Claude Sonnet 4.6 und Opus 4.7 mit je 13,5 % die Spitze.
  2. Wenn die strukturelle Umkehr ignoriert wird, dann verpasst man den Einkaufsdruck. US-Modelle fielen in 12 Monaten von ~70 % auf 30–36 %; China stieg auf ~46 % — Preiskampf plus Open-Weight-Oekosystem, nicht Sentiment.
  3. Wenn nur das Modell- und nicht das App-Ranking gelesen wird, dann erklaert sich der Traffic nicht. Hermes Agent haelt ~45 % App-Tokens; Kilo Code ~13 %. Ihr Framework routet oft vor Ihrer manuellen Auswahl.
  4. Wenn nur Input-Preise verglichen werden, dann explodieren Agent-Kosten. DeepSeek V4 Flash: 0,05–0,14 USD Input / 0,24–0,28 USD Output pro 1M; Kimi K3: ~3/15 USD. Output liegt in Agent-Loops typischerweise 3–10x ueber Input.
  5. Wenn ein einziger Provider hardcodiert wird, dann entsteht technische Schuld. Mimo V2.5 existierte im Juni noch nicht; Kimi K3 stieg am schnellsten ein — monatliche #1 rotiert.
  6. Wenn Agent-Gateways auf Laptops laufen, dann zahlen Sie Sleep, Jitter und Datenschutzrisiken. Wenn personenbezogene EU-Daten verarbeitet werden, dann gehoert DSGVO-Compliance in die Routing-Matrix — nicht erst nach dem Audit.

Juli 2026 Modell-Rankings: Top 12 nach taeglichem Token-Volumen

Quelle: OpenRouter, Stand 25. Juli 2026. Rankings aktualisieren taeglich — vor Produktionsdokumentation verifizieren.

RangModellAnbieterTokens/Tag30-Tage-SummeAnmerkung
1Mimo V2.5Xiaomi1,4T31,2TVolumenfuehrer
2DeepSeek V4 FlashDeepSeek943,9B23,6TPreis-Leistungs-Benchmark
3Hy3Tencent590B23,4T30-Tage-Volumen nahe DeepSeek
4Nemotron 3 Ultra (free)NVIDIA428,6B9TGratis-Tier als Traffic-Magnet
5DeepSeek V4 ProDeepSeek413,7B11,6TPro-Abzweig
6GLM 5.2Z.ai316,7B13,3T
7MiniMax M3MiniMax262,5B15,1T
8Step 3.7 FlashStepFun204,8B5,9T
9Kimi K3Moonshot AI157,6B1,6TSchnellster Neuzugang
10Ling 3.0 FlashInclusionAI128,3B417,3B
11Gemini 3 Flash PreviewGoogle106,3B4TUS-Vertreter
12Claude Sonnet 5Anthropic99,5B3,6TQualitaetsanker

Signal: Neun von zwölf Plaetzen gehen an chinesische Modelle. Nemotron 3 Ultra (free) beweist: Nullpreis zieht Traffic — wenn jedoch EU-Personendaten im Prompt liegen, dann ist ein Gratis-Tier ohne AVV-Pruefung kein Produktionspfad.

Anbieteranteile und Volumen-vs.-Qualitaet

Die folgende Tabelle fasst den 7-Tage-Fenster-Anteil zusammen. Wenn Sie Einkaufsentscheidungen treffen, dann trennen Sie Volumenfuehrer von Qualitaetsfuehrern.

AnbieterHerkunftAnteil (ca.)Juli-Schluesselereignis
DeepSeekChina16–18 %V4 Flash + V4 Pro doppelt in Top 5
XiaomiChina8–18 %Mimo V2.5 Spitzenreiter
AnthropicUSA10–15 %Claude Opus 5 (24.07.)
TencentChina8–13 %Hy3 stabil Top 3
GoogleUSA8–13 %Gemini 3 Flash im Top 12
Z.aiChina4–7 %GLM 5.2 konstant
OpenAIUSA6–8 %GPT-5.5 bei schweren Tasks
NVIDIAUSA~5 %Nemotron free-Tier
MiniMaxChina4–8 %M3 Long-Context
Moonshot AIChina3–4 %Kimi K3 Explosion
Alibaba QwenChina1–4 %Flash-Tiers verdraengen
China gesamt ~46 % · USA gesamt 30–36 % (vor einem Jahr USA ~70 %)

Ausgabenstruktur nach Aufgabentyp

  • Allgemeiner Chat: 35,7 %
  • Agentische Workloads: 30,4 %
  • Code: 26,5 %
  • Datenverarbeitung: 7,5 %

Bei schwerer Klassifikation: Claude Sonnet 4.6 und Opus 4.7 je 13,5 %; GPT-5.5 11,6 %. Wenn Fehlertoleranz niedrig ist, dann routen Sie zu Opus 5 — unabhaengig vom Tagesvolumen.

App-Ebene: Agent-Frameworks als Traffic-Verteiler

Das Modell-Ranking zeigt, welches Gehirn aufgerufen wird. Die App-Tabelle zeigt, wer den Prompt schreibt.

RangAppTypAnteil (ca.)
1Hermes AgentCLI-Agent (Nous Research)~45 %
2Kilo CodeCoding-Agent~13 %
3OpenClawMulti-Model-Gateway~9 %
4Claude CodeCoding-Agent (Anthropic)~6 %
5DescriptContent-Produktion~4,5 %
6piAgent~3,3 %
7LemonadeCompanion / Gaming~2,1 %
8ISEKAI ZERORoleplay~2,0 %
9Janitor AIRoleplay / Dialog~1,8 %
10ClineIDE-Coding-Agent~1,7 %

Die Fork-Kette Cline → Roo Code → Kilo Code zeigt: Der juengste Fork schlaegt die Vorgaenger im Volumen. Wenn Sie Kilo Code oder OpenClaw nutzen, dann pruefen Sie die Default-Model-ID — Details im CLI-Tools-Ranking-Guide.

Preisvergleich: Volumenfuehrer vs. Qualitaetsfuehrer

ModellInput / 1MOutput / 1MKontextPositionierung
DeepSeek V4 Flash~0,05–0,14 USD~0,24–0,28 USD1MGuenstigste Bulk-API fuer Code
Nemotron 3 Ultra0,42 USD (free verfuegbar)2,61 USDUS Open-Weight; Datenschutz pruefen
MiniMax M30,10 USD1,21 USDLangBudget-Multimodal
GLM 5.20,45 USD3,31 USDStaerkeres Open-Weight-Planning
Kimi K3~3 USD~15 USD1M1,4TB Open Weights; schnellster Steigerer
Claude Opus 55 USD (10 Fast)25 USD (50 Fast)1MGeschlossene Frontier-Klasse

Rechenbeispiel: 1M Input + 3M Output in einem Agent-Loop — DeepSeek V4 Flash ca. 0,90–1,50 USD, Kimi K3 ca. 48 USD, Claude Opus 5 ca. 80 USD. Wenn die Aufgabe kritisch ist, dann ist Opus 5 gerechtfertigt; wenn Bulk-Code generiert wird, dann ist Flash die rationale Wahl.

August-Ausblick, Runbook und Python-Routing

Fuenf Variablen fuer August 2026

  1. Chinesischer Gesamtanteil koennte 50 % ueberschreiten, sofern US-Anbieter Listenpreise nicht senken.
  2. Monats-#1 rotiert weiter — im Juni DeepSeek, im Juli Xiaomi; Architektur-Elasticitaet schlaegt Modell-Wetten.
  3. Anthropic koennte ein guenstigeres Volumen-Tier nach Opus 5 nachlegen.
  4. Kimi K3 Community-Quantisierung in 2–4 Wochen nach 1,4TB-Weight-Release; siehe Opus-5/K3-Analyse.
  5. Sicherheit und Governance (Sandbox-Escape, AI Kill Switch Act, White-House-Review) werden Einkaufskriterium — relevant fuer DSGVO-konforme Agent-Workloads.

Sechs-Schritte-Runbook nach Juli-Daten

  1. Routing-Tabelle exportieren: OpenRouter-Dashboard, 30-Tage-Top-3-Modelle und Stueckkosten markieren; mit Juni-Baseline vergleichen.
  2. Nach Aufgabentyp staffeln: Dialog/Agent/Code/Data — Defaults Mimo V2.5 oder DeepSeek V4 Flash; kritisch Opus 5 oder GPT-5.5.
  3. Agent-Framework-Defaults auditieren: Hermes Agent, Kilo Code, OpenClaw — ~45 % Traffic kommt ueber Hermes.
  4. Kostenalarme setzen: Kimi K3 vs. Flash ist 20–60x Preisdelta; ein falsch gerouteter Long-Session-Agent verbrennt Wochenbudget.
  5. Fallback-Ketten konfigurieren: Model-IDs in Config, nicht im Code; 429/Timeout: Flash → Pro → Frontier.
  6. 7x24-Knoten deployen: Gateway auf dediziertem Mac-Cloud-Host; DSGVO: API-Keys pro Umgebung, keine personenbezogenen Daten in Gratis-Tiers. Tarife: MACCOME Mietpreise.
python
# Gestaffeltes OpenRouter-Routing — Juli-2026-Leaderboard
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key=os.environ["OPENROUTER_API_KEY"],
)

ROUTES = {
    "bulk": {
        "model": "deepseek/deepseek-v4-flash",
        "fallback": ["xiaomi/mimo-v2.5", "tencent/hy3"],
    },
    "code": {
        "model": "deepseek/deepseek-v4-flash",
        "fallback": ["z-ai/glm-5.2", "anthropic/claude-sonnet-5"],
    },
    "agent": {
        "model": "moonshotai/kimi-k3",
        "fallback": ["deepseek/deepseek-v4-pro", "minimax/minimax-m3"],
    },
    "critical": {
        "model": "anthropic/claude-opus-5",
        "fallback": ["google/gemini-3-flash-preview"],
    },
}

def chat(task: str, messages: list) -> str:
    route = ROUTES[task]
    models = [route["model"], *route["fallback"]]
    resp = client.chat.completions.create(
        model=models[0],
        extra_body={"models": models},
        messages=messages,
    )
    return resp.choices[0].message.content
warning

Produktionshinweis: Wenn Flash-Tier 429 oder Timeout liefert, dann greift die Fallback-Kette. Wenn personenbezogene Daten im Prompt sind, dann blockieren Sie Gratis-Modelle auf dem kritischen Pfad — unabhaengig vom Ranking.

Drei Zahlen fuer das Tech-Review

  • 46 % China, 12-Monats-Sprung: von unter 2 % auf ~46 %; USA von ~70 % auf 30–36 %.
  • 14x Volumen-Gap: Mimo V2.5 (1,4T/Tag) vs. Claude Sonnet 5 (99,5B/Tag) — Qualitaet und Popularitaet divergieren.
  • 45 % App-Konzentration: Hermes Agent allein; Top 3 Apps (Hermes + Kilo Code + OpenClaw) ~67 %.

Juli 2026 ist kein „China gewinnt alles“-Narrativ, sondern Margin Compression auf der Volumenschicht bei verteidigter Premium-Qualitaet. Wenn Sie Hermes, Kilo Code oder OpenClaw auf einem Laptop betreiben, dann zahlen Sie Sleep und Jitter. MACCOME Mac-Cloud-Knoten liefern echtes macOS, SSH-Uebergabe und Umgebungsisolation fuer stabiles 7x24-Routing — Mietpreise und Konfiguration.

Quellen: OpenRouter Rankings und Apps-Leaderboard, Anthropic Opus-5-Release. Alle Zahlen Stand 25.07.2026, sofern nicht anders angegeben.

FAQ

Welches Modell fuehrt OpenRouter im Juli 2026?

Stand 25.07.: Xiaomi Mimo V2.5 (1,4T/Tag), dann DeepSeek V4 Flash (943,9B) und Tencent Hy3 (590B). Woechentlich stabil #1: DeepSeek mit 16–18 %. Live: openrouter.ai/rankings.

Was bedeutet 46 % chinesischer Marktanteil?

Chinesische Labs halten ~46 % des identifizierten Token-Volumens; US-Labs 30–36 %. Vor einem Jahr: USA ~70 %. Wenn Sie nur Volumen sehen, dann unterschaetzen Sie die Premium-Ausgaben bei Claude und GPT auf schweren Tasks.

Welches ist die guenstigste LLM-API fuer Code?

DeepSeek V4 Flash bei ~0,05–0,14 USD Input und ~0,24–0,28 USD Output pro 1M Tokens, 1M Kontext. Fuer staerkeres Planning: GLM 5.2; Eskalation: Claude Opus 5 nur bei Fehlern der guenstigen Stufe.

Welche DSGVO-Risiken hat OpenRouter-Routing?

Wenn EU-Personendaten in Prompts landen, dann pruefen Sie Datenresidenz, AVV und Subprocessor-Liste je Provider. Gratis-Tiers (z. B. Nemotron free) nur fuer nicht-sensitive Experimente. Details im API-Guide mit DSGVO-Abschnitt.

Wie betreibe ich gestaffeltes Routing 7x24?

Gateway mit task-getaggten Primaries und Fallbacks auf einem dedizierten Mac-Cloud-Host deployen. Siehe MACCOME Mac-mini-Mietpreise fuer M4/M4-Pro-Knoten.

Was hat sich seit Juni geaendert?

Mimo V2.5 ueberholte DeepSeek V4 Flash als Tages-#1; Kimi K3 mit schnellstem 30-Tage-Anstieg; Claude Opus 5 am 24.07. Vergleich: Juni-2026-Analyse.