OpenRouter Rankings Juli 2026:
Wer gewinnt wirklich das KI-Modell-Rennen?

Wer im Juli 2026 noch ein LLM nach einem Benchmark-Chart von vor zwei Monaten wählt, trifft Entscheidungen auf veralteten Annahmen. OpenRouter — der größte neutrale LLM-Routing-Marktplatz — veröffentlicht etwas Ehrlicheres als jede Hersteller-Ankündigung: echtes, bezahltes Produktions-Token-Volumen über Hunderte Modelle. Die Rankings messen nicht, wer einen Test gewinnt, sondern wem Entwickler genug vertrauen, um echten Traffic mit echtem Geld dorthin zu leiten.

Dieser Artikel richtet sich an Entwickler und Tech-Leads mit Agent-, CLI-Coding- oder Hybrid-API-Workflows auf dem Mac. Auf Basis von OpenRouter-Daten bis 25. Juli 2026 analysieren wir die drei Juli-Schlagzeilen (Xiaomi auf #1, chinesische Labs nahe 46% Anteil, Kimi K3 in den Top 10), die Nutzung-vs-Qualität-Hantel, Hermes/Kilo-Code-Dominanz auf App-Ebene, eine Preismatrix, den August-Ausblick und ein Sechs-Schritte-Hybrid-Routing-Playbook. Sie wissen danach, was die Zahlen bedeuten, welche Aufgaben ein Premium-Modell verdienen und wie Sie einen Stack bauen, der nicht von einer Wochenrangliste abhängt.

01 OpenRouter Rankings lesen: drei Fehler, die Juli-2026-Entscheidungen verzerren

OpenRouter sortiert nach Token-Volumen — im Wesentlichen das, wofür Entwickler in Produktion bezahlen, nicht wer eine Leaderboard-Spitze hält. Diese Lücke zwischen Nutzung und Fähigkeit ist der Rahmen, bevor Sie Julis Board lesen. Im Vergleich zu unserer Juni-2026-Zusammenfassung tauchen drei Fehler ständig auf:

  • Tagesvolumen-#1 als „bestes Modell“ behandeln: Ein günstiges, schnelles Modell in einer hoch frequentierten Consumer-App kann ein fähigeres Modell überholen, das nur für die schwersten 10% reserviert ist. Am 25. Juli führte Xiaomis Mimo V2.5 mit rund 1,4 Billionen Token/Tag — eine Preis-und-Reichweite-Geschichte, keine universelle Qualitätskrone.
  • Tagesvolatilität ignorieren: Rankings bewegen sich schnell. Claude Opus 4.8 lag in den Wochendaten vom 24. Juli in den Top 10; am 25. Juli hatte Ling 3.0 Flash ihn aus den Top 12 gedrängt. Monatsreihen schlagen Tages-Snapshots.
  • Nur Modelle, nicht Apps betrachten: Allein Hermes Agent hält etwa 45% des erfassten App-Token-Anteils. Roleplay- und Companion-Apps bewegen ernsthaftes Volumen, das Enterprise-AI-Berichterstattung selten erwähnt — ein versteckter Markt, der „wer nutzt was“ verzerrt.

Kernaussage: Die Rankings beantworten, wer die tägliche Token-Rechnung trägt; Ausgaben nach Aufgabenkategorie beantworten, wer Premium-Preise für die schwerste Arbeit verdient. Beides lesen.

Für EU-Unternehmen: Prompts, Code und Agent-Logs können personenbezogene oder geschäftskritische Daten enthalten. Cloud-Routing ohne Auftragsverarbeitung und Löschkonzept kollidiert schnell mit DSGVO-Pflichten — unabhängig vom gewählten Modell.

Offizielle Boards aktualisieren täglich — vor dem Zitieren prüfen:

https://openrouter.ai/rankings

https://openrouter.ai/apps

02 OpenRouter Juli 2026: Xiaomi auf #1, chinesische Modelle bei ~46% Anteil

Stand 25. Juli 2026 führen die Top drei nach täglichem Token-Volumen Xiaomi Mimo V2.5 (1,4T/Tag), DeepSeek V4 Flash (943,9B/Tag) und Tencent Hy3 (590B/Tag). Sieben der Top-10-Plätze gehören chinesischen Labs; Nemotron 3 Ultra (NVIDIA), Claude Sonnet 5 und Gemini 3 Flash Preview halten für die US-Seite Stand.

Modell-Token-Volumen Top 12 (Stand 2026-07-25, täglich)
Rang Modell Anbieter Token/Tag 30-Tage-Summe
1 Mimo V2.5 Xiaomi 1,4T 31,2T
2 DeepSeek V4 Flash DeepSeek 943,9B 23,6T
3 Hy3 Tencent 590B 23,4T
4 Nemotron 3 Ultra 550B (free) NVIDIA 428,6B 9T
5 DeepSeek V4 Pro DeepSeek 413,7B 11,6T
6 GLM 5.2 Z.ai 316,7B 13,3T
7 MiniMax M3 MiniMax 262,5B 15,1T
8 Step 3.7 Flash StepFun 204,8B 5,9T
9 Kimi K3 Moonshot AI 157,6B 1,6T (Neueinstieg)
10 Ling 3.0 Flash InclusionAI 128,3B 417,3B
11 Gemini 3 Flash Preview Google 106,3B 4T
12 Claude Sonnet 5 Anthropic 99,5B 3,6T

Auf Anbieter-Ebene machen chinesische Labs (DeepSeek, Xiaomi, Tencent, Z.ai, MiniMax, Moonshot, Alibaba) rund 46% des identifizierten Token-Volumens aus — vor einem Jahr noch unter 2%. US-Modelle (OpenAI, Anthropic, Google kombiniert) liegen bei etwa 30–36%, gegenüber ~70% vor einem Jahr.

Anbieter-Token-Anteil (gemischte ~7-Tage-Schätzungen)
Anbieter Herkunft Anteil (ca.)
DeepSeek China 16%–18%
Xiaomi China 8%–18%
Anthropic USA 10%–15%
Tencent China 8%–13%
Google USA 8%–13%
OpenAI USA 6%–8%

Preise treiben die Verschiebung: DeepSeek V4 Flash liegt bei etwa 0,05–0,14 USD/M Input-Token gegenüber GPT-5.5 nahe 5,00 USD/M — eine Lücke von etwa 35×. DeepSeek bleibt der stabilste #1-Anbieter nach Anteil (16–18%), während die „Modell-des-Monats“-Krone rotiert — MiniMax M2.5 im Februar, MiMo-V2-Pro im April, Mimo V2.5 im Juli.

03 Volumenführer ist nicht Qualitätsführer: Hantel-Markt und Claude Opus 5 Preismacht

OpenRouters Ausgaben nach Aufgabenkategorie erzählen eine andere Geschichte als reine Token-Zahlen: Allgemeiner Chat 35,7%, agentische Workflows 30,4%, Code 26,5%, Datenarbeit 7,5%. Im schwersten Bucket — Klassifikation und komplexes Reasoning — teilen sich Claude Sonnet 4.6 und Claude Opus 4.7 je 13,5% der Ausgaben, GPT-5.5 liegt mit 11,6% dritter. Die günstigen Open-Modelle der Volumen-Charts tauchen hier kaum auf.

Der Markt spaltet sich: Günstige chinesische Open-Weight-Modelle absorbieren hochvolumige, fehlertolerante Workloads (Chat, Kreatives, Roleplay, Routine-Coding), während geschlossene Frontier-Modelle auf harter, fehlerintoleranter Arbeit Preismacht behalten. Anthropics Juli-24-Launch von Claude Opus 5 führte FrontierBench v0.1 mit 43,3% an (gegenüber GPT-5.6 Sols 37,5%) bei Opus-Preisen von 5/25 USD pro Million Token.

Preise und Positionierung (Auswahl — Live-OpenRouter-Raten prüfen)
Modell Input/M Output/M Kontext Positionierung
DeepSeek V4 Flash ~$0,05–0,14 ~$0,24–0,28 1M Bester Wert; Agentic-Coding-Default
MiniMax M3 $0,10 $1,21 Long context Budget-Multimodal / Bild-Input
GLM 5.2 $0,45 $3,31 Open-Weight Opus-Style-Planung
Kimi K3 ~$3 ~$15 1M 1,4TB Open Weights, Closed-Tier-Fähigkeit
Claude Opus 5 $5 (Fast-Tier $10) $25 (Fast-Tier $50) 1M Geschlossene Frontier; Top Juli-Benchmark

04 Was wirklich genutzt wird: Coding-Agenten führen, Roleplay ist die unsichtbare Hälfte

Modell-Rankings zeigen, welches „Gehirn“ beliebt ist. Das App-Leaderboard (openrouter.ai/apps) zeigt, wofür dieses Gehirn in Produktion arbeitet.

App-/Agent-Layer Top 10 (OpenRouter Apps, nach Token, ca.)
Rang App Kategorie Anteil (ca.)
1 Hermes Agent Persönlicher Agent / CLI ~45%
2 Kilo Code Coding-Agent ~13%
3 OpenClaw Allgemeiner Agent ~9%
4 Claude Code Coding-Agent ~6%
5 Descript Content-Produktion ~4,5%
6 pi Agent ~3,3%
7 Lemonade Companion / Gaming ~2,1%
8 ISEKAI ZERO Roleplay ~2,0%
9 Janitor AI Roleplay ~1,8%
10 Cline Coding-Agent (IDE) ~1,7%
  • Cline → Roo Code → Kilo Code sind drei Generationen derselben Open-Source-Linie; der jüngste Fork Kilo Code hat beide Vorgänger überholt — First-Mover-Vorteil in Dev-Tools hält nicht ewig.
  • Roleplay- und Companion-Apps (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) bewegen gemeinsam ernsthaftes Volumen. Der OpenRouter × a16z State of AI Report fand, dass kreatives Roleplay mehr als die Hälfte aller Open-Model-Nutzung ausmacht — wer AI-Nutzung nur aus Enterprise-Schlagzeilen kennt, übersieht die Hälfte des Marktes.

05 August-Ausblick und praktische Empfehlungen nach Rolle

Auf Basis der Juli-Trajektorie und des Branchenkontexts erwarten wir für August:

  1. Chinesische Open-Weight-Kombination dürfte Richtung oder über 50% klettern, sofern kein US-Anbieter eine echte Preisbewegung macht.
  2. Die „Modell-des-Monats“-Krone rotiert weiter — Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax und Moonshot shippen und re-pricen schnell genug, dass ein neuer #1 im August nicht überrascht.
  3. Anthropic könnte ein günstigeres Volumen-Tier shippen, statt nur auf Opus 5 zu setzen — Opus 5 ist Anthropics vierte Flaggschiff-Linie in unter zwei Monaten (nach Mythos 5, Fable 5 und Sonnet 5).
  4. Kimi K3s 1,4-Terabyte Open Weights dürften in 2–4 Wochen Community-Quantization sehen, analog früherer Mega-Releases.
  5. Sicherheit und Governance werden echte Auswahlkriterien: OpenAIs Sandbox-Escape unveröffentlichter Modelle, der vorgeschlagene US „AI Kill Switch Act“ und erwartete White-House-Pre-Release-Reviews drücken Vendor-Safety-Track-Records in formale Enterprise-Scorecards — in der EU zusätzlich unter DSGVO, AI Act und Auftragsverarbeitungs-Pflichten.

Einzelentwickler und kleine Teams: OpenRouter bleibt der schnellste Weg, Dutzende Modelle hinter einem API-Key zu A/B-testen. Starten Sie Coding-Workloads auf DeepSeek V4 Flash und GLM 5.2; reservieren Sie Premium-Closed-Modelle für Schritte, wo günstige Modelle wirklich scheitern. Latenz selbst messen — OpenRouter ist nicht für jede Region oder Compliance optimiert.

Infrastruktur-Leads: Modelle nicht allein nach Nutzungsrang wählen — der spiegelt Preissensibilität, nicht Eignung für Ihre Workload. Hochvolumiges/niedrig-riskantes Routing zu günstigen Modellen, harte/hochriskante Arbeit zu Frontier-Closed-Modellen; Vendor-Safety-Historie in die Scorecard aufnehmen. Für EU-Enterprise: Datenresidenz, AV-Verträge und DSGVO-konforme Logging-Pfade vor dem Skalieren festlegen.

Agent- und Coding-Tool-Builder: Die Cline → Kilo-Code-Fork-Kette erinnert daran, dass Moats in Open-Source-Dev-Tools dünner sind als sie wirken. Wer Entertainment- oder Companion-Szenarien bedient, sollte dieses Segment nicht unterschätzen.

06 Sechs Schritte zum Hybrid-Routing-Stack: zitierbare Daten und CALMVPS-Abschluss

  1. Bei OpenRouter registrieren und Kosten-Dashboard bauen: API-Key anlegen, Ausgaben nach Modell und Projekt taggen, Rankings-Seite wöchentlich prüfen, damit Ihr Default-Modell nicht versteinert.
  2. Gestufte Routing-Regeln definieren: Workflows in Tier-0 (Autocomplete/Zusammenfassung), Tier-1 (Multi-File-Refactors), Tier-2 (Langlauf-Agenten) teilen. Tier-0 auf DeepSeek V4 Flash oder Mimo V2.5; Tier-2 auf Claude Opus 5.
  3. Austauschbare Modell-Konfiguration in CLI-Tools aktivieren: Claude Code, Kilo Code, Hermes Agent und OpenClaw akzeptieren OpenRouter-Model-IDs per Env oder Config — nie ein einzelnes Endpoint hardcoden.
  4. Self-Host-Pfad für Open Weights reservieren: Bei compliance-sensiblen Daten MiniMax M3, DeepSeek V4, GLM 5.2 oder Kimi K3 on-prem evaluieren — relevant für DSGVO und EU-Datenresidenz; auf dem Mac Ollama oder LM Studio als Offline-Fallback.
  5. 7×24-Orchestrierungsschicht auf dem Mac betreiben: Agent-Gateways, geplante Batch-Jobs und SSH-Tunnel dürfen nicht am zugeklappten Laptop hängen. launchd oder Bare-Metal-Mac, damit Routing und Log-Sammlung online bleiben.
  6. August-Release-Kalender sperren und A/B-Cutovers vorbereiten: Anthropics Volumen-Tier, Kimi-K3-Community-Quant-Builds und August-Ship-Kadenz chinesischer Labs beobachten; Shadow-Traffic und Rollback-Schalter vor Release-Woche.
  • Xiaomi Mimo V2.5 tägliche Token: etwa 1,4T, Modell-Rang #1 am 25. Juli
  • Chinesische Anbieter kombiniert: etwa 46% (vor einem Jahr unter 2%); US-Big-Three nahe 30–36%
  • DeepSeek V4 Flash vs GPT-5.5 Input-Lücke: etwa 35× (0,05–0,14 USD/M vs ~5 USD/M)
  • Hermes Agent App-Anteil: etwa 45%, größte Einzel-App der Plattform
  • Claude Opus 5 FrontierBench v0.1: 43,3%, über GPT-5.6 Sols 37,5%

Die Juli-Geschichte: Fähigkeit und Popularität divergieren. Chinesische Open-Weight-Modelle kauften mit Preis die Hälfte des Marktes. US-Closed-Frontier-Labs verteidigen die andere Hälfte mit Preismacht auf harter Arbeit und Safety-Glaubwürdigkeit. Die nützlichere Frage für Builder ist nicht „wer ist diese Woche #1“, sondern auf welcher Seite der Hantel Ihre Workload wirklich liegt.

Hybrid-Routing auf dem Mac offenbart vertraute Lücken: MacBook-Sleep trennt Agenten und OpenRouter-Callbacks; ein Linux-VPS kann Claude Codes macOS-native Sandbox nicht ausführen; virtualisierte Macs zahlen Metal- und Berechtigungs-Strafen gegenüber Bare Metal; ein maxed Mac Studio bringt Beschaffungszeit und Abschreibung. Teams mit Bedarf an 7×24-Uptime und elastischer M4/M4-Pro-Skalierung für Agent-Orchestrierung und iOS-CI/CD sollten CALMVPS Bare-Metal-Mac-Miete prüfen — dediziertes Apple Silicon, Bereitstellung in ~120 Sekunden, Tages-/Wochen-/Monats-/Quartalsabrechnung — damit Sie OpenRouter-Boards für Modellwahl nutzen, während die Routing-Schicht auf wachem macOS läuft. Preise: Mietpreise, Betrieb: Hilfezentrum, Bestellung: Mac mini M4 bestellen.