Classements OpenRouter juillet 2026 :
qui gagne vraiment la course aux modèles IA ?

Si vous choisissez encore un LLM à partir d'un benchmark daté de deux mois, vous décidez déjà en retard. OpenRouter — la plus grande place de marché neutre de routage LLM — publie quelque chose de plus honnête que n'importe quelle annonce éditeur : le volume réel de tokens payés en production, sur des centaines de modèles. Ses classements ne mesurent pas qui a le meilleur score de test, mais à qui les développeurs ont confié du trafic réel, avec de l'argent réel en jeu.

Cet article s'adresse aux développeurs et responsables techniques qui font tourner des agents, des assistants CLI ou des workflows API hybrides sur Mac. À partir des données OpenRouter jusqu'au 25 juillet 2026, nous décortiquons les trois bascules de juillet (Xiaomi #1, labs chinois près de 46% de parts, Kimi K3 dans le top 10), la barre volume vs qualité, la domination Hermes/Kilo Code côté apps, une matrice tarifaire, les perspectives d'août et un playbook de routage hybride en six étapes. Vous saurez ce que signifient les chiffres, quelles tâches méritent un modèle premium et comment construire une stack qui ne dépend pas du #1 d'une semaine.

01 Lire les classements OpenRouter : trois erreurs qui faussent les choix de juillet 2026

OpenRouter classe par volume de tokens — essentiellement ce que les développeurs paient en production, pas qui gagne un leaderboard. Cet écart entre usage et capacité est le cadre à avoir avant de lire le tableau de juillet. Par rapport à notre rétrospective de juin 2026, trois erreurs reviennent sans cesse :

  • Prendre le #1 volume quotidien pour « meilleur modèle » : un modèle bon marché et rapide branché sur une app grand public peut devancer un modèle plus capable réservé aux 10% les plus durs. Le 25 juillet, Mimo V2.5 de Xiaomi menait à environ 1,4 billion de tokens/jour — une histoire de prix et de portée, pas une couronne de qualité universelle.
  • Ignorer la volatilité jour par jour : les rangs bougent vite. Claude Opus 4.8 figurait dans le top 10 des données hebdo du 24 juillet ; le 25, Ling 3.0 Flash l'avait sorti du top 12. Les séries mensuelles valent mieux qu'un snapshot d'un jour.
  • Ne regarder que les modèles, pas les apps : seul Hermes Agent détient environ 45% des tokens apps suivis. Roleplay et companions déplacent un volume sérieux que la couverture IA entreprise mentionne rarement — un marché caché qui déforme « qui utilise quoi ».

Thèse : le classement répond à qui paie la facture token quotidienne ; les dépenses par catégorie de tâche répondent à qui mérite le premium sur le travail le plus dur. Lire les deux.

Tableaux officiels mis à jour chaque jour — vérifier avant de citer :

https://openrouter.ai/rankings

https://openrouter.ai/apps

02 Classement OpenRouter juillet 2026 : Xiaomi #1, modèles chinois à ~46% de parts

Au 25 juillet 2026, le top trois par volume quotidien est Xiaomi Mimo V2.5 (1,4T/jour), DeepSeek V4 Flash (943,9B/jour) et Tencent Hy3 (590B/jour). Sept des dix premières places reviennent à des labs chinois ; Nemotron 3 Ultra (NVIDIA), Claude Sonnet 5 et Gemini 3 Flash Preview tiennent le camp US.

Volume tokens modèles Top 12 (au 2026-07-25, quotidien)
Rang Modèle Éditeur Tokens/jour Total 30 j
1 Mimo V2.5 Xiaomi 1,4T 31,2T
2 DeepSeek V4 Flash DeepSeek 943,9B 23,6T
3 Hy3 Tencent 590B 23,4T
4 Nemotron 3 Ultra 550B (free) NVIDIA 428,6B 9T
5 DeepSeek V4 Pro DeepSeek 413,7B 11,6T
6 GLM 5.2 Z.ai 316,7B 13,3T
7 MiniMax M3 MiniMax 262,5B 15,1T
8 Step 3.7 Flash StepFun 204,8B 5,9T
9 Kimi K3 Moonshot AI 157,6B 1,6T (nouvelle entrée)
10 Ling 3.0 Flash InclusionAI 128,3B 417,3B
11 Gemini 3 Flash Preview Google 106,3B 4T
12 Claude Sonnet 5 Anthropic 99,5B 3,6T

Au niveau éditeur, les labs d'origine chinoise (DeepSeek, Xiaomi, Tencent, Z.ai, MiniMax, Moonshot, Alibaba) représentent environ 46% du volume identifié — contre moins de 2% il y a un an. Les modèles US (OpenAI, Anthropic, Google combinés) tournent autour de 30–36%, contre ~70% il y a un an.

Parts tokens par éditeur (estimations ~7 jours)
Éditeur Origine Part (approx.)
DeepSeek Chine 16%–18%
Xiaomi Chine 8%–18%
Anthropic US 10%–15%
Tencent Chine 8%–13%
Google US 8%–13%
OpenAI US 6%–8%

Les prix poussent le basculement : DeepSeek V4 Flash affiche environ 0,05–0,14 USD/M en input contre GPT-5.5 près de 5,00 USD/M — un écart d'environ 35×. DeepSeek reste l'éditeur #1 le plus stable par part (16–18%), tandis que la couronne « modèle du mois » tourne — MiniMax M2.5 en février, MiMo-V2-Pro en avril, Mimo V2.5 en juillet.

03 Leader volume ≠ leader qualité : marché en haltère et pricing power de Claude Opus 5

La ventilation dépenses par catégorie de tâche d'OpenRouter raconte autre chose que le volume brut : chat général 35,7%, workflows agentiques 30,4%, code 26,5%, données 7,5%. Dans le segment le plus dur — classification et raisonnement complexe — Claude Sonnet 4.6 et Claude Opus 4.7 partagent 13,5% des dépenses chacun, GPT-5.5 est troisième à 11,6%. Les modèles open bon marché des charts volume y figurent à peine.

Le marché se scinde : les open-weight chinois bon marché absorbent les charges à fort volume et tolérance d'erreur (chat, créatif, roleplay, assist code routine), tandis que les frontier fermés gardent le pricing sur le travail dur à faible tolérance. Le lancement du 24 juillet de Claude Opus 5 a mené FrontierBench v0.1 à 43,3% (contre 37,5% pour GPT-5.6 Sol) avec un tarif Opus de 5/25 USD par million de tokens.

Tarifs et positionnement (sélection — vérifier tarifs OpenRouter live)
Modèle Input/M Output/M Contexte Positionnement
DeepSeek V4 Flash ~$0,05–0,14 ~$0,24–0,28 1M Meilleur rapport ; défaut agentic code
MiniMax M3 $0,10 $1,21 Long context Multimodal budget / entrée image
GLM 5.2 $0,45 $3,31 Open-weight planification style Opus
Kimi K3 ~$3 ~$15 1M 1,4 To open weights, capacité tier fermé
Claude Opus 5 $5 (fast tier $10) $25 (fast tier $50) 1M Frontier fermé ; top benchmark juillet

04 Ce qui est vraiment utilisé : agents code en tête, le roleplay est la moitié invisible

Les classements modèles montrent quel « cerveau » est populaire. Le leaderboard apps (openrouter.ai/apps) montre ce que ce cerveau fait en production.

Couche apps / agents Top 10 (OpenRouter Apps, par tokens, approx.)
Rang App Catégorie Part (approx.)
1 Hermes Agent Agent perso / CLI ~45%
2 Kilo Code Agent code ~13%
3 OpenClaw Agent général ~9%
4 Claude Code Agent code ~6%
5 Descript Production contenu ~4,5%
6 pi Agent ~3,3%
7 Lemonade Companion / gaming ~2,1%
8 ISEKAI ZERO Roleplay ~2,0%
9 Janitor AI Roleplay ~1,8%
10 Cline Agent code (IDE) ~1,7%
  • Cline → Roo Code → Kilo Code sont trois générations de la même lignée open source ; le fork le plus jeune, Kilo Code, a dépassé ses ancêtres — l'avantage du first mover en outillage dev ne dure pas.
  • Apps roleplay et companion (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) déplacent ensemble un volume sérieux. Le rapport OpenRouter × a16z State of AI estime le roleplay créatif à plus de la moitié de l'usage open model — si votre vision de l'IA vient seulement des titres entreprise, vous ratez la moitié du marché.

05 Perspectives août et recommandations pratiques par profil

Sur la trajectoire de juillet et le contexte sectoriel, voici ce que nous anticipons pour août :

  1. La part combinée open-weight chinois devrait continuer vers ou au-delà de 50%, sauf mouvement tarifaire majeur d'un éditeur US.
  2. Le titre « modèle du mois » continuera de tourner — Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax et Moonshot publient et re-pricent assez vite pour qu'un nouveau #1 en août ne surprenne pas.
  3. Anthropic pourrait sortir un tier volume moins cher plutôt que de miser seulement sur Opus 5 — Opus 5 est le quatrième flagship Anthropic en moins de deux mois (après Mythos 5, Fable 5 et Sonnet 5).
  4. Les 1,4 téraoctets open weights de Kimi K3 devraient voir une quantification communautaire sous 2–4 semaines, comme les mega-releases précédentes.
  5. Sécurité et gouvernance deviennent des critères de sélection réels : l'évasion sandbox d'un modèle non publié chez OpenAI, le projet US « AI Kill Switch Act » et les cadres de revue pré-release attendus à la Maison Blanche poussent l'historique sécurité éditeur dans les grilles entreprise.

Développeurs indépendants et petites équipes : OpenRouter reste le moyen le plus rapide de A/B tester des dizaines de modèles derrière une clé API. Démarrer le code sur DeepSeek V4 Flash et GLM 5.2 ; réserver les modèles fermés premium aux étapes où les modèles bon marché échouent vraiment. Mesurer votre propre latence — OpenRouter n'est pas optimisé pour chaque région ou besoin conformité.

Responsables infra : ne pas choisir un modèle par rang d'usage seul — cela reflète la sensibilité prix, pas l'adéquation à votre charge. Router fort volume / faible risque vers modèles bon marché et travail dur / enjeu élevé vers frontier fermés ; ajouter l'historique sécurité éditeur à la grille.

Builders d'agents et outils code : la chaîne de forks Cline → Kilo Code rappelle que les moats en outillage dev open source sont plus fins qu'il n'y paraît. Si votre produit touche entertainment ou companion, ne sous-estimez pas le volume de ce segment.

06 Six étapes vers une stack de routage hybride : données citables et conclusion CALMVPS

  1. S'inscrire sur OpenRouter et construire un tableau de bord coûts : créer une clé API, taguer les dépenses par modèle et projet, consulter la page Rankings chaque semaine pour ne pas figer le modèle par défaut.
  2. Définir des règles de routage par paliers : séparer Tier-0 (autocomplétion/résumé), Tier-1 (refactors multi-fichiers), Tier-2 (agents longue durée). Tier-0 vers DeepSeek V4 Flash ou Mimo V2.5 ; Tier-2 vers Claude Opus 5.
  3. Activer une config modèle interchangeable dans les CLI : Claude Code, Kilo Code, Hermes Agent et OpenClaw acceptent les ID OpenRouter via env ou config — ne jamais coder un seul endpoint en dur.
  4. Prévoir un chemin self-host pour open weights : pour données sensibles conformité, évaluer MiniMax M3, DeepSeek V4, GLM 5.2 ou Kimi K3 on-prem ; sur Mac, Ollama ou LM Studio en secours hors ligne.
  5. Faire tourner une couche d'orchestration 7×24 sur Mac : gateways agents, jobs batch planifiés et tunnels SSH ne doivent pas dépendre d'un portable fermé. launchd ou Mac bare-metal pour garder routage et collecte de logs en ligne.
  6. Verrouiller le calendrier releases août et préparer les bascules A/B : surveiller le tier volume Anthropic, les builds quant communautaires Kimi K3 et la cadence août des labs chinois ; trafic shadow et interrupteurs rollback avant la semaine de release.
  • Tokens quotidiens Xiaomi Mimo V2.5 : environ 1,4T, rang modèle #1 au 25 juillet
  • Part combinée éditeurs chinois : environ 46% (moins de 2% il y a un an) ; big three US près de 30–36%
  • Écart input DeepSeek V4 Flash vs GPT-5.5 : environ 35× (0,05–0,14 USD/M vs ~5 USD/M)
  • Part app Hermes Agent : environ 45%, plus grande app unique de la plateforme
  • Claude Opus 5 FrontierBench v0.1 : 43,3%, au-dessus des 37,5% de GPT-5.6 Sol

L'histoire de juillet : capacité et popularité divergent. Les open-weight chinois ont acheté la moitié du marché au prix. Les labs US frontier fermés défendent l'autre moitié avec pricing power sur le travail dur et crédibilité sécurité. La question utile pour les builders n'est pas « qui est #1 cette semaine », mais de quel côté de l'haltère se situe vraiment votre charge.

Le routage hybride sur Mac expose des failles familières : MacBook endormi coupe agents et callbacks OpenRouter ; un VPS Linux ne peut pas exécuter le sandbox macOS natif de Claude Code ; les Mac virtualisés paient des pénalités Metal et permissions vs bare metal ; acheter un Mac Studio maxé ajoute délai d'approvisionnement et amortissement. Les équipes qui ont besoin de disponibilité 7×24 avec dimensionnement M4/M4 Pro élastique pour orchestration agents et CI/CD iOS devraient regarder la location Mac bare-metal CALMVPS — Apple Silicon dédié, provisioning ~120 secondes, facturation jour/semaine/mois/trimestre — pour choisir les modèles selon OpenRouter tout en gardant la couche routage sur un macOS qui ne dort jamais. Tarifs : tarifs location, aide : centre d'aide, commande : commander Mac mini M4.