Si vous choisissez encore vos modèles d'après les benchmarks du trimestre dernier, vos décisions sont déjà dépassées. Pour les développeurs IA, responsables plateforme et équipes produit agents, le classement OpenRouter reflète mieux la réalité de production que n'importe quel tableau marketing : du trafic token payé par de vrais workloads, pas des scores de laboratoire. Cet article s'appuie sur les données au 25 juillet 2026 pour décrypter les trois grandes mutations de juillet, la migration des parts fournisseurs, la structure en haltère entre volume et qualité, le marché applicatif caché, une checklist de routage en 6 étapes et les tendances d'août.
SECTION 01 Choisir un LLM en 2026 : benchmarks obsolètes, volume ≠ qualité, volatilité quotidienne
Les modèles frontier sortent chaque mois, mais beaucoup d'équipes pilotent encore sur de mauvais signaux :
- Culte des benchmarks statiques : SWE-bench et MMLU ne traduisent ni le coût API ni la latence, et encore moins ce pour quoi les développeurs paient réellement.
- Confondre volume de tokens et capacité : OpenRouter classe le trafic payé. Un modèle bon marché branché sur une app à fort volume peut dominer le tableau sans jamais toucher vos tâches de raisonnement les plus exigeantes.
- Ignorer les variations journalières : Mimo V2.5 et Claude Opus 4.8 ont échangé leurs places entre le 24 et le 25 juillet. Un instantané ne fait pas un classement permanent.
- Angle mort de la presse entreprise : les apps de roleplay et compagnon absorbent une part massive du trafic open model, quasi absente des médias B2B IA.
- Absence de routage par paliers : mélanger chat, code et raisonnement complexe dans un seul modèle fait exploser le budget ou dégrader la qualité. Les données OpenRouter dessinent déjà un marché en haltère.
Le classement OpenRouter mesure le volume réel de tokens payés, pas l'intelligence des modèles. Comprendre cet écart, c'est la différence entre une stratégie de routage et un article qui recopie un tableau.
SECTION 02 OpenRouter juillet 2026 : Xiaomi en tête, laboratoires chinois ~46 %
Au 25 juillet, le top 12 par volume journalier de tokens sur OpenRouter. Les chiffres évoluent chaque jour — vérifiez openrouter.ai/rankings avant toute décision critique.
| Rang | Modèle | Fournisseur | Tokens/jour | Total 30 j |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4T | 31,2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9B | 23,6T |
| 3 | Hy3 | Tencent | 590B | 23,4T |
| 4 | Nemotron 3 Ultra 550B (gratuit) | NVIDIA | 428,6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7B | 11,6T |
| 6 | GLM 5.2 | Z.ai | 316,7B | 13,3T |
| 7 | MiniMax M3 | MiniMax | 262,5B | 15,1T |
| 8 | Step 3.7 Flash | StepFun | 204,8B | 5,9T |
| 9 | Kimi K3 | Moonshot AI | 157,6B | 1,6T |
| 10 | Ling 3.0 Flash | InclusionAI (Ant) | 128,3B | 417,3B |
| 11 | Gemini 3 Flash Preview | 106,3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5B | 3,6T |
Sept des dix premiers viennent de laboratoires chinois. Agrégé par fournisseur (vue 7 jours, approximations) :
| Fournisseur | Origine | Part (approx.) |
|---|---|---|
| DeepSeek | Chine | 16 %–18 % |
| Xiaomi | Chine | 8 %–18 % |
| Anthropic | États-Unis | 10 %–15 % |
| Tencent | Chine | 8 %–13 % |
| États-Unis | 8 %–13 % | |
| OpenAI | États-Unis | 6 %–8 % |
| Total Chine | — | ~46 % |
| Big Three US | — | ~30 %–36 % |
Il y a un an, la part chinoise était inférieure à 2 %, les trois géants américains autour de 70 % — l'une des migrations les plus abruptes du secteur. Moteur principal : DeepSeek V4 Flash à ~$0,05–0,14/M en entrée contre GPT-5.5 à ~$5/M, soit un écart d'environ 35×. Le champion mensuel change souvent : février MiniMax M2.5, avril MiMo-V2-Pro, juillet Mimo V2.5.
SECTION 03 Volume élevé ≠ qualité élevée : marché en haltère et matrice tarifaire
Par part de dépense par type de tâche (pas par volume de tokens), le tableau change :
- Dialogue général : 35,7 %
- Workflows agents : 30,4 %
- Code : 26,5 %
- Traitement de données : 7,5 %
Sur la classification et le raisonnement complexe, Claude Sonnet 4.6 et Claude Opus 4.7 partagent la tête à 13,5 % chacun ; GPT-5.5 suit à 11,6 %. Les modèles open bon marché du classement volume sont quasi absents ici.
| Modèle | Entrée/M | Sortie/M | Positionnement |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0,05–0,14 | ~$0,24–0,28 | Roi du rapport qualité-prix, agentic coding |
| GLM 5.2 | $0,45 | $3,31 | Open weights, planification type Opus |
| Kimi K3 | ~$3 | ~$15 | 1,4 To de poids ouverts, capacité closed-tier |
| Claude Opus 5 | $5 (fast $10) | $25 (fast $50) | Frontier fermé, FrontierBench v0.1 43,3 % |
Le marché se segmente naturellement : les modèles open chinois bon marché absorbent les workloads massifs tolérants aux erreurs ; les frontier fermés conservent le pouvoir de fixation des prix sur les tâches critiques. Claude Opus 5, publié le 24 juillet, incarne la seconde catégorie.
SECTION 04 Couche applicative : les agents de code règnent, le roleplay reste invisible
Les classements modèles montrent quels « cerveaux » sont populaires. Le classement OpenRouter Apps montre à quoi ils servent :
| Rang | Application | Type | Part |
|---|---|---|---|
| 1 | Hermes Agent | Agent personnel / CLI | ~45 % |
| 2 | Kilo Code | Agent de code | ~13 % |
| 3 | OpenClaw | Agent généraliste | ~9 % |
| 4 | Claude Code | Agent de code | ~6 % |
| 5 | Descript | Production de contenu | ~4,5 % |
| Lignée | Cline → Roo Code → Kilo Code : trois forks d'une même base ; le petit-fils dépasse l'aïeul | ||
Les apps roleplay (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) portent ensemble une part considérable du trafic. Le rapport OpenRouter × a16z State of AI indique que le roleplay créatif représente plus de la moitié de l'usage des modèles open. Qui ne lit que la presse entreprise rate la moitié du marché.
SECTION 05 Routage API LLM par paliers : checklist de sélection en 6 étapes
À partir des données de juillet et de notre guide d'intégration OpenRouter, construisez votre stack d'évaluation et de routage en six étapes :
- Horodater les données et fixer un rythme de rafraîchissement : les classements bougent chaque jour. Consultez openrouter.ai/rankings en fin de mois ; évitez de citer des rangs périmés dans la documentation.
- Découper les workloads par type de tâche : chat/créatif, assistance code, planification agent, raisonnement complexe/classification — mesurez part et tolérance aux erreurs par segment.
- Palier volume vers les modèles open à bas coût : chat et roleplay d'abord sur DeepSeek V4 Flash et GLM 5.2 ; ajoutez MiniMax M3 pour l'assistance code.
- Réserver les frontier fermés aux tâches difficiles : raisonnement complexe et décisions agent à risque vers Claude Opus 5 / GPT-5.6, avec chaînes de fallback OpenRouter.
- Constituer un jeu d'évaluation interne : ne vous fiez pas au seul classement public. Mesurez taux d'adoption, taux d'erreur et latence P95 sur vos prompts réels — un fort volume ne garantit pas l'adéquation.
- Intégrer sécurité et conformité : la posture sécurité des fournisseurs entre dans la grille de notation. Les déploiements agents exigent un périmètre de permissions, quel que soit le modèle gagnant sur le prix.
SECTION 06 Perspectives août et données techniques citables
- Part des modèles open chinois : probable poursuite de la montée vers 50 % cette année, sauf baisse agressive des tarifs US.
- Rotation du champion mensuel : Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax et Moonshot ne ralentissent pas cycles de release ni guerre des prix.
- Palier volume Anthropic : un modèle type Haiku pourrait arriver en août ; Opus 5 est déjà le quatrième flagship en deux mois.
- Quantification communautaire Kimi K3 : builds compressés des poids 1,4 To attendus sous 2–4 semaines.
- Migration des parts : Chine ~46 % aujourd'hui vs. moins de 2 % il y a un an ; Big Three US ~30 %–36 % vs. ~70 %.
- Ancre tarifaire : écart entrée DeepSeek V4 Flash vs. GPT-5.5 d'environ 35× — principal moteur de migration du trafic.
- Concentration applicative : Hermes Agent seul ~45 % des tokens apps ; famille agents code (Kilo Code, OpenClaw, Claude Code) dépasse 28 % combinés.
Rouvrez ces sources après publication pour recouper avec les données upstream les plus récentes :
Classement officiel OpenRouter
Blog OpenRouter : DeepSeek V4 Adoption
Rapport OpenRouter × a16z State of AI
La leçon de juillet en une phrase : capacité et popularité divergent. OpenRouter unifie l'accès multi-modèles, mais les équipes qui connectent agents LLM, chaînes de build Xcode et CI/CD macOS butent sur le CI macOS en VM avec overhead hyperviseur, ou sur un Mac local incapable de tourner 24h/24. Pour les environnements de production exigeant une puissance Apple native sans perte, un CI/CD iOS stable et une automatisation agent continue, les nœuds Mac physiques dédiés MACNOX sont en général le meilleur choix : matériel Apple 100 %, accès root complet, pas de taxe hyperviseur, facturation flexible au jour, à la semaine ou au mois.
SECTION 07 FAQ
Le classement OpenRouter reflète-t-il la qualité des modèles ?
Non. Il trie par volume de tokens payés — combien les développeurs dépensent, pas l'intelligence du modèle. Des modèles bon marché sur des apps à fort trafic peuvent dominer sans toucher vos chemins de raisonnement les plus difficiles. Croisez avec les parts de dépense et votre propre jeu d'évaluation.
Quel modèle a mené OpenRouter en juillet 2026 ?
Au 25 juillet : Xiaomi Mimo V2.5 avec environ 1,4 billion de tokens par jour, suivi de DeepSeek V4 Flash et Tencent Hy3. Le classement change quotidiennement — consultez openrouter.ai/rankings en direct.
Quelle part occupent les modèles chinois sur OpenRouter ?
Vue 7 jours agrégée : laboratoires chinois (DeepSeek, Xiaomi, Tencent, Z.ai, MiniMax, Moonshot, Alibaba, etc.) ~46 % des tokens, contre moins de 2 % il y a un an. Big Three US ~30 %–36 % combinés.
Comment un développeur indépendant choisit-il son modèle ?
OpenRouter est un excellent bac à sable — une clé, des centaines de modèles. Testez DeepSeek V4 Flash et GLM 5.2 pour le code ; réservez Claude Opus 5 / GPT-5.6 aux étapes qui bloquent vraiment. Le routage hybride réduit fortement les coûts. Intégrez latence (~180–250 ms depuis certaines régions) et exigences de conformité avant la production.
Quels changements attendre en août ?
Part open chinoise en hausse continue ; rotation probable du leader mensuel ; Anthropic pourrait livrer un palier moins cher ; builds Kimi K3 quantifiés par la communauté ; sécurité et conformité pèseront davantage dans les choix entreprise.