Wer seine LLM-Auswahl noch an Benchmarks von vor einem Quartal festmacht, trifft Entscheidungen auf veralteter Grundlage. Für AI-Entwickler, Platform-Leads und Agent-Produktteams in der EU liefert das OpenRouter-Ranking belastbarere Signale als jede Marketing-Folie: bezahlte Token-Last aus echten Workloads, nicht theoretische Intelligenzwerte. Dieser datenbasierte Leitfaden nutzt Zahlen bis 25. Juli 2026, erklärt Juli-Verschiebungen, Anbieter-Migration, die Hantel-Struktur zwischen Volumen und Qualität, den versteckten App-Markt, eine 6-Schritte-Routing-Checkliste mit DSGVO-Bezug und den August-Ausblick.
SECTION 01 LLM-Auswahl 2026: Benchmark-Lag, Volumen ≠ Qualität, tägliche Rank-Volatilität
Frontier-Modelle erscheinen monatlich, doch viele Teams optimieren noch auf falsche Metriken:
- Benchmark-Fixierung: SWE-bench und MMLU spiegeln weder API-Kosten noch Latenz wider — und schon gar nicht, wofür Entwickler tatsächlich zahlen.
- Token-Volumen mit Fähigkeit verwechseln: OpenRouter sortiert nach bezahltem Traffic. Günstige Modelle hinter High-Volume-Apps dominieren die Tabelle, ohne je Ihre schwersten Reasoning-Pfade zu berühren.
- Tages-Schwankungen ignorieren: Mimo V2.5 und Claude Opus 4.8 tauschten zwischen 24. und 25. Juli die Plätze. Ein Snapshot ist kein dauerhaftes Leaderboard.
- Enterprise-Medien-Blindspot: Roleplay- und Companion-Apps tragen einen großen Teil des Open-Model-Traffics — in B2B-Berichterstattung kaum sichtbar.
- Kein gestaffeltes Routing: Chat, Code und komplexes Reasoning über ein Modell laufen lassen heißt Budgetexplosion oder Qualitätsmangel. OpenRouter zeigt bereits eine klare Hantel-Marktstruktur.
Das OpenRouter-Ranking misst bezahltes Token-Volumen, nicht Modell-Intelligenz. Wer diesen Unterschied versteht, baut Routing statt Copy-Paste-Tabellen.
SECTION 02 OpenRouter Juli 2026: Xiaomi an der Spitze, chinesische Labs ~46 %
Stand 25. Juli: Top 12 nach Tages-Token-Volumen. Zahlen aktualisieren sich täglich — vor Produktionsentscheidungen live auf openrouter.ai/rankings prüfen.
| Rang | Modell | Anbieter | Tages-Tokens | 30-Tage-Summe |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4T | 31,2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9B | 23,6T |
| 3 | Hy3 | Tencent | 590B | 23,4T |
| 4 | Nemotron 3 Ultra 550B (kostenlos) | NVIDIA | 428,6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7B | 11,6T |
| 6 | GLM 5.2 | Z.ai | 316,7B | 13,3T |
| 7 | MiniMax M3 | MiniMax | 262,5B | 15,1T |
| 8 | Step 3.7 Flash | StepFun | 204,8B | 5,9T |
| 9 | Kimi K3 | Moonshot AI | 157,6B | 1,6T |
| 10 | Ling 3.0 Flash | InclusionAI (Ant) | 128,3B | 417,3B |
| 11 | Gemini 3 Flash Preview | 106,3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5B | 3,6T |
Sieben der Top-Ten stammen von chinesischen Anbietern. Aggregiert auf Anbieter-Ebene (7-Tage-Blended, gerundet):
| Anbieter | Herkunft | Anteil (ca.) |
|---|---|---|
| DeepSeek | China | 16 %–18 % |
| Xiaomi | China | 8 %–18 % |
| Anthropic | USA | 10 %–15 % |
| Tencent | China | 8 %–13 % |
| USA | 8 %–13 % | |
| OpenAI | USA | 6 %–8 % |
| China gesamt | — | ~46 % |
| US-Big-Three gesamt | — | ~30 %–36 % |
Vor einem Jahr lag der China-Anteil unter 2 %, die US-Big-Three bei ~70 % — eine der steilsten Migrationskurven der Branche. Treiber: DeepSeek V4 Flash Eingabe ~$0,05–0,14/M gegenüber GPT-5.5 ~$5/M, Faktor ~35. Der Monats-Champion wechselt häufig: Februar MiniMax M2.5, April MiMo-V2-Pro, Juli Mimo V2.5.
SECTION 03 Hohes Volumen ≠ hohe Qualität: Hantel-Markt und Preis-Matrix
Nach Ausgabenanteil pro Aufgabentyp (nicht Token-Menge) sieht das Bild anders aus:
- Allgemeiner Dialog: 35,7 %
- Agent-Workflows: 30,4 %
- Code: 26,5 %
- Datenverarbeitung: 7,5 %
Bei Klassifikation und komplexem Reasoning teilen sich Claude Sonnet 4.6 und Claude Opus 4.7 mit je 13,5 % den Spitzenplatz; GPT-5.5 folgt mit 11,6 %. Die günstigen Open-Modelle aus dem Volumen-Ranking sind hier praktisch unsichtbar.
| Modell | Eingabe/M | Ausgabe/M | Positionierung |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0,05–0,14 | ~$0,24–0,28 | Preis-Leistungs-Führung, Agentic Coding |
| GLM 5.2 | $0,45 | $3,31 | Open-Weight mit Opus-ähnlicher Planung |
| Kimi K3 | ~$3 | ~$15 | 1,4 TB Open Weights, Closed-Tier-Fähigkeit |
| Claude Opus 5 | $5 (Fast $10) | $25 (Fast $50) | Closed Frontier, FrontierBench v0.1 43,3 % |
Der Markt trennt sich: günstige chinesische Open-Modelle fressen fehlertolerante Massen-Workloads; Closed-Frontier hält die Preissetzung bei kritischen Aufgaben. Am 24. Juli veröffentlichtes Claude Opus 5 verkörpert die zweite Kategorie.
SECTION 04 App-Layer: Coding-Agenten dominieren, Roleplay bleibt unsichtbar
Modell-Rankings zeigen beliebte „Gehirne“. Die OpenRouter Apps Leaderboard zeigt, wofür sie eingesetzt werden:
| Rang | App | Typ | Anteil |
|---|---|---|---|
| 1 | Hermes Agent | Persönlicher Agent / CLI | ~45 % |
| 2 | Kilo Code | Coding-Agent | ~13 % |
| 3 | OpenClaw | Allgemeiner Agent | ~9 % |
| 4 | Claude Code | Coding-Agent | ~6 % |
| 5 | Descript | Content-Produktion | ~4,5 % |
| Abstammung | Cline → Roo Code → Kilo Code: drei Forks einer Codebasis; der Enkel überholt den Vorfahren | ||
Roleplay-Apps (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) tragen zusammen erheblichen Traffic. Der OpenRouter × a16z State of AI-Report: kreatives Roleplay macht über die Hälfte des Open-Model-Volumens aus. Wer nur Enterprise-Presse liest, verpasst die andere Markthälfte.
SECTION 05 LLM-API-Stufen-Routing: 6-Schritte-Auswahl-Checkliste
Auf Basis der Juli-Daten und unseres OpenRouter-Integrationsleitfadens empfehlen wir diese sechs Schritte:
- Datumsstempel und Refresh-Rhythmus: Rankings schwanken täglich. Monatsende openrouter.ai/rankings prüfen; veraltete Ränge in Runbooks vermeiden.
- Workloads nach Aufgabentyp splitten: Chat/Kreativ, Code-Assist, Agent-Planung, komplexes Reasoning/Klassifikation — Anteil und Fehlertoleranz je Bucket messen.
- Volumen-Tier auf günstige Open-Modelle: Chat und Roleplay zuerst auf DeepSeek V4 Flash und GLM 5.2; Coding-Assist mit MiniMax M3 ergänzen.
- Closed Frontier für harte Aufgaben: Komplexes Reasoning und risikoreiche Agent-Entscheidungen zu Claude Opus 5 / GPT-5.6; OpenRouter-Fallback-Ketten für Failover.
- Internes Eval-Set aufbauen: Nicht nur dem öffentlichen Board vertrauen. Adoption Rate, Fehlerrate, P95-Latenz auf echten Prompts messen — hohes Volumen heißt nicht hoher Fit.
- Sicherheit und Compliance einbeziehen: Vendor-Sicherheitslage gehört auf die Scorecard. EU-Teams: Prompt-Inhalte können personenbezogene Daten enthalten — DSGVO Art. 32 (technische Maßnahmen) und Datenfluss-Dokumentation vor Produktions-Routing; Agent-Deployments brauchen Permission-Scoping unabhängig vom Preis-Sieger.
SECTION 06 August-Ausblick und zitierbare Kennzahlen
- Chinesischer Open-Model-Anteil: Wahrscheinlich Richtung 50 % in diesem Jahr, sofern US-Anbieter nicht aggressiv Listenpreise senken.
- Monatlicher Volumen-Champion: Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax und Moonshot verlangsamen Release- und Preiszyklen nicht.
- Anthropic Volumen-Tier: Haiku-Klasse für Durchsatz möglicherweise im August; Opus 5 ist bereits das vierte Flagship in zwei Monaten.
- Kimi K3 Community-Quantisierung: Komprimierte Builds der 1,4-TB-Gewichte in 2–4 Wochen erwartbar.
- Anbieter-Migration: China ~46 % heute vs. unter 2 % vor einem Jahr; US-Big-Three ~30 %–36 % vs. ~70 %.
- Preisanker: DeepSeek V4 Flash vs. GPT-5.5 Eingabe ~35× — Haupttreiber der Traffic-Verschiebung.
- App-Konzentration: Hermes Agent allein ~45 % App-Token-Anteil; Coding-Agent-Familie (Kilo Code, OpenClaw, Claude Code) zusammen über 28 %.
Nach Veröffentlichung diese Quellen erneut öffnen und gegen aktuelle Upstream-Daten prüfen:
OpenRouter Offizielles Ranking
OpenRouter Blog: DeepSeek V4 Adoption
OpenRouter × a16z State of AI Report
Julis Kernaussage: Fähigkeit und Popularität divergieren. OpenRouter vereinheitlicht Multi-Model-API-Zugriff, doch Teams, die LLM-Agenten, Xcode-Build-Ketten und macOS CI/CD verbinden, stoßen an Grenzen: VM-basiertes macOS-CI mit Hypervisor-Overhead, lokale Macs ohne 7×24-Betrieb. Für Produktionsumgebungen mit nativer Apple-Compute ohne Overhead, stabilem iOS-CI/CD und durchgängiger Agent-Automatisierung — unter Berücksichtigung von DSGVO-konformer Datenverarbeitung bei sensiblen Workloads — sind MACNOX dedizierte physische Mac-Knoten meist die bessere Wahl: 100 % Apple-Hardware, voller Root, kein Hypervisor-Steuer, flexible Tag-/Wochen-/Monats-Abrechnung.
SECTION 07 FAQ
Spiegeln OpenRouter-Rankings die Modellqualität wider?
Nein. Sortierung nach bezahltem Token-Volumen — wie viel Entwickler ausgeben, nicht wie intelligent ein Modell ist. Günstige Modelle auf High-Traffic-Apps können oben stehen, ohne Ihre schwersten Reasoning-Pfade zu berühren. Ausgabenanteile mit eigenem Eval-Set kombinieren.
Welches Modell führte im Juli 2026 auf OpenRouter?
Stand 25. Juli: Xiaomi Mimo V2.5 mit ~1,4 Billionen Tokens/Tag, gefolgt von DeepSeek V4 Flash und Tencent Hy3. Tägliche Änderungen — live auf openrouter.ai/rankings prüfen.
Welchen Anteil haben chinesische Modelle auf OpenRouter?
7-Tage-Blended: chinesische Anbieter (DeepSeek, Xiaomi, Tencent, Z.ai, MiniMax, Moonshot, Alibaba u. a.) ~46 % Token-Anteil, vor einem Jahr unter 2 %. US-Big-Three zusammen ~30 %–36 %.
Wie wählen Indie-Entwickler ein Modell?
OpenRouter eignet sich als Sandbox — ein Key, hunderte Modelle. DeepSeek V4 Flash und GLM 5.2 für Coding testen; Claude Opus 5 / GPT-5.6 für blockierende Schritte reservieren. Hybrid-Routing senkt Kosten stark. Latenz (~180–250 ms aus manchen Regionen) und DSGVO-Anforderungen vor Produktion klären.
Was erwartet den Markt im August?
Chinesischer Open-Model-Anteil steigt weiter; Monats-Champion rotiert vermutlich erneut; Anthropic könnte günstigeren Durchsatz-Tier liefern; community-quantisierte Kimi-K3-Builds erscheinen; Sicherheit und Compliance gewinnen in Enterprise-Auswahl an Gewicht.