Startseite / Blog / OpenRouter
ENGINEERING_BLOG · 2026.07.27

OpenRouter Juli 2026:
Wer gewinnt den LLM-Traffic wirklich?

Wer seine LLM-Auswahl noch an Benchmarks von vor einem Quartal festmacht, trifft Entscheidungen auf veralteter Grundlage. Für AI-Entwickler, Platform-Leads und Agent-Produktteams in der EU liefert das OpenRouter-Ranking belastbarere Signale als jede Marketing-Folie: bezahlte Token-Last aus echten Workloads, nicht theoretische Intelligenzwerte. Dieser datenbasierte Leitfaden nutzt Zahlen bis 25. Juli 2026, erklärt Juli-Verschiebungen, Anbieter-Migration, die Hantel-Struktur zwischen Volumen und Qualität, den versteckten App-Markt, eine 6-Schritte-Routing-Checkliste mit DSGVO-Bezug und den August-Ausblick.

SECTION 01 LLM-Auswahl 2026: Benchmark-Lag, Volumen ≠ Qualität, tägliche Rank-Volatilität

Frontier-Modelle erscheinen monatlich, doch viele Teams optimieren noch auf falsche Metriken:

  • Benchmark-Fixierung: SWE-bench und MMLU spiegeln weder API-Kosten noch Latenz wider — und schon gar nicht, wofür Entwickler tatsächlich zahlen.
  • Token-Volumen mit Fähigkeit verwechseln: OpenRouter sortiert nach bezahltem Traffic. Günstige Modelle hinter High-Volume-Apps dominieren die Tabelle, ohne je Ihre schwersten Reasoning-Pfade zu berühren.
  • Tages-Schwankungen ignorieren: Mimo V2.5 und Claude Opus 4.8 tauschten zwischen 24. und 25. Juli die Plätze. Ein Snapshot ist kein dauerhaftes Leaderboard.
  • Enterprise-Medien-Blindspot: Roleplay- und Companion-Apps tragen einen großen Teil des Open-Model-Traffics — in B2B-Berichterstattung kaum sichtbar.
  • Kein gestaffeltes Routing: Chat, Code und komplexes Reasoning über ein Modell laufen lassen heißt Budgetexplosion oder Qualitätsmangel. OpenRouter zeigt bereits eine klare Hantel-Marktstruktur.

Das OpenRouter-Ranking misst bezahltes Token-Volumen, nicht Modell-Intelligenz. Wer diesen Unterschied versteht, baut Routing statt Copy-Paste-Tabellen.

SECTION 02 OpenRouter Juli 2026: Xiaomi an der Spitze, chinesische Labs ~46 %

Stand 25. Juli: Top 12 nach Tages-Token-Volumen. Zahlen aktualisieren sich täglich — vor Produktionsentscheidungen live auf openrouter.ai/rankings prüfen.

OpenRouter Modell-Token-Volumen Top 12 (2026-07-25)
Rang Modell Anbieter Tages-Tokens 30-Tage-Summe
1 Mimo V2.5 Xiaomi 1,4T 31,2T
2 DeepSeek V4 Flash DeepSeek 943,9B 23,6T
3 Hy3 Tencent 590B 23,4T
4 Nemotron 3 Ultra 550B (kostenlos) NVIDIA 428,6B 9T
5 DeepSeek V4 Pro DeepSeek 413,7B 11,6T
6 GLM 5.2 Z.ai 316,7B 13,3T
7 MiniMax M3 MiniMax 262,5B 15,1T
8 Step 3.7 Flash StepFun 204,8B 5,9T
9 Kimi K3 Moonshot AI 157,6B 1,6T
10 Ling 3.0 Flash InclusionAI (Ant) 128,3B 417,3B
11 Gemini 3 Flash Preview Google 106,3B 4T
12 Claude Sonnet 5 Anthropic 99,5B 3,6T

Sieben der Top-Ten stammen von chinesischen Anbietern. Aggregiert auf Anbieter-Ebene (7-Tage-Blended, gerundet):

Anbieter-Token-Anteile (7-Tage-Blended, ca.)
Anbieter Herkunft Anteil (ca.)
DeepSeek China 16 %–18 %
Xiaomi China 8 %–18 %
Anthropic USA 10 %–15 %
Tencent China 8 %–13 %
Google USA 8 %–13 %
OpenAI USA 6 %–8 %
China gesamt ~46 %
US-Big-Three gesamt ~30 %–36 %

Vor einem Jahr lag der China-Anteil unter 2 %, die US-Big-Three bei ~70 % — eine der steilsten Migrationskurven der Branche. Treiber: DeepSeek V4 Flash Eingabe ~$0,05–0,14/M gegenüber GPT-5.5 ~$5/M, Faktor ~35. Der Monats-Champion wechselt häufig: Februar MiniMax M2.5, April MiMo-V2-Pro, Juli Mimo V2.5.

SECTION 03 Hohes Volumen ≠ hohe Qualität: Hantel-Markt und Preis-Matrix

Nach Ausgabenanteil pro Aufgabentyp (nicht Token-Menge) sieht das Bild anders aus:

  • Allgemeiner Dialog: 35,7 %
  • Agent-Workflows: 30,4 %
  • Code: 26,5 %
  • Datenverarbeitung: 7,5 %

Bei Klassifikation und komplexem Reasoning teilen sich Claude Sonnet 4.6 und Claude Opus 4.7 mit je 13,5 % den Spitzenplatz; GPT-5.5 folgt mit 11,6 %. Die günstigen Open-Modelle aus dem Volumen-Ranking sind hier praktisch unsichtbar.

Preis und Positionierung (Juli 2026)
Modell Eingabe/M Ausgabe/M Positionierung
DeepSeek V4 Flash ~$0,05–0,14 ~$0,24–0,28 Preis-Leistungs-Führung, Agentic Coding
GLM 5.2 $0,45 $3,31 Open-Weight mit Opus-ähnlicher Planung
Kimi K3 ~$3 ~$15 1,4 TB Open Weights, Closed-Tier-Fähigkeit
Claude Opus 5 $5 (Fast $10) $25 (Fast $50) Closed Frontier, FrontierBench v0.1 43,3 %

Der Markt trennt sich: günstige chinesische Open-Modelle fressen fehlertolerante Massen-Workloads; Closed-Frontier hält die Preissetzung bei kritischen Aufgaben. Am 24. Juli veröffentlichtes Claude Opus 5 verkörpert die zweite Kategorie.

SECTION 04 App-Layer: Coding-Agenten dominieren, Roleplay bleibt unsichtbar

Modell-Rankings zeigen beliebte „Gehirne“. Die OpenRouter Apps Leaderboard zeigt, wofür sie eingesetzt werden:

OpenRouter App-Layer Top 10 (Token-Anteil, ca.)
Rang App Typ Anteil
1 Hermes Agent Persönlicher Agent / CLI ~45 %
2 Kilo Code Coding-Agent ~13 %
3 OpenClaw Allgemeiner Agent ~9 %
4 Claude Code Coding-Agent ~6 %
5 Descript Content-Produktion ~4,5 %
Abstammung Cline → Roo Code → Kilo Code: drei Forks einer Codebasis; der Enkel überholt den Vorfahren

Roleplay-Apps (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) tragen zusammen erheblichen Traffic. Der OpenRouter × a16z State of AI-Report: kreatives Roleplay macht über die Hälfte des Open-Model-Volumens aus. Wer nur Enterprise-Presse liest, verpasst die andere Markthälfte.

SECTION 05 LLM-API-Stufen-Routing: 6-Schritte-Auswahl-Checkliste

Auf Basis der Juli-Daten und unseres OpenRouter-Integrationsleitfadens empfehlen wir diese sechs Schritte:

  1. Datumsstempel und Refresh-Rhythmus: Rankings schwanken täglich. Monatsende openrouter.ai/rankings prüfen; veraltete Ränge in Runbooks vermeiden.
  2. Workloads nach Aufgabentyp splitten: Chat/Kreativ, Code-Assist, Agent-Planung, komplexes Reasoning/Klassifikation — Anteil und Fehlertoleranz je Bucket messen.
  3. Volumen-Tier auf günstige Open-Modelle: Chat und Roleplay zuerst auf DeepSeek V4 Flash und GLM 5.2; Coding-Assist mit MiniMax M3 ergänzen.
  4. Closed Frontier für harte Aufgaben: Komplexes Reasoning und risikoreiche Agent-Entscheidungen zu Claude Opus 5 / GPT-5.6; OpenRouter-Fallback-Ketten für Failover.
  5. Internes Eval-Set aufbauen: Nicht nur dem öffentlichen Board vertrauen. Adoption Rate, Fehlerrate, P95-Latenz auf echten Prompts messen — hohes Volumen heißt nicht hoher Fit.
  6. Sicherheit und Compliance einbeziehen: Vendor-Sicherheitslage gehört auf die Scorecard. EU-Teams: Prompt-Inhalte können personenbezogene Daten enthalten — DSGVO Art. 32 (technische Maßnahmen) und Datenfluss-Dokumentation vor Produktions-Routing; Agent-Deployments brauchen Permission-Scoping unabhängig vom Preis-Sieger.

SECTION 06 August-Ausblick und zitierbare Kennzahlen

  • Chinesischer Open-Model-Anteil: Wahrscheinlich Richtung 50 % in diesem Jahr, sofern US-Anbieter nicht aggressiv Listenpreise senken.
  • Monatlicher Volumen-Champion: Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax und Moonshot verlangsamen Release- und Preiszyklen nicht.
  • Anthropic Volumen-Tier: Haiku-Klasse für Durchsatz möglicherweise im August; Opus 5 ist bereits das vierte Flagship in zwei Monaten.
  • Kimi K3 Community-Quantisierung: Komprimierte Builds der 1,4-TB-Gewichte in 2–4 Wochen erwartbar.
  • Anbieter-Migration: China ~46 % heute vs. unter 2 % vor einem Jahr; US-Big-Three ~30 %–36 % vs. ~70 %.
  • Preisanker: DeepSeek V4 Flash vs. GPT-5.5 Eingabe ~35× — Haupttreiber der Traffic-Verschiebung.
  • App-Konzentration: Hermes Agent allein ~45 % App-Token-Anteil; Coding-Agent-Familie (Kilo Code, OpenClaw, Claude Code) zusammen über 28 %.

Nach Veröffentlichung diese Quellen erneut öffnen und gegen aktuelle Upstream-Daten prüfen:

OpenRouter Offizielles Ranking

OpenRouter Apps Leaderboard

OpenRouter Blog: DeepSeek V4 Adoption

OpenRouter × a16z State of AI Report

Julis Kernaussage: Fähigkeit und Popularität divergieren. OpenRouter vereinheitlicht Multi-Model-API-Zugriff, doch Teams, die LLM-Agenten, Xcode-Build-Ketten und macOS CI/CD verbinden, stoßen an Grenzen: VM-basiertes macOS-CI mit Hypervisor-Overhead, lokale Macs ohne 7×24-Betrieb. Für Produktionsumgebungen mit nativer Apple-Compute ohne Overhead, stabilem iOS-CI/CD und durchgängiger Agent-Automatisierung — unter Berücksichtigung von DSGVO-konformer Datenverarbeitung bei sensiblen Workloads — sind MACNOX dedizierte physische Mac-Knoten meist die bessere Wahl: 100 % Apple-Hardware, voller Root, kein Hypervisor-Steuer, flexible Tag-/Wochen-/Monats-Abrechnung.

SECTION 07 FAQ

Spiegeln OpenRouter-Rankings die Modellqualität wider?

Nein. Sortierung nach bezahltem Token-Volumen — wie viel Entwickler ausgeben, nicht wie intelligent ein Modell ist. Günstige Modelle auf High-Traffic-Apps können oben stehen, ohne Ihre schwersten Reasoning-Pfade zu berühren. Ausgabenanteile mit eigenem Eval-Set kombinieren.

Welches Modell führte im Juli 2026 auf OpenRouter?

Stand 25. Juli: Xiaomi Mimo V2.5 mit ~1,4 Billionen Tokens/Tag, gefolgt von DeepSeek V4 Flash und Tencent Hy3. Tägliche Änderungen — live auf openrouter.ai/rankings prüfen.

Welchen Anteil haben chinesische Modelle auf OpenRouter?

7-Tage-Blended: chinesische Anbieter (DeepSeek, Xiaomi, Tencent, Z.ai, MiniMax, Moonshot, Alibaba u. a.) ~46 % Token-Anteil, vor einem Jahr unter 2 %. US-Big-Three zusammen ~30 %–36 %.

Wie wählen Indie-Entwickler ein Modell?

OpenRouter eignet sich als Sandbox — ein Key, hunderte Modelle. DeepSeek V4 Flash und GLM 5.2 für Coding testen; Claude Opus 5 / GPT-5.6 für blockierende Schritte reservieren. Hybrid-Routing senkt Kosten stark. Latenz (~180–250 ms aus manchen Regionen) und DSGVO-Anforderungen vor Produktion klären.

Was erwartet den Markt im August?

Chinesischer Open-Model-Anteil steigt weiter; Monats-Champion rotiert vermutlich erneut; Anthropic könnte günstigeren Durchsatz-Tier liefern; community-quantisierte Kimi-K3-Builds erscheinen; Sicherheit und Compliance gewinnen in Enterprise-Auswahl an Gewicht.