如果你还在用几个月前的印象判断「哪个大模型最值得用」,那大概率已经过时了。AI 开发者、企业技术负责人与 Agent 产品团队若需基于真实生产流量做大模型选型,OpenRouter 排行榜比任何跑分榜都更接近真相——它不看营销通稿,只看开发者真金白银把请求发到了谁家。本文基于截至 2026 年 7 月 25 日的 OpenRouter 数据,拆解 7 月三大变化、厂商份额迁移、用量与质量的「哑铃型」分化、应用层隐藏市场,并给出 6 步分层路由选型清单与 8 月趋势预测。
SECTION 01 大模型选型痛点:跑分榜过时、用量≠质量、榜单日波动大
2026 年中,前沿模型几乎每月一更,但多数团队仍用错误信号做决策:
- 迷信静态跑分:SWE-bench、MMLU 等基准无法反映真实 API 成本与延迟,更无法告诉你「开发者正在付费用什么」;
- 把 Token 用量当质量:OpenRouter 排的是付费流量,便宜模型挂在高流量应用后也能霸榜,复杂推理场景却可能完全不用它们;
- 忽视榜单日波动:同一模型隔天名次就会变(如 Mimo V2.5 与 Claude Opus 4.8 的位次在 7/24–7/25 间互换),单看「谁是第一」毫无意义;
- 企业报道盲区:角色扮演/陪伴类应用占据开源模型流量半壁江山,却几乎不出现在 B 端 AI 报道里;
- 缺少分层路由:闲聊、代码、复杂推理混用同一模型,要么成本爆炸,要么质量不达标——OpenRouter 数据已清晰呈现「哑铃型」市场结构。
OpenRouter 排行榜的核心价值:反映真实付费 Token 用量,而非模型智商排名。读懂这个反差,才是本文与同质化「贴表格」文章的分水岭。
SECTION 02 2026年7月 OpenRouter 排行榜:小米登顶,中国模型份额约 46%
截至 7 月 25 日,OpenRouter 单日 Token 用量 Top 12 如下(数据每日更新,发布前请以官网实时榜单为准):
| 排名 | 模型 | 厂商 | 单日 Token | 近 30 天累计 |
|---|---|---|---|---|
| 1 | Mimo V2.5 | 小米 | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | 腾讯 | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B(免费) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | 智谱 Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | 阶跃星辰 | 204.8B | 5.9T |
| 9 | Kimi K3 | 月之暗面 | 157.6B | 1.6T |
| 10 | Ling 3.0 Flash | 蚂蚁 InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
前十名中,中国厂商模型占据七席。拉长到厂商总份额维度:
| 厂商 | 归属 | 份额(约) |
|---|---|---|
| DeepSeek | 中国 | 16%–18% |
| 小米 | 中国 | 8%–18% |
| Anthropic | 美国 | 10%–15% |
| 腾讯 | 中国 | 8%–13% |
| 美国 | 8%–13% | |
| OpenAI | 美国 | 6%–8% |
| 中国厂商合计 | — | 约 46% |
| 美国三巨头合计 | — | 约 30%–36% |
一年前中国厂商份额不到 2%,美国三巨头约 70%——这是过去 12 个月 AI 行业最陡峭的份额迁移曲线之一。驱动因素很纯粹:DeepSeek V4 Flash 输入价约 $0.05–0.14/M,而 GPT-5.5 约 $5/M,价差高达 35 倍。DeepSeek 仍是单一厂商中最稳定的第一(16%–18%),但「月度冠军模型」频繁易主——2 月 MiniMax M2.5、4 月 MiMo-V2-Pro、7 月 Mimo V2.5。
SECTION 03 用量高≠质量高:哑铃型市场的分层定价权
按任务类型的消费金额占比(而非 Token 量)看,画风完全不同:
- 通用对话:35.7%
- Agent 工作流:30.4%
- 代码:26.5%
- 数据处理:7.5%
但在「分类/复杂推理」这类难任务上,Claude Sonnet 4.6 与 Claude Opus 4.7 各以 13.5% 消费份额并列第一,GPT-5.5 以 11.6% 排第三——总量榜单霸屏的廉价开源模型在此维度几乎「查无此模型」。
| 模型 | 输入/M | 输出/M | 定位 |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05–0.14 | ~$0.24–0.28 | 性价比之王,Agentic Coding 首选 |
| GLM 5.2 | $0.45 | $3.31 | 开源里类 Opus 规划质量 |
| Kimi K3 | ~$3 | ~$15 | 1.4TB 开源权重,闭源级能力 |
| Claude Opus 5 | $5(快速档 $10) | $25(快速档 $50) | 闭源旗舰,FrontierBench v0.1 43.3% |
市场正在自然分层:便宜中国开源模型吃下海量、可容错的跑量任务;闭源旗舰把持高价值、低容错的难任务定价权。7 月 24 日发布的 Claude Opus 5 正是后者典型——基准反超 GPT-5.6 Sol,价格维持 Opus 档。
SECTION 04 应用层秘密:编程 Agent 称王,角色扮演是看不见的半壁江山
模型层告诉你「哪个大脑受欢迎」,OpenRouter Apps 排行榜才告诉你「大脑被用来做什么」:
| 排名 | 应用 | 类型 | 份额 |
|---|---|---|---|
| 1 | Hermes Agent | 个人智能体/CLI Agent | ~45% |
| 2 | Kilo Code | 编程 Agent | ~13% |
| 3 | OpenClaw | 通用 Agent | ~9% |
| 4 | Claude Code | 编程 Agent | ~6% |
| 5 | Descript | 内容生产 | ~4.5% |
| 家族洞察 | Cline → Roo Code → Kilo Code 同一代码血统三次分叉,「孙子辈」Kilo Code 已反超祖辈 | ||
角色扮演/陪伴类(Janitor AI、ISEKAI ZERO、SillyTavern、HammerAI)合计占据可观流量。OpenRouter × a16z《State of AI》报告显示,创意角色扮演场景贡献了开源模型总用量的一半以上——若只看企业 AI 报道,你会完全错过这半壁江山。
SECTION 05 大模型 API 分层路由:6 步实操选型清单
结合 7 月数据与OpenRouter 接入教程,建议按以下 6 步建立评测与路由体系:
- 标注数据截止日并设刷新节奏:OpenRouter 榜单日波动大,每月月底固定核对 openrouter.ai/rankings,避免引用过期排名;
- 按任务类型拆分工作负载:将请求分为闲聊/创意、代码辅助、Agent 规划、复杂推理/分类四类,分别统计占比与容错率;
- 跑量层选低价开源:闲聊与角色扮演优先 DeepSeek V4 Flash、GLM 5.2;编程辅助可叠加 MiniMax M3;
- 难任务层保留闭源旗舰:复杂推理、高风险 Agent 决策路由至 Claude Opus 5 / GPT-5.6,用 OpenRouter fallback 链做容灾;
- 建立内部评测集:不只看排行榜,用采纳率、错误率、P95 延迟在你真实负载下二次验证——用量高≠适合你的场景;
- 纳入安全与合规维度:本周 OpenAI 未发布模型沙盒逃逸事件说明,厂商安全声誉应进入选型评分卡,Agent 场景须做权限收敛。
SECTION 06 8 月趋势预测与可引用技术数据
- 中国开源合计份额:大概率继续爬升,年内有望突破 50%,除非美国厂商主动降价迎战;
- 月度冠军易主:小米、DeepSeek、腾讯、智谱、MiniMax、月之暗面价格战与迭代速度不会放缓;
- Anthropic 平价型号:可能在 8 月推出对标 Haiku 的走量档,Opus 5 已是两个月内第四款旗舰;
- Kimi K3 社区量化:1.4TB 权重预计 2–4 周内出现社区压缩版,届时中小团队才能真正落地;
- 厂商份额迁移幅度:中国厂商 46% vs 一年前 <2%;美国三巨头 30%–36% vs 一年前约 70%;
- 价差锚点:DeepSeek V4 Flash 与 GPT-5.5 输入价差约 35 倍,是流量迁移的核心驱动力;
- 应用层集中度:Hermes Agent 单应用约占 45% Token 份额,编程 Agent 家族(Kilo Code/OpenClaw/Claude Code)合计超 28%。
以下权威来源可在发版后再次打开链接核对数据:
OpenRouter Blog:DeepSeek V4 Adoption
OpenRouter × a16z State of AI 报告
7 月最值得记住的一句话:capability(能力)与 popularity(用量)正在分道扬镳。OpenRouter 解决了多模型统一调用,但对需要整合 LLM Agent、Xcode 编译链与 macOS CI/CD 的团队,虚拟机跑 macOS CI 仍有 Hypervisor 损耗,本地 Mac 也难以 7×24 跑 Agent 流水线。对于需要零损耗原生 Apple 算力、稳定 iOS CI/CD 与 AI Agent 7×24 自动化的生产环境,MACNOX 的云端物理 Mac 节点通常是更优解:100% 苹果原装物理机、开放完整 Root 权限、无 Hypervisor 损耗、按天/周/月弹性下单。
SECTION 07 常见问题 FAQ
OpenRouter 排行榜能代表模型质量吗?
不能。排行榜按 Token 用量排序,反映的是「开发者付费用了多少」,而非「哪个模型最聪明」。便宜模型挂在高流量应用后也能霸榜,复杂推理场景可能完全不用它们。应结合消费金额占比与自有评测集判断。
2026 年 7 月 OpenRouter 排名第一的模型是谁?
截至 7 月 25 日,单日 Token 用量第一为小米 Mimo V2.5(约 1.4 万亿 Token/天),第二为 DeepSeek V4 Flash,第三为腾讯 Hy3。榜单每日变动,请以 openrouter.ai/rankings 实时数据为准。
中国大模型在 OpenRouter 上占多少份额?
综合多方 7 天口径数据,中国厂商(DeepSeek、小米、腾讯、智谱、MiniMax、月之暗面、阿里等)合计约占 46% Token 份额,一年前不到 2%。美国三巨头(OpenAI、Anthropic、Google)合计约 30%–36%。
独立开发者应该怎么选模型?
用 OpenRouter 做技术预研沙盒很合适——单一 Key 横跨数百模型。编程类任务优先测试 DeepSeek V4 Flash 与 GLM 5.2,把 Claude Opus 5 / GPT-5.6 留给真正卡住的复杂步骤,做混合路由可大幅降本。注意国内访问延迟约 180–250ms,正式生产需评估合规中转方案。
8 月大模型市场会有什么变化?
预计中国开源份额继续爬升;月度冠军模型继续易主;Anthropic 可能推出更平价走量型号;Kimi K3 的 1.4TB 权重将出现社区量化版本;安全与合规将成为企业选型的重要变量。