七月进入尾声,若你仍用几个月前的印象判断「哪个大模型最值得用」,决策很可能已建立在过期数据之上。OpenRouter 作为全球最大的中立模型路由平台,排行榜不测跑分、不看营销通稿,只看一件事——开发者真金白银把请求发到了谁家。
本文面向在 Mac 上跑 Agent、CLI 编程助手或混合 API 工作流的开发者与技术决策者,严格依据 OpenRouter 截至 2026 年 7 月 25 日的排行榜数据,拆解 7 月三大变化(小米登顶、中国厂商约 46% 份额、Kimi K3 新进前十)、用量与质量的「哑铃型」分层、应用层 Hermes/Kilo Code 主导结构、价格对照与 8 月趋势预测,并给出六步混合路由落地清单。读完应能回答:榜单数字意味着什么、该为哪类任务付溢价、以及如何建立不依赖单周排名的选型体系。
01 OpenRouter 排行榜怎么看:三类让团队误读 7 月数据的常见误区
OpenRouter 的排行榜按 Token 用量排序,本质是「开发者真金白银在用什么」,而不是「哪个模型最聪明」。这个「用量≠质量」的反差,正是解读 7 月数据前必须建立的认知框架。结合6 月排行榜与本月走势,以下三类误区最高频:
- 把单日 Token 榜首当「最强模型」:便宜又快的模型挂在高流量应用背后,就能轻松刷到前列——哪怕它在复杂推理上表现平平。7 月 25 日小米 Mimo V2.5以约 1.4 万亿 Token/天登顶,反映的是性价比与接入广度,不等于全能质量第一。
- 忽略榜单每日波动:同一模型隔天名次都会变(例如 Claude Opus 4.8在 7/24 周用量数据中位列第 10,7/25 被 Ling 3.0 Flash挤出前 12)。月度系列比单日快照更有参考价值。
- 只看模型层、不看应用层:Hermes Agent单应用约占平台 45% Token 份额,角色扮演类应用合计占据开源模型流量可观比例——企业 AI 报道几乎从不覆盖的「隐藏市场」,会系统性扭曲你对「谁在用什么」的判断。
核心论点:OpenRouter 榜回答的是「谁在承担日常 Token 账单」;按任务类型的消费金额榜回答的是「谁值得为最难的工作付溢价」。两件事必须分开读。
官方排行与实时数据请访问以下页面(发版后请再次打开链接核对最新数值):
02 2026年7月 OpenRouter 榜单全解析:小米杀进第一,中国模型份额约 46%
截至 2026 年 7 月 25 日,OpenRouter 单日 Token 用量榜单前三名是 小米 Mimo V2.5(1.4 万亿/天)、DeepSeek V4 Flash(9439 亿/天)、腾讯 Hy3(5900 亿/天)。前十名中,中国厂商模型占据七席,Nemotron 3 Ultra(NVIDIA)、Claude Sonnet 5、Gemini 3 Flash Preview 等为美国阵营守住位置。
| 排名 | 模型 | 厂商 | 单日 Token | 近 30 天累计 |
|---|---|---|---|---|
| 1 | Mimo V2.5 | 小米 | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | 腾讯 | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B(免费) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | 智谱 Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | 阶跃星辰 | 204.8B | 5.9T |
| 9 | Kimi K3 | 月之暗面 | 157.6B | 1.6T(新上榜) |
| 10 | Ling 3.0 Flash | 蚂蚁 InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
拉长到厂商总份额维度:中国厂商(DeepSeek、小米、腾讯、智谱、MiniMax、月之暗面、阿里)合计约 46%,一年前不到 2%;美国三巨头(OpenAI、Anthropic、Google)合计约 30%–36%,一年前约 70%。
| 厂商 | 归属 | 份额(约) |
|---|---|---|
| DeepSeek | 中国 | 16%–18% |
| 小米 | 中国 | 8%–18% |
| Anthropic | 美国 | 10%–15% |
| 腾讯 | 中国 | 8%–13% |
| 美国 | 8%–13% | |
| OpenAI | 美国 | 6%–8% |
价差是核心驱动力:DeepSeek V4 Flash输入价约每百万 Token $0.05–0.14,GPT-5.5约 $5.00——价差高达约 35 倍。值得注意的是,DeepSeek 仍是单一厂商中份额最稳定的第一名,而「月度冠军模型」经常易主——从 2 月 MiniMax M2.5、4 月 MiMo-V2-Pro 到 7 月 Mimo V2.5,中国阵营内部竞争同样激烈。
03 「用量第一」≠「质量第一」:哑铃型市场与 Claude Opus 5 定价权
按任务类型统计的消费金额占比(而非 Token 量)呈现不同图景:通用对话 35.7%,Agent 工作流 30.4%,代码 26.5%,数据处理 7.5%。但在「分类/复杂推理」这类难任务上画风反转——Claude Sonnet 4.6 与 Claude Opus 4.7 以各 13.5% 的消费份额并列第一,GPT-5.5 以 11.6% 排第三,总量榜上的廉价开源模型几乎「查无此模型」。
市场正在自然分层:便宜的中国开源模型吃下海量、低门槛、可容错的「跑量」任务(闲聊、创意写作、角色扮演、简单编程辅助),闭源旗舰仍把持高价值、低容错的「难任务」定价权。7 月 24 日 Anthropic 发布的 Claude Opus 5 在 FrontierBench v0.1 拿下 43.3%(GPT-5.6 Sol 37.5%),价格维持 Opus 系列 $5/$25 每百万 Token——是「我贵,但我值这个价」的典型打法。
| 模型 | 输入/M | 输出/M | 上下文 | 定位 |
|---|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05–0.14 | ~$0.24–0.28 | 1M | 性价比之王,Agentic Coding 首选 |
| MiniMax M3 | $0.10 | $1.21 | 长上下文 | 多模态/图像输入预算之选 |
| GLM 5.2 | $0.45 | $3.31 | — | 开源里接近 Opus 规划质量 |
| Kimi K3 | ~$3 | ~$15 | 1M | 1.4TB 开源权重,闭源级能力 |
| Claude Opus 5 | $5(快速档 $10) | $25(快速档 $50) | 1M | 闭源旗舰,7 月最强基准分 |
04 应用层秘密:编程 Agent 称王,角色扮演是「看不见的半壁江山」
模型层排行榜反映「哪个大脑更受欢迎」;应用层排行榜(openrouter.ai/apps)反映「这些大脑真正被用来做什么」。
| 排名 | 应用 | 类型 | 份额(约) |
|---|---|---|---|
| 1 | Hermes Agent | 个人智能体/CLI Agent | ~45% |
| 2 | Kilo Code | 编程 Agent | ~13% |
| 3 | OpenClaw | 通用 Agent | ~9% |
| 4 | Claude Code | 编程 Agent | ~6% |
| 5 | Descript | 内容生产 | ~4.5% |
| 6 | pi | Agent | ~3.3% |
| 7 | Lemonade | 陪伴/游戏 | ~2.1% |
| 8 | ISEKAI ZERO | 角色扮演 | ~2.0% |
| 9 | Janitor AI | 角色扮演 | ~1.8% |
| 10 | Cline | 编程 Agent(IDE 插件) | ~1.7% |
- Cline → Roo Code → Kilo Code 是同一代码血统的三次分叉,「孙子辈」Kilo Code 流量已反超祖辈 Cline,说明开源编程 Agent 生态迭代极快,先发优势并不牢固。
- 角色扮演/陪伴类(Janitor AI、ISEKAI ZERO、SillyTavern、HammerAI)合计占据开源模型流量相当可观比例。OpenRouter × a16z《State of AI》报告显示,创意角色扮演场景贡献了开源模型总用量的一半以上——若只从企业级 AI 报道判断市场,你会完全看不到这半壁江山。
05 8 月趋势预测与各角色实操建议
结合 7 月数据走势与行业动态,对 8 月做出以下判断:
- 中国开源模型合计份额大概率继续爬升,年内有望突破 50%,除非美国厂商在定价上做出重大让步。
- 「月度冠军模型」宝座还会继续易主——小米、DeepSeek、腾讯、智谱、MiniMax、月之暗面之间的价格战与迭代速度不会放缓。
- Anthropic 可能在 8 月推出更「平价」的型号来抢占用量份额,而不只是靠 Opus 5 守住基准分数——Opus 5 已是两个月内第四款旗舰(继 Mythos 5、Fable 5、Sonnet 5 之后)。
- Kimi K3 的 1.4TB 权重或在 2–4 周内出现社区量化压缩版本,届时才是中小团队真正能用上的时间点。
- 安全与合规将成为新的选型变量:OpenAI 未发布模型沙盒逃逸事件持续发酵,美国国会已提出「AI 终止开关法案」,企业采购中「厂商安全声誉」权重将明显上升。
独立开发者/小团队:用 OpenRouter 做技术预研沙盒完全没问题;编程类任务优先测试 DeepSeek V4 Flash与 GLM 5.2,把 Claude Opus 5 / GPT-5.6 留给真正卡住的复杂步骤,做「混合路由」能大幅降低成本。注意国内访问 OpenRouter 平均延迟约 180–250ms,正式生产环境建议评估国内合规中转方案。
企业技术负责人:不要只看用量排行榜做选型决策;建议按任务类型分层路由——闲聊/创意走低价开源模型,分类/复杂推理/高风险 Agent 决策走闭源旗舰,并把「模型供应商安全记录」正式纳入选型评分卡。
AI Agent/编程工具产品:关注 Cline → Kilo Code 分叉链的启示;角色扮演/陪伴类场景体量远超多数人想象,泛娱乐产品不要忽视这块市场。
06 六步构建混合路由架构:可引用数据与 CALMVPS 收束
- 注册 OpenRouter 并建立成本仪表盘:在控制台创建 API Key,按模型/项目打标签;每周对照 Rankings 页复盘 Token 流向,避免「默认模型」常年不更新。
- 定义任务分级路由规则:将工作流拆为 Tier-0(补全/摘要)、Tier-1(多文件重构)、Tier-2(长程 Agent);Tier-0 指向 DeepSeek V4 Flash / Mimo V2.5,Tier-2 指向 Claude Opus 5。
- 在 CLI 工具层启用可切换模型配置:Claude Code、Kilo Code、Hermes Agent、OpenClaw 等均支持通过环境变量或配置文件切换 OpenRouter 模型 ID,禁止硬编码单一 endpoint。
- 为开放权重模型预留自托管路径:对合规敏感数据,评估 MiniMax M3、DeepSeek V4、GLM 5.2、Kimi K3 的 on-prem 部署;Mac 上可用 Ollama / LM Studio 做离线 fallback。
- 在 Mac 上部署 7×24 编排层:Agent Gateway、定时批处理与 SSH 隧道不应依赖笔记本合盖;使用 launchd 或裸金属 Mac 确保路由层与日志采集常驻在线。
- 锁定 8 月发版日历并设置 A/B 切换窗口:关注 Anthropic 平价型号、Kimi K3 社区量化版与各家 8 月迭代节奏;提前准备 shadow 流量与回滚开关。
- 小米 Mimo V2.5 日 Token:约 1.4T,7 月 25 日模型榜 #1
- 中国厂商合计份额:约 46%(一年前 <2%);美国三巨头合计约 30%–36%
- DeepSeek V4 Flash vs GPT-5.5 输入价差:约 35 倍($0.05–0.14/M vs ~$5/M)
- Hermes Agent 应用份额:约 45%,平台最大单一应用
- Claude Opus 5 FrontierBench v0.1:43.3%,高于 GPT-5.6 Sol 的 37.5%
7 月这份榜单最值得记住的一句话是:capability(能力)和 popularity(用量)正在分道扬镳。中国开源模型靠价格拿下了流量的半壁江山,而美国闭源旗舰仍然守着难任务的定价权和安全声誉的护城河。对普通开发者与技术决策者,现在最值钱的能力不是「选对最强模型」,而是构建能随时切换模型的架构。
在 Mac 上落地上述混合路由时,常见替代方案的短板同样清晰:笔记本合盖休眠导致 Agent 与 OpenRouter 回调断连;Linux VPS 无法运行 Claude Code 等 macOS 原生沙箱;虚拟机 Mac 在 Metal 与文件权限上与裸金属有明显差距;自购高配 Mac Studio 则面临采购周期与折旧。对需要 7×24 稳定在线、按项目弹性切换 M4/M4 Pro 配置 的 Agent 编排与 iOS CI/CD 生产环境,CALMVPS 裸金属 Mac 租赁 提供独占 Apple Silicon、约 120 秒交付与日/周/月/季租灵活计费,让你在信任 OpenRouter 榜单选模型的同时,把路由层放在不会休眠的生产级 macOS 上。机型与价格见 定价页,远程接入见 帮助中心。