Если вы всё ещё выбираете LLM по benchmark-таблице двухмесячной давности, решения уже принимаются на устаревших данных. OpenRouter — крупнейший нейтральный маркетплейс LLM-routing — публикует честнее любого vendor announcement: реальный платный production token volume сотен моделей. Рейтинг измеряет не «кто набрал больше баллов в тесте», а кому разработчики доверили реальный трафик с реальными деньгами.
Статья для разработчиков и tech-лидов с agent-, CLI-coding- или hybrid API-workflows на Mac. На базе данных OpenRouter до 25 июля 2026 разбираем три июльских сдвига (Xiaomi на #1, китайские labs около 46% доли, Kimi K3 в топ-10), barbell «объём vs качество», доминирование Hermes/Kilo Code на app-слое, матрицу цен, прогноз на август и playbook гибридного routing в шесть шагов. После прочтения вы поймёте, что значат цифры, каким задачам нужен premium-модель и как собрать stack без зависимости от недельного #1.
01 Как читать рейтинг OpenRouter: три ошибки, искажающие решения июля 2026
OpenRouter ранжирует по объёму токенов — по сути, за что разработчики платят в production, а не кто победил в leaderboard. Разрыв между usage и capability — рамка, которую нужно зафиксировать до чтения июльской доски. По сравнению с нашим обзором июня 2026 три ошибки встречаются постоянно:
- Дневной #1 по volume как «лучшая модель»: дешёвая быстрая модель в high-traffic consumer app легко обгоняет более capable модель, зарезервированную для самых сложных 10% работы. 25 июля Mimo V2.5 от Xiaomi лидировал с ~1,4 трлн token/день — история цены и охвата, не универсальная корона качества.
- Игнорирование дневной волатильности: рейтинги двигаются быстро. Claude Opus 4.8 был в топ-10 недельных данных 24 июля; к 25 июля Ling 3.0 Flash вытеснил его из топ-12. Месячные ряды надёжнее однодневных snapshot.
- Смотреть только модели, не apps: один Hermes Agent держит ~45% отслеживаемой app-доли token. Roleplay и companion apps двигают серьёзный volume, который enterprise AI coverage почти не упоминает — скрытый рынок, искажающий «кто чем пользуется».
Ключевой тезис: рейтинг отвечает, кто несёт ежедневный token bill; spend-by-task-category — «кто заслуживает premium на самой тяжёлой работе». Читать раздельно.
Официальные доски обновляются ежедневно — проверьте перед цитированием:
02 OpenRouter июль 2026: Xiaomi на #1, китайские модели пересекли ~46% доли
На 25 июля 2026 топ-3 по дневному token volume: Xiaomi Mimo V2.5 (1,4T/день), DeepSeek V4 Flash (943,9B/день) и Tencent Hy3 (590B/день). Семь из десяти первых мест — китайские labs; Nemotron 3 Ultra (NVIDIA), Claude Sonnet 5 и Gemini 3 Flash Preview удерживают позиции US-кamp.
| Ранг | Модель | Вендор | Token/день | 30-дн. итог |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4T | 31,2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9B | 23,6T |
| 3 | Hy3 | Tencent | 590B | 23,4T |
| 4 | Nemotron 3 Ultra 550B (free) | NVIDIA | 428,6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7B | 11,6T |
| 6 | GLM 5.2 | Z.ai | 316,7B | 13,3T |
| 7 | MiniMax M3 | MiniMax | 262,5B | 15,1T |
| 8 | Step 3.7 Flash | StepFun | 204,8B | 5,9T |
| 9 | Kimi K3 | Moonshot AI | 157,6B | 1,6T (новый вход) |
| 10 | Ling 3.0 Flash | InclusionAI | 128,3B | 417,3B |
| 11 | Gemini 3 Flash Preview | 106,3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5B | 3,6T |
На уровне вендоров китайские labs (DeepSeek, Xiaomi, Tencent, Z.ai, MiniMax, Moonshot, Alibaba) дают ~46% идентифицированного token volume — год назад было меньше 2%. US-модели (OpenAI, Anthropic, Google вместе) около 30–36%, против ~70% год назад.
| Вендор | Происхождение | Доля (прибл.) |
|---|---|---|
| DeepSeek | Китай | 16%–18% |
| Xiaomi | Китай | 8%–18% |
| Anthropic | США | 10%–15% |
| Tencent | Китай | 8%–13% |
| США | 8%–13% | |
| OpenAI | США | 6%–8% |
Цены двигают сдвиг: DeepSeek V4 Flash ~$0,05–0,14/M input против GPT-5.5 около $5,00/M — разрыв ~35×. DeepSeek остаётся самым стабильным #1 вендором по доле (16–18%), а «модель месяца» вращается — MiniMax M2.5 в феврале, MiMo-V2-Pro в апреле, Mimo V2.5 в июле.
03 Лидер по объёму — не лидер по качеству: barbell-рынок и pricing power Claude Opus 5
Spend-by-task-category OpenRouter рассказывает другую историю, чем сырой token count: general chat 35,7%, agentic workflows 30,4%, code 26,5%, data work 7,5%. В самом тяжёлом bucket — classification и complex reasoning — Claude Sonnet 4.6 и Claude Opus 4.7 делят по 13,5% spend, GPT-5.5 третий с 11,6%. Дешёвые open-модели из volume charts здесь почти не видны.
Рынок расходится: недорогие китайские open-weight модели поглощают high-volume, error-tolerant workloads (chat, creative, roleplay, routine coding assist), а closed frontier models сохраняют pricing power на hard, low-error-tolerance work. Запуск Claude Opus 5 24 июля дал 43,3% на FrontierBench v0.1 (против 37,5% у GPT-5.6 Sol) при Opus-tier pricing $5/$25 за миллион token.
| Модель | Input/M | Output/M | Контекст | Позиционирование |
|---|---|---|---|---|
| DeepSeek V4 Flash | ~$0,05–0,14 | ~$0,24–0,28 | 1M | Лучшая цена; agentic coding default |
| MiniMax M3 | $0,10 | $1,21 | Long context | Budget multimodal / image input |
| GLM 5.2 | $0,45 | $3,31 | — | Open-weight Opus-style planning |
| Kimi K3 | ~$3 | ~$15 | 1M | 1,4TB open weights, closed-tier capability |
| Claude Opus 5 | $5 (fast tier $10) | $25 (fast tier $50) | 1M | Closed frontier; top июль benchmark |
04 Что реально используется: coding agents впереди, roleplay — невидимая половина
Model rankings показывают, какой «мозг» популярен. App leaderboard (openrouter.ai/apps) показывает, что этот мозг делает в production.
| Ранг | App | Категория | Доля (прибл.) |
|---|---|---|---|
| 1 | Hermes Agent | Personal agent / CLI | ~45% |
| 2 | Kilo Code | Coding agent | ~13% |
| 3 | OpenClaw | General agent | ~9% |
| 4 | Claude Code | Coding agent | ~6% |
| 5 | Descript | Content production | ~4,5% |
| 6 | pi | Agent | ~3,3% |
| 7 | Lemonade | Companion / gaming | ~2,1% |
| 8 | ISEKAI ZERO | Roleplay | ~2,0% |
| 9 | Janitor AI | Roleplay | ~1,8% |
| 10 | Cline | Coding agent (IDE) | ~1,7% |
- Cline → Roo Code → Kilo Code — три поколения одной open-source линии; младший fork Kilo Code обошёл обоих предков — first-mover advantage в dev tooling не вечен.
- Roleplay и companion apps (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) вместе двигают серьёзный volume. OpenRouter × a16z State of AI report: creative roleplay — больше половины open-model usage — если ваш взгляд на AI usage только из enterprise headlines, вы пропускаете половину рынка.
05 Прогноз на август и практические выводы по ролям
Исходя из июльской траектории и отраслевого контекста, ожидаем в августе:
- Комбинированная доля китайских open-weight, вероятно, продолжит рост к 50% и выше, если major US vendor не сделает реальный pricing move.
- Титул «модель месяца» продолжит вращаться — Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax и Moonshot ship и re-price достаточно быстро, чтобы новый #1 в августе не удивил.
- Anthropic может выпустить более дешёвый volume-focused tier вместо ставки только на Opus 5 — Opus 5 уже четвёртый flagship Anthropic менее чем за два месяца (после Mythos 5, Fable 5 и Sonnet 5).
- 1,4-терабайтные open weights Kimi K3, вероятно, получат community quantization за 2–4 недели по паттерну прошлых mega-release.
- Security и governance становятся реальными критериями выбора: sandbox escape unreleased модели OpenAI, proposed US AI Kill Switch Act и ожидаемые White House pre-release review frameworks толкают vendor safety track records в formal enterprise scorecards.
Independent developers и малые команды: OpenRouter остаётся fastest way A/B test dozens моделей за одним API key. Coding workloads начинайте на DeepSeek V4 Flash и GLM 5.2; premium closed models — для шагов, где cheap models реально fail. Latency измеряйте сами — OpenRouter не оптимизирован под каждый region или compliance need.
Infrastructure leads: не выбирайте модели только по usage rank — он отражает price sensitivity, не fitness для вашей workload. High-volume/low-risk — на cheap models, hard/high-stakes — на frontier closed; vendor safety history — в scorecard.
Agent и coding tool builders: цепочка fork Cline → Kilo Code напоминает, что moats в open-source dev tooling тоньше, чем кажется. Если продукт касается entertainment или companion use cases, не недооценивайте volume этого сегмента.
06 Шесть шагов к hybrid routing stack: цитируемые данные и CALMVPS wrap-up
- Регистрация на OpenRouter и cost dashboard: API key, tag spend по модели и проекту, Rankings page еженедельно — default model не должен окаменеть.
- Tiered routing rules: Tier-0 (autocomplete/summary), Tier-1 (multi-file refactors), Tier-2 (long-horizon agents). Tier-0 → DeepSeek V4 Flash или Mimo V2.5; Tier-2 → Claude Opus 5.
- Swappable model config в CLI tools: Claude Code, Kilo Code, Hermes Agent и OpenClaw принимают OpenRouter model IDs через env или config — never hard-code single endpoint.
- Self-host path для open weights: для compliance-sensitive data оцените on-prem MiniMax M3, DeepSeek V4, GLM 5.2 или Kimi K3; на Mac — Ollama или LM Studio как offline fallback.
- 24/7 orchestration layer на Mac: agent gateways, scheduled batch jobs и SSH tunnels не должны зависеть от laptop lid. launchd или bare-metal Mac — routing и log collection online.
- August release calendar и A/B cutovers: следите за Anthropic volume tier, Kimi K3 community quant builds и august ship cadence китайских labs; shadow traffic и rollback switches до launch week.
- Xiaomi Mimo V2.5 daily tokens: ~1,4T, model rank #1 на 25 июля
- Китайские вендоры combined share: ~46% (год назад under 2%); US big three ~30–36%
- DeepSeek V4 Flash vs GPT-5.5 input gap: ~35× ($0,05–0,14/M vs ~$5/M)
- Hermes Agent app share: ~45%, largest single app на платформе
- Claude Opus 5 FrontierBench v0.1: 43,3%, выше 37,5% у GPT-5.6 Sol
История июля: capability и popularity расходятся. Китайские open-weight модели купили половину рынка ценой. US closed-frontier labs защищают другую половину pricing power на hard tasks и safety credibility. Полезнее спросить не «кто #1 на этой неделе», а на какой стороне barbell лежит ваша workload.
Hybrid routing на Mac вскрывает знакомые gaps: MacBook sleep рвёт agents и OpenRouter callbacks; Linux VPS не запускает macOS-native sandbox Claude Code; virtualized Mac платит Metal и file-permission penalties vs bare metal; maxed Mac Studio — procurement lead time и depreciation. Командам с 24/7 uptime и elastic M4/M4 Pro sizing для agent orchestration и iOS CI/CD подойдёт аренда bare-metal Mac CALMVPS — dedicated Apple Silicon, provisioning ~120 секунд, day/week/month/quarter billing — OpenRouter boards для model choice, routing layer на macOS, который не спит. Цены: цены аренды, эксплуатация: центр помощи, заказ: оформить заказ Mac mini M4.