8 июля 2026 SpaceXAI Илона Маска официально выпустил Grok 4.5 — первый флагман после IPO. В X заявлено: модель уровня Opus, быстрее, эффективнее по токенам, дешевле.
Материал для разработчиков, выбирающих AI coding-ассистента, пользователей Cursor и команд с жёстким бюджетом. Сводим публичные benchmarks, независимый тест TryAI, API-тарифы и точки входа. Отвечаем: где Grok 4.5 силён, где слаб и является ли «в 4 раза дешевле» арифметикой или маркетингом.
01 Grok 4.5: совместное обучение с Cursor и базовые спеки
Типичные ошибки перед выбором:
- Смотреть только рейтинг benchmark: разрыв между vendor-harness и нейтральным harness — до 17 п.п.
- Сравнивать только цену API: при расходе output-токенов в 4,2× низкая ставка не означает дешёвую задачу.
- Игнорировать спор о train data: CursorBench снят из-за contamination — заявления про Cursor нуждаются в независимом ретесте.
- Не учитывать hallucination rate: AA-Omniscience Index — 54 % у Grok 4.5; в проде нужен слой валидации.
Grok 4.5 — сильнейшая модель SpaceXAI, заточена под:
- Программирование и code-agents: багфиксы, крупные рефакторы, end-to-end приложения
- Agentic workflows: многошаговая автоматизация через инструменты и приложения
- Knowledge-intensive работу: право, медицина, образование, аналитика
Модель совместно обучалась с Cursor на триллионах токенов реальных dev-взаимодействий (code review, отладка, диалоги agent-репозиторий). SpaceX купил Anysphere в июне 2026; co-training — один из первых результатов сделки. Контекст: разбор покупки Cursor SpaceX.
| Параметр | Значение |
|---|---|
| Архитектура | Mixture of Experts (MoE) |
| Контекст | 500 000 tokens |
| Режимы reasoning | Low / Medium / High (по умолчанию High) |
| Скорость инференса | Официально 80 TPS, замер ~90 TPS |
| Train hardware | Десятки тысяч NVIDIA GB300 GPU (ДЦ Memphis) |
| Параметры | Не раскрыты (MoE) |
02 Цены Grok 4.5: API-тарифы и реальная стоимость задачи
Цена — центральный аргумент. Сначала ставки API, затем стоимость задачи с учётом token-эффективности.
| Модель | Input | Output |
|---|---|---|
| Grok 4.5 | $2.00 | $6.00 |
| Grok 4.5 (cache hit) | $0.50 | — |
| Grok 4.5 Fast | $4.00 | $18.00 |
| Claude Opus 4.7 | $5.00 | $25.00 |
| Claude Fable 5 | Выше | Выше |
| GPT-5.6 Sol (флагман) | $5.00 | $30.00 |
| GPT-5.6 Luna (эконом) | $1.00 | $6.00 |
| Модель / платформа | Средний расход tokens | Реальная цена / задача |
|---|---|---|
| Grok 4.5 / Grok Build | ~1.9M tokens | $2.49 |
| GPT-5.5 / Codex | ~6.2M tokens | $5.07 |
| Claude Fable 5 / Claude Code | ~7.2M tokens | $11.80 |
На SWE-Bench Pro Grok 4.5 в среднем выдаёт 15 954 output tokens за прогон, Claude Opus 4.8 — 67 020, разрыв 4,2×. При 500 задач/день: Grok ~$1 245/день vs Claude Code ~$5 900/день. На высокой частоте вызовов преимущество растёт экспоненциально.
03 Benchmarks Grok 4.5: coding, agents, intelligence index
SpaceXAI опубликовал четыре coding-оценки. Сводим официальные и независимые цифры и фиксируем отзыв CursorBench.
| Тест | Grok 4.5 | Fable 5 | Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| DeepSWE 1.0 (vendor harness) | 62.0% | 66.1% | 55.75% | 64.31% |
| DeepSWE 1.1 (нейтральный harness) | 53% | 70% | 59% | 67% |
| Terminal Bench 2.1 | 83.3% | 84.3% | 78.9% | 83.4% |
| SWE-Bench Pro | 64.7% | 80.4% | 69.2% | 58.6% |
Интерпретация:
- DeepSWE 1.0: Grok 4.5 — 3-е место, разрыв небольшой.
- DeepSWE 1.1: 4-е место; Fable 5 впереди на 17 п.п. — честнейшее сравнение.
- Terminal Bench 2.1: топ-4 в пределах 5,4 п.п. — фактически паритет.
- SWE-Bench Pro: самый жёсткий тест; Grok 4.5 ~на 16 п.п. позади Fable 5.
Отзыв CursorBench: при релизе proprietary benchmark Cursor временно снят — снимки кодовой базы Cursor попали в train data. Contamination. Цифры по Cursor-training ждут независимого ретеста.
| Тест | Grok 4.5 | Fable 5 | Opus 4.8 |
|---|---|---|---|
| AutomationBench-AA (657 workflows) | 51.4% | 48.6% | 48.5% |
| Snorkel GDPVal+ (проф. работа) | 29% | — | 21% |
AutomationBench-AA эмулирует 40 корпоративных приложений (Gmail, Slack, Salesforce, HubSpot). Grok 4.5 — первая модель, прошедшая более половины workflow-целей без нарушения бизнес-ограничений. Snorkel: право (40% vs 27–28%), образование (58% vs 35–42%), медицина (35% vs 23–25%).
Artificial Analysis Intelligence Index: Grok 4.5 — 54 балла (4-е место), после Fable 5 (60), Opus 4.8 (56), GPT-5.5 (55), но +16 к прошлому Grok.
04 Тест TryAI и подключение Cursor / API за 6 шагов
TryAI дал Grok 4.5, GPT-5.5, Claude Opus 4.8 и Claude Fable 5 одинаковые промпты для сборки одного интерактивного приложения с нуля.
| Модель | Результат |
|---|---|
| Opus 4.8 / Fable 5 | Успех с первой попытки |
| Grok 4.5 | Первая попытка: только заголовок и кнопка, без куба; успех на retry |
| GPT-5.5 | Провал |
Скорость и стоимость: time-to-first-token <0,5 с, ~110 tokens/s (~2× конкурентов). GPT-5.5 быстрее на коротких ответах; Fable 5 — самый медленный и дорогой. Grok 4.5 доминирует на высокочастотных повторяющихся coding-задачах; Claude надёжнее для сложного state management за один проход.
Доступные платформы (EU ожидается в середине июля):
- Grok Build: собственная coding-agent платформа SpaceXAI, Grok 4.5 по умолчанию
- Cursor: все планы (desktop, Web, iOS, CLI, SDK); удвоенный лимит в первую неделю
- SpaceXAI Console API: Chat Completions и Responses API
- Office plugins: модель по умолчанию в Word, PowerPoint, Excel
- Сторонние шлюзы: OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic
API-регионы: us-east-1, us-west-2. Лимиты: 150 req/s, 50M tokens/min.
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "Найди баг и исправь: function median(a){a.sort();return a[a.length/2]}"
}'
6 шагов в прод:
- Регистрация SpaceXAI Console: аккаунт на console.x.ai, API key, проверка billing-региона us-east-1 или us-west-2.
- Переключение модели в Cursor: Cursor → выбор модели → Grok 4.5; первая неделя — удвоенный лимит для нагрузочного теста.
- Настройка cache key:
prompt_cache_keyв Responses API или headerx-grok-conv-idв Chat Completions — input $0.50/M при cache hit. - Context Compaction для длинных agent loops: снижение накопления tokens и контроль суммарной стоимости.
- Гибридный routing: рутинные subtasks на Grok 4.5, сложные архитектурные решения на Claude Fable 5 — fallback в Cursor или LiteLLM.
- Валидация output в проде: CI gates и ручной review для SWE-Bench-Pro-уровня и сценариев, чувствительных к hallucinations.
05 Стоит ли переходить на Grok 4.5: матрица, FAQ, вывод
| Сценарий | Рекомендация | Причина |
|---|---|---|
| High-frequency agents (сотни–тысячи/день) | Приоритет | ~$2.49 vs $11.80 за задачу — мгновенная экономия |
| Terminal и tool calling | Приоритет | Terminal Bench 2.1, AutomationBench — топ |
| Команды с глубокой интеграцией Cursor | Приоритет | Co-training, нативная поддержка, плавное переключение |
| Гибридная модельная стратегия | Рекомендуется | Grok на рутину, Fable 5 на архитектуру |
| Высокоточный код уровня SWE-Bench Pro | Осторожно | Fable 5 впереди ~на 16 п.п. |
| Прод с низкой толерантностью к hallucinations | Осторожно | AA-Omniscience 54% — нужна валидация |
| Пользователи EU | Ждать | API только us-east-1 / us-west-2; EU ещё не открыт |
| Заявления по CursorBench | Не принимать | Train data contamination, результаты отозваны |
Цитируемые метрики (EEAT):
- Token-эффективность: SWE-Bench Pro output: Grok 4.5 — 15 954 vs Opus 4.8 — 67 020, разрыв 4,2× (SpaceXAI, 08.07.2026).
- Скорость инференса: первый token <500 ms, ~110 tokens/s, ~2× конкурентов (TryAI).
- Intelligence index: Artificial Analysis 54, +16 к прошлому Grok, 4-е место (июль 2026).
FAQ:
- В: Grok 4.5 лучше Claude Opus 4.8? О: Зависит от метрики. Opus 4.8 сильнее на SWE-Bench Pro (69.2% vs 64.7%). Grok 4.5 часто выигрывает по скорости, token-эффективности и стоимости (до 4×). По completion rate agent-workflows слегка впереди Opus 4.8 в независимых benchmarks.
- В: Grok 4.5 бесплатен? О: Были временные free-квоты на Grok Build и Cursor; официальная API — $2/M input, $6/M output. Включён в пул моделей Cursor.
- В: Как использовать Grok 4.5 в Cursor? О: Все планы Cursor; селектор модели → Grok 4.5. Первая неделя — удвоенный лимит.
- В: Размер контекста? О: 500 000 tokens — достаточно для большинства крупных репозиториев.
- В: Почему отозван CursorBench? О: Снимки Cursor в train data — contamination; SpaceXAI отозвал результаты.
- В: Через OpenRouter? О: Да — также Vercel AI Gateway, Cloudflare, Snowflake, Databricks Mosaic.
Вывод: Grok 4.5 — не сильнейшая coding-модель, но лучший по цене/качеству Opus-класс agent: в token-эффективности и API-тарифах часто 70–80% дешевле при качестве, близком к Opus 4.8, в типовых agent-workflows. Финансовый и safety-critical код — по-прежнему Claude Fable 5.
Основные источники — перепроверьте ссылки после обновлений upstream:
https://cursor.com/blog/grok-4-5
https://docs.x.ai/developers/models/grok-4.5
Запуск Grok 4.5 на личном ноутбуке упирается в sleep, обрывающий длинные agent loops; параллельные репозитории конкурируют за CPU/RAM; аудит сложно унифицировать в команде. Для Cursor Agent, Codex CI или OpenClaw Gateway 24/7 аренда bare-metal Mac Mini CALMVPS обычно стабильнее: выделенный Apple Silicon, нативное ускорение Metal, помесячная гибкость, provisioning ~120 с — тяжёлые agent-run в облако, локально только review планов. Страница цен.