Grok 4.5: полный разбор
Сильнейшая coding-модель SpaceXAI — Opus-уровень за четверть цены?

8 июля 2026 SpaceXAI Илона Маска официально выпустил Grok 4.5 — первый флагман после IPO. В X заявлено: модель уровня Opus, быстрее, эффективнее по токенам, дешевле.

Материал для разработчиков, выбирающих AI coding-ассистента, пользователей Cursor и команд с жёстким бюджетом. Сводим публичные benchmarks, независимый тест TryAI, API-тарифы и точки входа. Отвечаем: где Grok 4.5 силён, где слаб и является ли «в 4 раза дешевле» арифметикой или маркетингом.

01 Grok 4.5: совместное обучение с Cursor и базовые спеки

Типичные ошибки перед выбором:

  • Смотреть только рейтинг benchmark: разрыв между vendor-harness и нейтральным harness — до 17 п.п.
  • Сравнивать только цену API: при расходе output-токенов в 4,2× низкая ставка не означает дешёвую задачу.
  • Игнорировать спор о train data: CursorBench снят из-за contamination — заявления про Cursor нуждаются в независимом ретесте.
  • Не учитывать hallucination rate: AA-Omniscience Index — 54 % у Grok 4.5; в проде нужен слой валидации.

Grok 4.5 — сильнейшая модель SpaceXAI, заточена под:

  • Программирование и code-agents: багфиксы, крупные рефакторы, end-to-end приложения
  • Agentic workflows: многошаговая автоматизация через инструменты и приложения
  • Knowledge-intensive работу: право, медицина, образование, аналитика

Модель совместно обучалась с Cursor на триллионах токенов реальных dev-взаимодействий (code review, отладка, диалоги agent-репозиторий). SpaceX купил Anysphere в июне 2026; co-training — один из первых результатов сделки. Контекст: разбор покупки Cursor SpaceX.

Ключевые спеки Grok 4.5
Параметр Значение
Архитектура Mixture of Experts (MoE)
Контекст 500 000 tokens
Режимы reasoning Low / Medium / High (по умолчанию High)
Скорость инференса Официально 80 TPS, замер ~90 TPS
Train hardware Десятки тысяч NVIDIA GB300 GPU (ДЦ Memphis)
Параметры Не раскрыты (MoE)

02 Цены Grok 4.5: API-тарифы и реальная стоимость задачи

Цена — центральный аргумент. Сначала ставки API, затем стоимость задачи с учётом token-эффективности.

Сравнение API (за 1M tokens)
Модель Input Output
Grok 4.5 $2.00 $6.00
Grok 4.5 (cache hit) $0.50
Grok 4.5 Fast $4.00 $18.00
Claude Opus 4.7 $5.00 $25.00
Claude Fable 5 Выше Выше
GPT-5.6 Sol (флагман) $5.00 $30.00
GPT-5.6 Luna (эконом) $1.00 $6.00
Реальная стоимость coding-agent задачи
Модель / платформа Средний расход tokens Реальная цена / задача
Grok 4.5 / Grok Build ~1.9M tokens $2.49
GPT-5.5 / Codex ~6.2M tokens $5.07
Claude Fable 5 / Claude Code ~7.2M tokens $11.80

На SWE-Bench Pro Grok 4.5 в среднем выдаёт 15 954 output tokens за прогон, Claude Opus 4.8 — 67 020, разрыв 4,2×. При 500 задач/день: Grok ~$1 245/день vs Claude Code ~$5 900/день. На высокой частоте вызовов преимущество растёт экспоненциально.

03 Benchmarks Grok 4.5: coding, agents, intelligence index

SpaceXAI опубликовал четыре coding-оценки. Сводим официальные и независимые цифры и фиксируем отзыв CursorBench.

Coding benchmarks
Тест Grok 4.5 Fable 5 Opus 4.8 GPT-5.5
DeepSWE 1.0 (vendor harness) 62.0% 66.1% 55.75% 64.31%
DeepSWE 1.1 (нейтральный harness) 53% 70% 59% 67%
Terminal Bench 2.1 83.3% 84.3% 78.9% 83.4%
SWE-Bench Pro 64.7% 80.4% 69.2% 58.6%

Интерпретация:

  • DeepSWE 1.0: Grok 4.5 — 3-е место, разрыв небольшой.
  • DeepSWE 1.1: 4-е место; Fable 5 впереди на 17 п.п. — честнейшее сравнение.
  • Terminal Bench 2.1: топ-4 в пределах 5,4 п.п. — фактически паритет.
  • SWE-Bench Pro: самый жёсткий тест; Grok 4.5 ~на 16 п.п. позади Fable 5.

Отзыв CursorBench: при релизе proprietary benchmark Cursor временно снят — снимки кодовой базы Cursor попали в train data. Contamination. Цифры по Cursor-training ждут независимого ретеста.

Agent benchmarks (сильная сторона Grok 4.5)
Тест Grok 4.5 Fable 5 Opus 4.8
AutomationBench-AA (657 workflows) 51.4% 48.6% 48.5%
Snorkel GDPVal+ (проф. работа) 29% 21%

AutomationBench-AA эмулирует 40 корпоративных приложений (Gmail, Slack, Salesforce, HubSpot). Grok 4.5 — первая модель, прошедшая более половины workflow-целей без нарушения бизнес-ограничений. Snorkel: право (40% vs 27–28%), образование (58% vs 35–42%), медицина (35% vs 23–25%).

Artificial Analysis Intelligence Index: Grok 4.5 — 54 балла (4-е место), после Fable 5 (60), Opus 4.8 (56), GPT-5.5 (55), но +16 к прошлому Grok.

04 Тест TryAI и подключение Cursor / API за 6 шагов

TryAI дал Grok 4.5, GPT-5.5, Claude Opus 4.8 и Claude Fable 5 одинаковые промпты для сборки одного интерактивного приложения с нуля.

TryAI — 3D-куб (самый сложный тест)
Модель Результат
Opus 4.8 / Fable 5 Успех с первой попытки
Grok 4.5 Первая попытка: только заголовок и кнопка, без куба; успех на retry
GPT-5.5 Провал

Скорость и стоимость: time-to-first-token <0,5 с, ~110 tokens/s (~2× конкурентов). GPT-5.5 быстрее на коротких ответах; Fable 5 — самый медленный и дорогой. Grok 4.5 доминирует на высокочастотных повторяющихся coding-задачах; Claude надёжнее для сложного state management за один проход.

Доступные платформы (EU ожидается в середине июля):

  • Grok Build: собственная coding-agent платформа SpaceXAI, Grok 4.5 по умолчанию
  • Cursor: все планы (desktop, Web, iOS, CLI, SDK); удвоенный лимит в первую неделю
  • SpaceXAI Console API: Chat Completions и Responses API
  • Office plugins: модель по умолчанию в Word, PowerPoint, Excel
  • Сторонние шлюзы: OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic

API-регионы: us-east-1, us-west-2. Лимиты: 150 req/s, 50M tokens/min.

api-quickstart.sh
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "Найди баг и исправь: function median(a){a.sort();return a[a.length/2]}"
  }'

6 шагов в прод:

  1. Регистрация SpaceXAI Console: аккаунт на console.x.ai, API key, проверка billing-региона us-east-1 или us-west-2.
  2. Переключение модели в Cursor: Cursor → выбор модели → Grok 4.5; первая неделя — удвоенный лимит для нагрузочного теста.
  3. Настройка cache key: prompt_cache_key в Responses API или header x-grok-conv-id в Chat Completions — input $0.50/M при cache hit.
  4. Context Compaction для длинных agent loops: снижение накопления tokens и контроль суммарной стоимости.
  5. Гибридный routing: рутинные subtasks на Grok 4.5, сложные архитектурные решения на Claude Fable 5 — fallback в Cursor или LiteLLM.
  6. Валидация output в проде: CI gates и ручной review для SWE-Bench-Pro-уровня и сценариев, чувствительных к hallucinations.

05 Стоит ли переходить на Grok 4.5: матрица, FAQ, вывод

Подходящие и рискованные сценарии
Сценарий Рекомендация Причина
High-frequency agents (сотни–тысячи/день) Приоритет ~$2.49 vs $11.80 за задачу — мгновенная экономия
Terminal и tool calling Приоритет Terminal Bench 2.1, AutomationBench — топ
Команды с глубокой интеграцией Cursor Приоритет Co-training, нативная поддержка, плавное переключение
Гибридная модельная стратегия Рекомендуется Grok на рутину, Fable 5 на архитектуру
Высокоточный код уровня SWE-Bench Pro Осторожно Fable 5 впереди ~на 16 п.п.
Прод с низкой толерантностью к hallucinations Осторожно AA-Omniscience 54% — нужна валидация
Пользователи EU Ждать API только us-east-1 / us-west-2; EU ещё не открыт
Заявления по CursorBench Не принимать Train data contamination, результаты отозваны

Цитируемые метрики (EEAT):

  • Token-эффективность: SWE-Bench Pro output: Grok 4.5 — 15 954 vs Opus 4.8 — 67 020, разрыв 4,2× (SpaceXAI, 08.07.2026).
  • Скорость инференса: первый token <500 ms, ~110 tokens/s, ~2× конкурентов (TryAI).
  • Intelligence index: Artificial Analysis 54, +16 к прошлому Grok, 4-е место (июль 2026).

FAQ:

  • В: Grok 4.5 лучше Claude Opus 4.8? О: Зависит от метрики. Opus 4.8 сильнее на SWE-Bench Pro (69.2% vs 64.7%). Grok 4.5 часто выигрывает по скорости, token-эффективности и стоимости (до 4×). По completion rate agent-workflows слегка впереди Opus 4.8 в независимых benchmarks.
  • В: Grok 4.5 бесплатен? О: Были временные free-квоты на Grok Build и Cursor; официальная API — $2/M input, $6/M output. Включён в пул моделей Cursor.
  • В: Как использовать Grok 4.5 в Cursor? О: Все планы Cursor; селектор модели → Grok 4.5. Первая неделя — удвоенный лимит.
  • В: Размер контекста? О: 500 000 tokens — достаточно для большинства крупных репозиториев.
  • В: Почему отозван CursorBench? О: Снимки Cursor в train data — contamination; SpaceXAI отозвал результаты.
  • В: Через OpenRouter? О: Да — также Vercel AI Gateway, Cloudflare, Snowflake, Databricks Mosaic.

Вывод: Grok 4.5 — не сильнейшая coding-модель, но лучший по цене/качеству Opus-класс agent: в token-эффективности и API-тарифах часто 70–80% дешевле при качестве, близком к Opus 4.8, в типовых agent-workflows. Финансовый и safety-critical код — по-прежнему Claude Fable 5.

Основные источники — перепроверьте ссылки после обновлений upstream:

https://x.ai/news/grok-4-5

https://cursor.com/blog/grok-4-5

https://docs.x.ai/developers/models/grok-4.5

https://techcrunch.com/2026/07/08/spacexai-releases-grok-4-5-which-elon-describes-as-an-opus-class-model/

https://snorkel.ai/blog/grok-4-5-testing-results-how-spacexais-new-model-performs-on-real-professional-work/

Запуск Grok 4.5 на личном ноутбуке упирается в sleep, обрывающий длинные agent loops; параллельные репозитории конкурируют за CPU/RAM; аудит сложно унифицировать в команде. Для Cursor Agent, Codex CI или OpenClaw Gateway 24/7 аренда bare-metal Mac Mini CALMVPS обычно стабильнее: выделенный Apple Silicon, нативное ускорение Metal, помесячная гибкость, provisioning ~120 с — тяжёлые agent-run в облако, локально только review планов. Страница цен.