Главная / Блог / Обзор Grok 4.5
ENGINEERING_BLOG · 2026.07.11

Обзор Grok 4.5:
флагман SpaceXAI для кодинг-агентов — действительно в 4 раза дешевле Claude Opus?

Если вы ежедневно вызываете LLM сотни раз в Cursor или собственном agent-пайплайне, Grok 4.5 с 8 июля 2026 уже должен быть в списке моделей — SpaceXAI позиционирует его как «интеллект уровня Opus за долю цены». Этот технический гайд собирает публичные бенчмарки, независимые тесты и тарифы API: спецификации, сравнение цен, бенчмарки программирования и агентов, кодинг-тест TryAI, платформы, 6 шагов настройки и FAQ.

  • Кратко: Grok 4.5 не лидер coding-бенчмарков, но при высокочастотных agent-сценариях эффективность токенов и тариф API дают стоимость одной задачи примерно в четверть от Claude Code (около $2,49 vs $11,80).
  • Сильные стороны: совместное обучение с Cursor, контекст 500 000 токенов, AutomationBench-AA — первый результат выше 50 %, first token <0,5 с, около 110 tokens/s.
  • Слабые стороны: SWE-Bench Pro отстаёт от Claude Fable 5 примерно на 16 п.п.; галлюцинации AA-Omniscience — 54 %; CursorBench снят из-за загрязнения обучающих данных.
  • Подходит для: высокочастотных агентов, terminal-задач, команд на Cursor, бюджетно-чувствительных инженерных организаций.
  • Осторожность: точный multi-file рефакторинг, финансовый/критичный по безопасности код, API для ЕС пока недоступен (ожидается середина июля).

SECTION 01 Что такое Grok 4.5? Флагман SpaceXAI и совместное обучение с Cursor

Grok 4.5 — первый флагманский модель SpaceXAI после IPO, оптимизированный для программирования и code-агентов, автономных workflow через инструменты и knowledge-intensive доменов (право, медицина, образование). Ключевое отличие — совместное обучение с Cursor на триллионах токенов реальных взаимодействий разработчиков (code review, отладка, логи agent-codebase). SpaceX приобрела Anysphere (родитель Cursor) в июне 2026 — Grok 4.5 один из первых видимых результатов.

Grok 4.5 — ключевые характеристики
Параметр Значение
Архитектура Mixture of Experts (MoE)
Контекстное окно 500 000 токенов
Режим рассуждения Низкий / Средний / Высокий (по умолчанию: Высокий)
Скорость инференса Официально 80 TPS, измерено около 90 TPS
Обучающее железо Десятки тысяч NVIDIA GB300 GPU (дата-центр Memphis)
Число параметров Не раскрыто (MoE)

SECTION 02 Цены: тарифы API и реальная стоимость задачи

Цена — главный аргумент Grok 4.5. Номинал уже ниже Claude Opus, но решающий разрыв даёт эффективность токенов: на задачах SWE-Bench Pro Grok 4.5 в среднем расходует 15 954 output-токена за прогон, Claude Opus 4.8 — 67 020, коэффициент 4,2.

Тарифы API (за 1M токенов)
Модель Вход Выход
Grok 4.5 $2,00 $6,00
Grok 4.5 (cache hit) $0,50
Grok 4.5 Fast $4,00 $18,00
Claude Opus 4.7 $5,00 $25,00
Claude Fable 5 Выше Выше
GPT-5.6 Sol (флагман) $5,00 $30,00
GPT-5.6 Luna (эконом) $1,00 $6,00
Оценка стоимости одной задачи coding-агента
Модель / платформа Средние токены на задачу Реальная стоимость
Grok 4.5 / Grok Build ~1,9M токенов $2,49
GPT-5.5 / Codex ~6,2M токенов $5,07
Claude Fable 5 / Claude Code ~7,2M токенов $11,80

При 500 agent-задачах в день: Grok 4.5 около $1 245/день, Claude Code около $5 900/день — разрыв эффективности растёт экспоненциально с объёмом.

SECTION 03 Бенчмарки: программирование, агенты и индекс интеллекта

SpaceXAI опубликовала четыре бенчмарка, связанных с программированием. Ниже официальные и независимые данные.

Сравнение programming-бенчмарков
Бенчмарк Grok 4.5 Claude Fable 5 Claude Opus 4.8 GPT-5.5
DeepSWE 1.0 (официальный harness) 62,0 % 66,1 % 55,75 % 64,31 %
DeepSWE 1.1 (нейтральный harness) 53 % 70 % 59 % 67 %
Terminal Bench 2.1 83,3 % 84,3 % 78,9 % 83,4 %
SWE-Bench Pro (решение) 64,7 % 80,4 % 69,2 % 58,6 %

Интерпретация: под DeepSWE 1.1 (нейтральный harness) Grok 4.5 падает на четвёртое место — Fable 5 впереди на 17 п.п. Terminal Bench 2.1: четыре топ-модели в пределах 5,4 п.п., фактически паритет. SWE-Bench Pro — самый жёсткий тест: Grok 4.5 третий, примерно на 16 п.п. позади Fable 5.

Agent-бенчмарки (сильная сторона Grok 4.5):

Бенчмарки агентов и enterprise-workflow
Бенчмарк Grok 4.5 Claude Fable 5 Claude Opus 4.8
AutomationBench-AA (657 enterprise-workflow) 51,4 % 48,6 % 48,5 %
Snorkel GDPVal+ (профессиональные сценарии) 29 % 21 %

AutomationBench-AA симулирует 40 корпоративных приложений (Gmail, Slack, Salesforce, HubSpot и др.). Grok 4.5 — первая модель, преодолевшая половину целей workflow без нарушения бизнес-ограничений. Тесты Snorkel: Grok 4.5 лидирует в праве (40 % vs 27–28 %), образовании (58 % vs 35–42 %) и медицине (35 % vs 23–25 %).

Общий интеллект: индекс Artificial Analysis — 54 балла (четвёртое место), позади Fable 5 (60), Opus 4.8 (56), GPT-5.5 (55), но +16 баллов к предыдущему Grok.

Снятие CursorBench: при запуске CursorBench (собственный бенчмарк Cursor) убрали — снимки codebase Cursor случайно попали в обучающие данные Grok 4.5 (data contamination). Заметный дефект релиза.

SECTION 04 Практический тест и платформы: TryAI, Grok Build, Cursor, API

TryAI заставил Grok 4.5, GPT-5.5, Claude Opus 4.8 и Claude Fable 5 с одинаковыми промптами собрать одно интерактивное приложение с нуля:

  • 3D-рендер куба (самый сложный тест): Opus 4.8 и Fable 5 с первой попытки; Grok 4.5 в первом прогоне только заголовок и кнопка без куба, со второй — успех; GPT-5.5 провалился.
  • Скорость: first token Grok 4.5 <0,5 с, пропускная способность около 110 tokens/s (примерно вдвое быстрее конкурентов).
  • Стоимость: наименьшая цена одного тестового прогона у Grok 4.5.

Вывод: для высокочастотных повторяющихся coding-задач доминируют скорость и цена Grok 4.5; для сложного state management с первого раза Claude надёжнее.

Доступные платформы (регион ЕС ожидается в середине июля):

  • Grok Build: платформа coding-агента SpaceXAI, Grok 4.5 — модель по умолчанию
  • Cursor: все тарифы (desktop, web, iOS, CLI, SDK), удвоенный лимит в первую неделю
  • SpaceXAI Console API: Chat Completions и Responses API, регионы us-east-1 / us-west-2, лимит 150 req/s, 50M tokens/min
  • Office-плагины: Word, PowerPoint, Excel — модель по умолчанию
  • Сторонние шлюзы: OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic
api-call.sh
curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "Найди баг в этом коде и исправь: function median(a){a.sort();return a[a.length/2]}"
  }'

SECTION 05 Интеграция: шесть шагов для Cursor и API

  1. Выбрать модель в Cursor: открыть Cursor → выбор модели → Grok 4.5 (все тарифы, удвоенный лимит в первую неделю).
  2. Получить API Key SpaceXAI: SpaceXAI Console → API Keys → создать ключ, подтвердить доступ к us-east-1 или us-west-2.
  3. Настроить переменную окружения: локально или в CI export XAI_API_KEY="your-key" — не коммитить ключ в репозиторий.
  4. Включить prompt cache: Responses API с prompt_cache_key или Chat Completions с заголовком x-grok-conv-id — снизить цену входа с $2,00/M до $0,50/M.
  5. Context Compaction для длинных agent-циклов: уменьшить накопление токенов за несколько раундов, снизить общую стоимость пайплайна.
  6. Построить гибридный роутинг: рутинные подзадачи — Grok 4.5, сложные архитектурные решения — Claude Fable 5; автоматическая валидация вывода, особенно при чувствительности к галлюцинациям.

SECTION 06 Стоит ли переходить? Сценарии, риски и твёрдые цифры

Grok 4.5 подходит, если:

  • команда выполняет сотни–тысячи programming-задач в день — экономия сразу измерима
  • в фокусе terminal-задачи и tool calls (Terminal Bench 2.1, AutomationBench на вершине)
  • Cursor уже глубоко интегрирован — переключение без трения
  • стартапы и бюджетные команды хотят сопоставимый интеллект за четверть стоимости задачи
  • гибридная стратегия: Grok 4.5 для рутины, Claude Fable 5 для архитектуры

Осторожность, если:

  • нужна точность уровня SWE-Bench Pro (Fable 5 +16 п.п.)
  • критичен уровень галлюцинаций: индекс AA-Omniscience 54 % — валидация вывода в продакшене обязательна
  • пользователи ЕС: API только us-east-1 и us-west-2
  • данные CursorBench недействительны из-за contamination — ждать независимых ретестов

Цифры для цитирования:

  • Контекстное окно: 500 000 токенов
  • Эффективность выхода SWE-Bench Pro: 15 954 (Grok 4.5) vs 67 020 (Opus 4.8), коэффициент 4,2×
  • Стоимость одной agent-задачи: $2,49 (Grok 4.5) vs $11,80 (Claude Code)
  • AutomationBench-AA: 51,4 %, первая модель выше 50 % enterprise-workflow
  • Индекс Artificial Analysis: 54 балла, +16 к предыдущей версии

Высокочастотные agent-пайплайны на локальном Mac страдают от сна, сетевых колебаний и конкуренции за ресурсы — автоматизация 7×24 прерывается. Чистые VM-решения добавляют потери гипервизора и риски EULA macOS. Для нативной мощности без потерь, стабильной iOS/macOS CI/CD и постоянно онлайн агентов физические облачные узлы MACNOX часто оптимальнее: 100 % оригинальный Mac Mini M4, полный Root, гибкая аренда день/неделя/месяц, нулевые потери гипервизора. См. аренда vs покупка Mac Mini M4 и риски безопасности Claude Code, а также страницу тарифов.

Grok 4.5 — не «самая сильная programming-модель», но самый экономичный coding-агент уровня Opus: когда эффективность токенов и тариф API переводятся в реальную стоимость задачи, в типичных agent-workflow он даёт качество близкое к Opus 4.8 за долю цены. Где точность критична (финансовый код, security-critical системы), Claude Fable 5 остаётся более безопасным выбором.

Официальные и независимые источники (перепроверьте ссылки после публикации):

SpaceXAI — релиз Grok 4.5

Cursor — совместный анонс Grok 4.5

Документация API SpaceXAI — Grok 4.5

TechCrunch — SpaceXAI releases Grok 4.5

Awesome Agents — независимый тест Grok 4.5

Snorkel AI — профессиональные сценарии

SECTION 07 Часто задаваемые вопросы

Grok 4.5 лучше Claude Opus 4.8?

Зависит от определения «лучше». Opus 4.8 точнее на SWE-Bench Pro (69,2 % vs 64,7 %). Grok 4.5 лидирует по скорости, эффективности токенов и стоимости задачи; чуть впереди на agent-workflow. Высокочастотные агенты — Grok. Точный одноразовый кодинг — Claude.

Grok 4.5 бесплатный?

SpaceXAI даёт ограниченные бесплатные квоты в Grok Build и Cursor. Далее API: $2/M вход, $6/M выход. Тарифы Cursor включают модель в пул.

Как использовать Grok 4.5 в Cursor?

Доступен автоматически на всех планах Cursor. Открыть Cursor → выбор модели → Grok 4.5. Первая неделя после релиза — удвоенный лимит.

Какой размер контекстного окна?

500 000 токенов — достаточно для большинства задач на крупных codebase.

Почему сняли CursorBench?

Снимки codebase Cursor случайно попали в обучающие данные Grok 4.5 и исказили бенчмарк. SpaceXAI отозвала данные; независимый ретест ожидается.

Grok 4.5 доступен через OpenRouter?

Да. Доступен через OpenRouter, Vercel AI Gateway, Cloudflare, Snowflake, Databricks Mosaic и другие шлюзы.