Если вы ежедневно вызываете LLM сотни раз в Cursor или собственном agent-пайплайне, Grok 4.5 с 8 июля 2026 уже должен быть в списке моделей — SpaceXAI позиционирует его как «интеллект уровня Opus за долю цены». Этот технический гайд собирает публичные бенчмарки, независимые тесты и тарифы API: спецификации, сравнение цен, бенчмарки программирования и агентов, кодинг-тест TryAI, платформы, 6 шагов настройки и FAQ.
- Кратко: Grok 4.5 не лидер coding-бенчмарков, но при высокочастотных agent-сценариях эффективность токенов и тариф API дают стоимость одной задачи примерно в четверть от Claude Code (около $2,49 vs $11,80).
- Сильные стороны: совместное обучение с Cursor, контекст 500 000 токенов, AutomationBench-AA — первый результат выше 50 %, first token <0,5 с, около 110 tokens/s.
- Слабые стороны: SWE-Bench Pro отстаёт от Claude Fable 5 примерно на 16 п.п.; галлюцинации AA-Omniscience — 54 %; CursorBench снят из-за загрязнения обучающих данных.
- Подходит для: высокочастотных агентов, terminal-задач, команд на Cursor, бюджетно-чувствительных инженерных организаций.
- Осторожность: точный multi-file рефакторинг, финансовый/критичный по безопасности код, API для ЕС пока недоступен (ожидается середина июля).
SECTION 01 Что такое Grok 4.5? Флагман SpaceXAI и совместное обучение с Cursor
Grok 4.5 — первый флагманский модель SpaceXAI после IPO, оптимизированный для программирования и code-агентов, автономных workflow через инструменты и knowledge-intensive доменов (право, медицина, образование). Ключевое отличие — совместное обучение с Cursor на триллионах токенов реальных взаимодействий разработчиков (code review, отладка, логи agent-codebase). SpaceX приобрела Anysphere (родитель Cursor) в июне 2026 — Grok 4.5 один из первых видимых результатов.
| Параметр | Значение |
|---|---|
| Архитектура | Mixture of Experts (MoE) |
| Контекстное окно | 500 000 токенов |
| Режим рассуждения | Низкий / Средний / Высокий (по умолчанию: Высокий) |
| Скорость инференса | Официально 80 TPS, измерено около 90 TPS |
| Обучающее железо | Десятки тысяч NVIDIA GB300 GPU (дата-центр Memphis) |
| Число параметров | Не раскрыто (MoE) |
SECTION 02 Цены: тарифы API и реальная стоимость задачи
Цена — главный аргумент Grok 4.5. Номинал уже ниже Claude Opus, но решающий разрыв даёт эффективность токенов: на задачах SWE-Bench Pro Grok 4.5 в среднем расходует 15 954 output-токена за прогон, Claude Opus 4.8 — 67 020, коэффициент 4,2.
| Модель | Вход | Выход |
|---|---|---|
| Grok 4.5 | $2,00 | $6,00 |
| Grok 4.5 (cache hit) | $0,50 | — |
| Grok 4.5 Fast | $4,00 | $18,00 |
| Claude Opus 4.7 | $5,00 | $25,00 |
| Claude Fable 5 | Выше | Выше |
| GPT-5.6 Sol (флагман) | $5,00 | $30,00 |
| GPT-5.6 Luna (эконом) | $1,00 | $6,00 |
| Модель / платформа | Средние токены на задачу | Реальная стоимость |
|---|---|---|
| Grok 4.5 / Grok Build | ~1,9M токенов | $2,49 |
| GPT-5.5 / Codex | ~6,2M токенов | $5,07 |
| Claude Fable 5 / Claude Code | ~7,2M токенов | $11,80 |
При 500 agent-задачах в день: Grok 4.5 около $1 245/день, Claude Code около $5 900/день — разрыв эффективности растёт экспоненциально с объёмом.
SECTION 03 Бенчмарки: программирование, агенты и индекс интеллекта
SpaceXAI опубликовала четыре бенчмарка, связанных с программированием. Ниже официальные и независимые данные.
| Бенчмарк | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| DeepSWE 1.0 (официальный harness) | 62,0 % | 66,1 % | 55,75 % | 64,31 % |
| DeepSWE 1.1 (нейтральный harness) | 53 % | 70 % | 59 % | 67 % |
| Terminal Bench 2.1 | 83,3 % | 84,3 % | 78,9 % | 83,4 % |
| SWE-Bench Pro (решение) | 64,7 % | 80,4 % | 69,2 % | 58,6 % |
Интерпретация: под DeepSWE 1.1 (нейтральный harness) Grok 4.5 падает на четвёртое место — Fable 5 впереди на 17 п.п. Terminal Bench 2.1: четыре топ-модели в пределах 5,4 п.п., фактически паритет. SWE-Bench Pro — самый жёсткий тест: Grok 4.5 третий, примерно на 16 п.п. позади Fable 5.
Agent-бенчмарки (сильная сторона Grok 4.5):
| Бенчмарк | Grok 4.5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| AutomationBench-AA (657 enterprise-workflow) | 51,4 % | 48,6 % | 48,5 % |
| Snorkel GDPVal+ (профессиональные сценарии) | 29 % | — | 21 % |
AutomationBench-AA симулирует 40 корпоративных приложений (Gmail, Slack, Salesforce, HubSpot и др.). Grok 4.5 — первая модель, преодолевшая половину целей workflow без нарушения бизнес-ограничений. Тесты Snorkel: Grok 4.5 лидирует в праве (40 % vs 27–28 %), образовании (58 % vs 35–42 %) и медицине (35 % vs 23–25 %).
Общий интеллект: индекс Artificial Analysis — 54 балла (четвёртое место), позади Fable 5 (60), Opus 4.8 (56), GPT-5.5 (55), но +16 баллов к предыдущему Grok.
Снятие CursorBench: при запуске CursorBench (собственный бенчмарк Cursor) убрали — снимки codebase Cursor случайно попали в обучающие данные Grok 4.5 (data contamination). Заметный дефект релиза.
SECTION 04 Практический тест и платформы: TryAI, Grok Build, Cursor, API
TryAI заставил Grok 4.5, GPT-5.5, Claude Opus 4.8 и Claude Fable 5 с одинаковыми промптами собрать одно интерактивное приложение с нуля:
- 3D-рендер куба (самый сложный тест): Opus 4.8 и Fable 5 с первой попытки; Grok 4.5 в первом прогоне только заголовок и кнопка без куба, со второй — успех; GPT-5.5 провалился.
- Скорость: first token Grok 4.5 <0,5 с, пропускная способность около 110 tokens/s (примерно вдвое быстрее конкурентов).
- Стоимость: наименьшая цена одного тестового прогона у Grok 4.5.
Вывод: для высокочастотных повторяющихся coding-задач доминируют скорость и цена Grok 4.5; для сложного state management с первого раза Claude надёжнее.
Доступные платформы (регион ЕС ожидается в середине июля):
- Grok Build: платформа coding-агента SpaceXAI, Grok 4.5 — модель по умолчанию
- Cursor: все тарифы (desktop, web, iOS, CLI, SDK), удвоенный лимит в первую неделю
- SpaceXAI Console API: Chat Completions и Responses API, регионы us-east-1 / us-west-2, лимит 150 req/s, 50M tokens/min
- Office-плагины: Word, PowerPoint, Excel — модель по умолчанию
- Сторонние шлюзы: OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "Найди баг в этом коде и исправь: function median(a){a.sort();return a[a.length/2]}"
}'
SECTION 05 Интеграция: шесть шагов для Cursor и API
- Выбрать модель в Cursor: открыть Cursor → выбор модели → Grok 4.5 (все тарифы, удвоенный лимит в первую неделю).
- Получить API Key SpaceXAI: SpaceXAI Console → API Keys → создать ключ, подтвердить доступ к us-east-1 или us-west-2.
- Настроить переменную окружения: локально или в CI
export XAI_API_KEY="your-key"— не коммитить ключ в репозиторий. - Включить prompt cache: Responses API с
prompt_cache_keyили Chat Completions с заголовкомx-grok-conv-id— снизить цену входа с $2,00/M до $0,50/M. - Context Compaction для длинных agent-циклов: уменьшить накопление токенов за несколько раундов, снизить общую стоимость пайплайна.
- Построить гибридный роутинг: рутинные подзадачи — Grok 4.5, сложные архитектурные решения — Claude Fable 5; автоматическая валидация вывода, особенно при чувствительности к галлюцинациям.
SECTION 06 Стоит ли переходить? Сценарии, риски и твёрдые цифры
Grok 4.5 подходит, если:
- команда выполняет сотни–тысячи programming-задач в день — экономия сразу измерима
- в фокусе terminal-задачи и tool calls (Terminal Bench 2.1, AutomationBench на вершине)
- Cursor уже глубоко интегрирован — переключение без трения
- стартапы и бюджетные команды хотят сопоставимый интеллект за четверть стоимости задачи
- гибридная стратегия: Grok 4.5 для рутины, Claude Fable 5 для архитектуры
Осторожность, если:
- нужна точность уровня SWE-Bench Pro (Fable 5 +16 п.п.)
- критичен уровень галлюцинаций: индекс AA-Omniscience 54 % — валидация вывода в продакшене обязательна
- пользователи ЕС: API только us-east-1 и us-west-2
- данные CursorBench недействительны из-за contamination — ждать независимых ретестов
Цифры для цитирования:
- Контекстное окно: 500 000 токенов
- Эффективность выхода SWE-Bench Pro: 15 954 (Grok 4.5) vs 67 020 (Opus 4.8), коэффициент 4,2×
- Стоимость одной agent-задачи: $2,49 (Grok 4.5) vs $11,80 (Claude Code)
- AutomationBench-AA: 51,4 %, первая модель выше 50 % enterprise-workflow
- Индекс Artificial Analysis: 54 балла, +16 к предыдущей версии
Высокочастотные agent-пайплайны на локальном Mac страдают от сна, сетевых колебаний и конкуренции за ресурсы — автоматизация 7×24 прерывается. Чистые VM-решения добавляют потери гипервизора и риски EULA macOS. Для нативной мощности без потерь, стабильной iOS/macOS CI/CD и постоянно онлайн агентов физические облачные узлы MACNOX часто оптимальнее: 100 % оригинальный Mac Mini M4, полный Root, гибкая аренда день/неделя/месяц, нулевые потери гипервизора. См. аренда vs покупка Mac Mini M4 и риски безопасности Claude Code, а также страницу тарифов.
Grok 4.5 — не «самая сильная programming-модель», но самый экономичный coding-агент уровня Opus: когда эффективность токенов и тариф API переводятся в реальную стоимость задачи, в типичных agent-workflow он даёт качество близкое к Opus 4.8 за долю цены. Где точность критична (финансовый код, security-critical системы), Claude Fable 5 остаётся более безопасным выбором.
Официальные и независимые источники (перепроверьте ссылки после публикации):
Cursor — совместный анонс Grok 4.5
Документация API SpaceXAI — Grok 4.5
TechCrunch — SpaceXAI releases Grok 4.5
Awesome Agents — независимый тест Grok 4.5
Snorkel AI — профессиональные сценарии
SECTION 07 Часто задаваемые вопросы
Grok 4.5 лучше Claude Opus 4.8?
Зависит от определения «лучше». Opus 4.8 точнее на SWE-Bench Pro (69,2 % vs 64,7 %). Grok 4.5 лидирует по скорости, эффективности токенов и стоимости задачи; чуть впереди на agent-workflow. Высокочастотные агенты — Grok. Точный одноразовый кодинг — Claude.
Grok 4.5 бесплатный?
SpaceXAI даёт ограниченные бесплатные квоты в Grok Build и Cursor. Далее API: $2/M вход, $6/M выход. Тарифы Cursor включают модель в пул.
Как использовать Grok 4.5 в Cursor?
Доступен автоматически на всех планах Cursor. Открыть Cursor → выбор модели → Grok 4.5. Первая неделя после релиза — удвоенный лимит.
Какой размер контекстного окна?
500 000 токенов — достаточно для большинства задач на крупных codebase.
Почему сняли CursorBench?
Снимки codebase Cursor случайно попали в обучающие данные Grok 4.5 и исказили бенчмарк. SpaceXAI отозвала данные; независимый ретест ожидается.
Grok 4.5 доступен через OpenRouter?
Да. Доступен через OpenRouter, Vercel AI Gateway, Cloudflare, Snowflake, Databricks Mosaic и другие шлюзы.