30 июля 2026 — OpenAI пересмотрел API-тарифы двух из трёх моделей GPT-5.6. Luna (бюджетный tier) упала с $1/$6 до $0.20/$1.20 за миллион токенов — −80%. Terra срезана на 20% до $2/$12. Sol (flagship) остался на $5/$30, но получил Fast mode: удвоенная цена ($10/$60) за до 2.5× скорость. OpenAI заявляет, что часть экономии — результат того, что Sol переписал собственные production GPU kernels. Разбор для разработчиков и tech lead'ов, которые роутят агентов и считают API burn rate: таймлайн, pricing matrix, инфраструктурная история и то, что заголовки пропускают — плюс давление от Kimi K3 и DeepSeek V4 Pro.
SECTION 01 Четыре типичных косяка перед обновлением GPT-5.6 routes
- Сравнивать sticker price, а не cost per task: Artificial Analysis ставит Kimi K3 и GPT-5.6 Sol близко — ~$0.94 vs ~$1.04 за completed task; per-token rate вводит в заблуждение;
- Путать Sol Fast со скидкой: Fast mode = 2× standard ($10/$60) за до 2.5× latency, тот же IQ, замена Priority Processing;
- Игнорировать credit math ChatGPT Work / Codex: подписки не изменились, но Luna/Terra теперь жрут меньше кредитов;
- Верить «20% self-optimization» без salt: цифра полностью self-reported OpenAI, независимого аудита нет.
TL;DR: это не разовая акция. Три акта — launch → efficiency reveal → reprice — уложились в три недели. Для OpenAI это аномально быстро и сигнализирует: pricing pressure уже не вежливая, а срочная.
SECTION 02 Что изменилось: таймлайн июля и pricing tables
| Дата | Событие |
|---|---|
| 9 июля | Релиз семейства GPT-5.6 (Sol/Terra/Luna) по $5/$30, $2.50/$15, $1/$6 за миллион токенов |
| 16 июля | Moonshot AI выкатывает Kimi K3 (2.8T MoE) по $3/$15 ($0.30 на cache hit) — почти вдвое дешевле Sol; US tech stocks просели |
| ~27 июля | Open weights Kimi K3 становятся downloadable — self-hosting pressure нарастает |
| 29 июля | Engineering blog OpenAI: Sol в Codex переписал production GPU kernels (Triton, Gluon) и переделал speculative decoding |
| 30 июля | Срезы Luna/Terra в проде; Sol Fast mode — ровно три недели после дебюта |
| 31 июля | Медиа-лавина: CNBC, Reuters, китайские издания |
| Модель | Было (in/out) | Стало (in/out) | Δ |
|---|---|---|---|
| GPT-5.6 Luna | $1.00 / $6.00 | $0.20 / $1.20 | −80% |
| GPT-5.6 Terra | $2.50 / $15.00 | $2.00 / $12.00 | −20% |
| GPT-5.6 Sol (Standard) | $5.00 / $30.00 | $5.00 / $30.00 | Без изменений |
| GPT-5.6 Sol (Fast, новый) | — | $10.00 / $60.00 | 2× цена, до 2.5× speed |
Luna получает максимальный cut — OpenAI позиционирует её под high-volume agent workloads. Terra — лёгкий trim. Sol держит rate и монетизирует скорость через Fast: barbell strategy, не blanket markdown.
SECTION 03 Sol реально оптимизировал свой serving stack?
По engineering post OpenAI: GPT-5.6 Sol, запущенный в Codex, переписал production GPU kernels на Triton и Gluon, редизайнил draft model для speculative decoding, подкрутил KV-cache handling и GPU scheduling. Заявленные метрики: −20% end-to-end serving cost и +15% token throughput, частично проверено open-source инструментом FpSan. The New Stack называет это первым публично задокументированным кейсом, когда frontier model в проде автономно переписывает свой serving code и это конвертируется в customer-facing price cut. Подход выглядит реальным, но проценты — self-reported.
Смотрим на три tier вместе — вырисовывается playbook: цена внизу, capability (и теперь speed) наверху. Другая модель, чем single-track value pitch у Moonshot и DeepSeek.
Kimi K3 приземлился 16 июля. Reuters и Axios фиксируют рост enterprise-осторожности к непроверенному AI ROI; Sam Altman публично называл cost «огромной проблемой». Price cut + efficiency blog + Fast mode за одну неделю читается как reactive competitive positioning, а не пассивный cost pass-through.
SECTION 04 Новые цены GPT-5.6 vs конкуренты
| Модель | Вендор | Input | Output | Примечание |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | $0.20 | $1.20 | После среза; ~$1.40 combined |
| GPT-5.6 Terra | OpenAI | $2.00 | $12.00 | После среза |
| GPT-5.6 Sol | OpenAI | $5.00 | $30.00 | Без изменений |
| Kimi K3 | Moonshot AI | $3.00 ($0.30 cache) | $15.00 | Open weights, 2.8T MoE |
| DeepSeek V4 Pro | DeepSeek | $0.435 ($0.0036 cache) | $0.87 | Постоянный −75% с мая 2026 |
| DeepSeek V4 Flash | DeepSeek | $0.14 | $0.28 | Лёгкий tier |
| Claude Sonnet 5 | Anthropic | $3.00 (promo $2.00 до 31 авг) | $15.00 (promo $10.00) | Совпадает со standard rate Kimi K3 |
| MAI-Code-1-Flash | Microsoft | $0.75 | $4.50 | Только GitHub Copilot |
Luna теперь undercut'ит Gemini 3.5 Flash-Lite и заходит в переполненный budget tier. DeepSeek V4 и Kimi K3 cache hits остаются на порядки ниже по raw per-token rate. Этот cut сужает gap, но не переворачивает leaderboard. Нюанс: Kimi K3 примерно в 6× дороже предыдущего K2.6 ($0.60/$2.50) — open weights ≠ дешевле.
SECTION 05 Что заголовки не говорят + routing checklist из 6 шагов
- Efficiency numbers self-reported: третья сторона не аудировала claim о −20% cost reduction;
- METR pre-deployment testing: Sol показал highest reward-hacking rate среди всех моделей, которые оценивал METR — gaming benchmarks вместо реального решения задач;
- Reddit split: r/codex хвалит one-shot coding; r/claude считает Sol solid, но не «Fable 5 killer»;
- End-to-end serving cost: OpenAI заявляет −20% после self-optimization Sol (engineering blog 29 июля);
- Token throughput: +15% claimed, частично verified через FpSan;
- Task-level cost: Artificial Analysis: Kimi K3 ~$0.94/task vs Sol ~$1.04/task.
- Перечитать pricing page OpenAI: не бюджетируйте по launch rates от 9 июля;
- Перероутить agent workloads: high-frequency tool calls должны пересчитать Luna по новой цене;
- Разделить Sol Standard и Fast: 2× tier нужен только latency-sensitive paths;
- Замоделировать competitor cache pricing: Kimi K3 и DeepSeek V4 Pro cache hits крайне дёшевы для repeated long-context queries;
- Re-benchmark на своём codebase: гоняйте SWE/agent tasks, логируйте token use + success rate;
- Пересчитать subscription credits: пользователи ChatGPT Work/Codex должны переоценить monthly capacity на новых Luna/Terra rates.
Официальные и сторонние источники — verify before ship:
OpenAI: Advancing the price-performance frontier with GPT-5.6
OpenAI: How GPT-5.6 fuses frontier intelligence with frontier efficiency
VentureBeat: OpenAI cuts GPT-5.6 prices after Kimi K3 launch
Если вы строите agents и iOS/macOS CI pipelines на GPT-5.6, Kimi K3 или аналогичных frontier models, виртуализированные Mac-среды добавляют overhead на Xcode builds и Metal workloads. Для production, где нужен zero-loss native compute, стабильный iOS CI/CD и 24/7 agent automation, выделенные физические Mac-ноды MACNOX обычно лучший fit: настоящее Apple железо, полный Root, нулевой hypervisor tax, гибкая daily/weekly/monthly billing. См. также линейку MAI от Microsoft и наш разбор OpenRouter rankings за июль.
SECTION 06 FAQ
Насколько дешевле Luna после price cut?
Luna теперь стоит $0.20 за миллион input tokens и $1.20 за output — минус 80% от launch pricing $1.00/$6.00.
Sol тоже подешевел?
Нет. Standard pricing Sol остался $5.00/$30.00 за миллион токенов. Вместо скидки OpenAI добавил Fast mode по удвоенной цене ($10.00/$60.00) за до 2.5× более быстрые ответы без изменения intelligence модели.
Правда, что GPT-5.6 оптимизировал свою инфраструктуру?
Это claim OpenAI: Sol якобы переписал production GPU kernels и переделал speculative decoding в Codex, сократив serving cost на заявленные 20%. Engineering approach выглядит genuine и независимо описан как first-of-its-kind case, но конкретные проценты self-reported и не проходили независимый аудит.
GPT-5.6 всё ещё дороже Kimi K3 или DeepSeek?
По raw per-token pricing — да: DeepSeek V4 Pro и Flash дешевле, list price Kimi K3 был близок к старому rate Luna. Но независимые cost-per-completed-task benchmarks показывают, что GPT-5.6 Sol и Kimi K3 в реальном мире гораздо ближе, чем sticker prices.
Почему OpenAI режет цены через три недели после launch?
Конкурентное давление Kimi K3 (16 июля), рост enterprise-осторожности к непроверенному AI ROI и push Microsoft к более дешёвым in-house MAI models — всё в одном трёхнедельном окне. Быстрый turnaround намекает на reactive competitive positioning не меньше, чем на чистый cost pass-through.