За пять дней команды, которые покупают китайские frontier API или качают веса, получили три хода, которые на поверхности противоречат друг другу. DeepSeek поднял API-тарифы до 1 100 % на отдельных строках. В ту же неделю Alibaba выложила веса 2,4-триллионного флагмана, которого раньше не отдавала. Zhipu AI выпустила GLM-5.3: на том же базовом чекпоинте coding-бенчмарки выросли примерно в 6 раз — без retraining. Текст для инженеров, которым нужно пересчитать счёт, прочитать лицензию и выбрать стек. Общий сигнал: лаборатории Китая уходят от конкуренции только ценой к конкуренции pricing power.
SECTION 01 Пять ошибок при чтении подорожания DeepSeek
Проблема не в дефиците заголовков. Проблема в том, что биллинг режут по неправильным осям.
- Цифра 1 100 % принимается за весь счёт: это peak-hour cache-hit input на V4-Pro. Output вырос на 350 %. Cache-miss input — на 200 %.
- Официальный API считается всегда самым дешёвым: в пиковые часы list price DeepSeek уже выше ряда реселлеров (GMI Cloud, Novita и другие по-прежнему котируют V4 Pro ниже нового официального peak).
- Релиз Alibaba читается как благотворительность Apache 2.0: веса скачиваются, но бизнес Model-as-a-Service или AI Work Assistant с выручкой свыше $50 million за любые 12 месяцев обязан отдельно согласовать коммерческую лицензию.
- Повторяется слух про geo-ban: утверждения, что США, ЕС, Великобритания и Южная Корея не могут скачать чекпоинт, ложны. В опубликованной лицензии нет территориальной оговорки.
- GLM-5.3 называют новой foundation-моделью: это тот же 743B base, что у GLM-5.2. Прирост даёт масштабированный post-training RL. Скоры — vendor-reported; независимого перепрогона в открытом доступе нет.
Три лаборатории, три хода, один сигнал: китайские AI-лаборатории конкурируют pricing power, а не только прайсом.
SECTION 02 Таймлайн: что вышло и когда US-лаборатории резали цены
Шире кадр. 30 июля OpenAI срезала самый дешёвый tier, GPT-5.6 Luna, на 80 %. 6–7 августа Luna стала бесплатным дефолтом с unlimited text chats. Пока китайские лаборатории поднимали цены и открывали веса флагманов, американские резали прайс и уходили в free на consumer-слое. Это две стороны одной борьбы. Предыдущие продуктовые заметки: релиз Qwen3.8-Max и цены DeepSeek V4 GA.
| Дата | Событие |
|---|---|
| 16 июля 2026 | Moonshot AI выкладывает веса Kimi K3 (2,8T параметров); модель попадает под US security scrutiny |
| 2–3 августа 2026 | Alibaba показывает preview, затем запускает Qwen3.8-Max как hosted API |
| 10 августа 2026 | Meta выпускает Muse Glimmer (30B, Apache 2.0) и анонсирует open weights для флагмана Muse Spark 1.2 |
| 12 августа 2026 | Alibaba публикует Qwen3.8-2.4T-A95B на Hugging Face / ModelScope; xAI выпускает Grok 4.6 |
| 13 августа 2026 | DeepSeek-V4-Pro выходит в GA и объявляет повышение цен с 17 августа; Google выпускает discounted Gemini 3.7 Flash |
| 14 августа 2026 | Zhipu выпускает GLM-5.3 на том же 743B base, что GLM-5.2 |
| 17 августа 2026, 00:00 по Пекину | Вступают в силу новые тарифы DeepSeek |
SECTION 03 Цифры: тарифы DeepSeek, спецификации Qwen, бенчмарки GLM-5.3
Новые тарифы DeepSeek действуют с 17 августа, 00:00 по пекинскому времени. Пиковые часы — 9:00–12:00 и 14:00–18:00 по Пекину. Заголовок про 1 100 % относится к peak cache-hit input — строке, которая раньше была ближе всего к нулю. Output, который доминирует в большинстве реальных счетов, вырос на 350 %. Независимое моделирование стоимости для тяжёлой нагрузки (примерно 84M токенов/месяц, в основном off-peak, половина cache hits) даёт рост счёта ближе к 1,8×.
| Статья биллинга | Было | Новый off-peak | Новый peak | Рост в peak |
|---|---|---|---|---|
| V4-Flash cache hit (input) | ¥0.02 | ¥0.05 | ¥0.10 | ~400% |
| V4-Flash cache miss (input) | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash output | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro cache hit (input) | ¥0.025 | ¥0.15 | ¥0.30 | ~1,100% |
| V4-Pro cache miss (input) | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro output | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
| Параметр | Значение |
|---|---|
| Параметры | 2,4T всего, 95B active на токен (MoE, 512 experts, 10 routed + 1 shared) |
| Контекст | 262 144 токена native (open checkpoint), расширяется до ~1,01M; hosted Max по умолчанию 1M |
| Каденция релиза | Preview 2 августа → API 3 августа → open weights 12 августа |
| API (international) | $2/M input, $6/M output |
| Лицензия | Не Apache 2.0 — отдельная Qwen3.8-Max License |
| Почему это важно | Первый раз Alibaba выложила веса Max-tier флагмана; Qwen3.5/3.6/3.7 Max оставались только API |
| Бенчмарк | GLM-5.2 | GLM-5.3 | Изменение |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 pts |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 pts |
| Agents' Last Exam (CLI) | 23.8% | 28.5% | +4.7 pts |
| CyberGym | 77.2% | 84.5% | +7.3 pts |
| AutomationBench | 26.2% | 48.2% | +22.0 pts |
Это собственные цифры Zhipu. На Terminal-Bench 3.0 GLM-5.3 всё ещё отстаёт от GPT-5.6 Sol (34.6%) и Claude Fable 5 (33.7%). Это сильный open-weight результат, не абсолютная победа на frontier.
SECTION 04 Три стратегии: time-of-day тариф, лицензия на веса, post-training
DeepSeek: с плоского дешёвого тарифа на time-of-day — это дефицит compute, не смена бренда. Лёгкое чтение: «самая дешёвая китайская модель наконец сдалась». Структура ближе к явному дефициту мощности. Плоский always-cheap прайс работал как acquisition, пока GPU-supply успевал. Когда usage рос экспоненциально, а ёмкость — нет, какую-то ось пришлось сделать явной. «Более гибкое планирование нагрузки» в корпоративном языке означает scarce peak-hour compute. В пике официальный API больше не самый дешёвый способ гонять DeepSeek. Это допущение сломалось.
Alibaba: веса покупают mindshare; кастомная лицензия держит потолок выручки. Публикация 2,4T-чекпоинта и кастомная лицензия — один ход. Любой бизнес Model-as-a-Service или AI Work Assistant с выручкой свыше $50 million за любые 12 месяцев обязан отдельно согласовать коммерческую лицензию. Продукты с 100M+ monthly active users или $20M+ месячной выручки должны показывать имя модели. Ставка: забрать международных разработчиков и сохранить рычаг над теми, кто продаёт inference сверху. Это другая ставка, чем Muse Glimmer у Meta под unrestricted Apache 2.0. Слух про geo-ban ложен — смотрите файл LICENSE, не тред анонса. Репозиторий чекпоинта лежит на Hugging Face и ModelScope.
GLM-5.3: новый base не нужен, ставка на post-training больше. Тот же 743B, что у GLM-5.2, без retraining, и примерно 6× на Terminal-Bench 3.0 (4.6% → 28.3%) за счёт масштабирования RL-окружений. Когда законы масштабирования pretraining выполаживаются, post-training RL становится отдельным рычагом с более низким cost floor, чем новая foundation-модель. Mid-tier лаборатории всё ещё могут закрывать разрыв на agentic и coding benches без pretrain-бюджета масштаба OpenAI.
SECTION 05 Остаётся ли DeepSeek самым дешёвым frontier: аудит из 6 шагов
Курс RMB/USD около ¥7.15/$1, оценка. Off-peak V4-Pro всё ещё заметно ниже Claude Opus 5, но это уже не безусловный минимум. International pricing Qwen3.8-Max и Luna у OpenAI оба подрезают off-peak DeepSeek. Формула «китайская модель = самая дешёвая» держалась большую часть 2025 и начала 2026. Сейчас это небезопасное допущение. Контекст американского среза: GPT-5.6 Luna минус 80 %.
| Модель | Input | Output | Open weights? |
|---|---|---|---|
| DeepSeek V4-Pro (peak) | ¥9.0 (~$1.26) | ¥27.0 (~$3.78) | Нет |
| DeepSeek V4-Pro (off-peak) | ¥4.5 (~$0.63) | ¥13.5 (~$1.89) | Нет |
| Qwen3.8-Max (international API) | $2.00 | $6.00 | Да (кастомная лицензия) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | Нет |
| Claude Opus 5 (implied, по сравнению Alibaba) | ~$5.00 | ~$25.00 | Нет |
Если стек нужно вывести на этой неделе, аудит идёт в шесть шагов, а не умножением заголовка:
- Разделение счёта по строкам биллинга: последние 30 дней делятся на cache-hit input, cache-miss input и output. Новая карточка применяется к каждой строке. Весь счёт на 1 100 % не умножается.
- Разметка пиковых часов Пекина: 9:00–12:00 и 14:00–18:00 по пекинскому времени. В анонсе просили более гибкий scheduling не случайно.
- Сравнение официального API и реселлеров: в пике проверяется, держат ли GMI Cloud, Novita или другой реселлер котировку ниже официального peak DeepSeek.
- Проверка файла LICENSE: до скачивания Qwen3.8-2.4T-A95B подтверждаются пороги $50M / 100M MAU / $20M месячной выручки. Треды про geo-ban игнорируются.
- Оценка GLM-5.3 как post-training дельты: тот же base, что у 5.2, только vendor benches. Свои terminal- и SWE-задачи прогоняются до замены.
- Маршрутизация запросов по слоям стека: дешёвый consumer text — на Luna; веса и экосистема — на Qwen; сдвигаемый по времени frontier inference — на DeepSeek off-peak; long-horizon агенты и iOS CI — на физический Mac, не на гипервизор.
peak = {"in_miss": 9.0, "in_hit": 0.30, "out": 27.0}
off = {"in_miss": 4.5, "in_hit": 0.15, "out": 13.5}
tokens_m = {"in_miss": 40, "in_hit": 40, "out": 4}
def bill(rate, t):
return t["in_miss"]*rate["in_miss"] + t["in_hit"]*rate["in_hit"] + t["out"]*rate["out"]
print("off-peak CNY", round(bill(off, tokens_m), 2))
print("peak CNY", round(bill(peak, tokens_m), 2))
SECTION 06 Что не верифицировано и какие источники открыть заново
- Заголовок 1 100 % точен и неполон: это только peak cache-hit input. Output — строка, которая доминирует в большинстве счетов — вырос на 350 %.
- Утверждения про Zhenwu M890 / Pangu AL128: ряд китайских финансовых изданий пишет, что часть inference Qwen3.8-Max идёт на собственных чипах Alibaba. Alibaba не публиковала независимую техническую документацию и сторонние бенчмарки. Статус: не верифицировано.
- GLM-5.3 и «серьёзная уязвимость Cursor»: VentureBeat плюс собственный disclosure Zhipu. Технических деталей в открытом доступе нет. Читать как vendor-sourced, без независимого аудита.
- Ответные export controls: сообщения, что Министерство коммерции КНР может готовить контрмеры по AI/полупроводникам, — спекулятивные медиа, не официальный анонс.
За последний месяц топ-лаборатории Китая выкладывали релизы в темпе, который местная финансовая пресса называет «три обновления модели в неделю» (一周三更) — DeepSeek, Alibaba, Zhipu, плюс Kimi K3 от Moonshot (веса 16 июля, 2,8T) и MiniMax H3. Китайское покрытие формулирует это как open-weight релизы, которые принуждают к глобальному пересчёту цен. US-лаборатории на consumer-слое сыграли наоборот: срез Luna на 80 %, затем free unlimited text; Gemini 3.7 Flash за полцены 13 августа. Флагманские веса плюс ступенчатый, более высокий прайс на compute-constrained вершине; free и cheap на consumer-конце. Оба хода реальны. Они оптимизируют разные части воронки.
Есть и геополитический слой. Kimi K3 уже попал под US security scrutiny. Часть аналитиков читает 2,4T-релиз Alibaba в этом окне как фиксацию международного mindshare и нарратива «технологического паритета» до любого ужесточения регуляторики. Это обоснованная интерпретация, не подтверждённый факт — и её легко пропустить, если читать только английские product-посты.
Официальные и перекрёстно проверенные источники. Эти страницы стоит открыть заново до того, как перепубликовать цены или условия лицензии:
Официальные тарифы DeepSeek API (карточка peak / off-peak)
Alibaba Cloud Community: заметка о запуске Qwen3.8-Max
Hugging Face: репозиторий чекпоинта Qwen3.8-2.4T-A95B
Reuters / MarketScreener: DeepSeek поднимает цены V4 API
MarkTechPost: GLM-5.3, тот же base, только post-training
Самостоятельный хостинг MoE на 2,4 трлн параметров или подключение агента к Xcode и iOS CI накладывает потери гипервизора поверх только что выросшего счёта за токены. Для нативной мощности без потерь, стабильного iOS CI/CD и круглосуточной автоматизации агентов облачный физический узел MACNOX обычно надёжнее в production: оригинальное железо Apple, полный Root, без гипервизора, оплата за день / неделю / месяц. Контекст по трафику: рейтинги OpenRouter за июль.
SECTION 07 Часто задаваемые вопросы
DeepSeek после повышения всё ещё дешевле GPT-5.6 и Claude?
Off-peak по-прежнему дешевле Claude Opus 5, но это уже не единственный минимум по рынку. GPT-5.6 Luna у OpenAI ($0.20/$1.20 за миллион токенов) и international pricing Qwen3.8-Max у Alibaba ($2/$6) подрезают новый off-peak DeepSeek хотя бы по одной оси. Для frontier-класса DeepSeek всё ещё относительно дешёв, просто больше не безусловный минимум.
Можно ли бесплатно ставить open weights Qwen3.8-Max в коммерческий продукт?
Да, для большинства сценариев — личные проекты и внутреннее корпоративное использование не затрагиваются. Ограничение срабатывает только если вы ведёте бизнес Model-as-a-Service или AI Work Assistant с выручкой свыше $50 million за любые последовательные 12 месяцев; этому tier нужна отдельная коммерческая лицензия Alibaba. Продукты с 100M+ MAU или $20M+ месячной выручки должны показывать имя модели.
Qwen3.8-Max запрещён или ограничен для пользователей США, ЕС или Великобритании?
Нет. Утверждение ходило в сети, но оно ложно: в опубликованной лицензии нет географического ограничения любого вида. Ограничения завязаны на выручку, не на то, где находитесь вы или ваши пользователи.
Чем GLM-5.3 фактически отличается от GLM-5.2?
На уровне base-модели — ничем: оба используют один и тот же foundation на 743 миллиарда параметров. Прирост (примерно 6× на Terminal-Bench 3.0) целиком из масштабирования reinforcement learning на этапе post-training, без retraining базовой модели.
Meta действительно откроет веса флагмана, а не только Muse Glimmer?
Пока нет. Muse Glimmer — distilled-модель на 30B, не настоящий флагман Meta. Марк Цукерберг говорил, что open weights для более крупной закрытой Muse Spark 1.2 появятся «скоро». Если это случится, это будет первый US flagship-tier релиз в открытую. На момент публикации это заявленное намерение, не подтверждённый факт.