Главная / Блог / Цены API
ENGINEERING_BLOG · 2026.08.17

Почему DeepSeek поднял API до 1 100 %
сразу после open-weight блица Qwen и GLM-5.3

За пять дней команды, которые покупают китайские frontier API или качают веса, получили три хода, которые на поверхности противоречат друг другу. DeepSeek поднял API-тарифы до 1 100 % на отдельных строках. В ту же неделю Alibaba выложила веса 2,4-триллионного флагмана, которого раньше не отдавала. Zhipu AI выпустила GLM-5.3: на том же базовом чекпоинте coding-бенчмарки выросли примерно в 6 раз — без retraining. Текст для инженеров, которым нужно пересчитать счёт, прочитать лицензию и выбрать стек. Общий сигнал: лаборатории Китая уходят от конкуренции только ценой к конкуренции pricing power.

SECTION 01 Пять ошибок при чтении подорожания DeepSeek

Проблема не в дефиците заголовков. Проблема в том, что биллинг режут по неправильным осям.

  • Цифра 1 100 % принимается за весь счёт: это peak-hour cache-hit input на V4-Pro. Output вырос на 350 %. Cache-miss input — на 200 %.
  • Официальный API считается всегда самым дешёвым: в пиковые часы list price DeepSeek уже выше ряда реселлеров (GMI Cloud, Novita и другие по-прежнему котируют V4 Pro ниже нового официального peak).
  • Релиз Alibaba читается как благотворительность Apache 2.0: веса скачиваются, но бизнес Model-as-a-Service или AI Work Assistant с выручкой свыше $50 million за любые 12 месяцев обязан отдельно согласовать коммерческую лицензию.
  • Повторяется слух про geo-ban: утверждения, что США, ЕС, Великобритания и Южная Корея не могут скачать чекпоинт, ложны. В опубликованной лицензии нет территориальной оговорки.
  • GLM-5.3 называют новой foundation-моделью: это тот же 743B base, что у GLM-5.2. Прирост даёт масштабированный post-training RL. Скоры — vendor-reported; независимого перепрогона в открытом доступе нет.

Три лаборатории, три хода, один сигнал: китайские AI-лаборатории конкурируют pricing power, а не только прайсом.

SECTION 02 Таймлайн: что вышло и когда US-лаборатории резали цены

Шире кадр. 30 июля OpenAI срезала самый дешёвый tier, GPT-5.6 Luna, на 80 %. 6–7 августа Luna стала бесплатным дефолтом с unlimited text chats. Пока китайские лаборатории поднимали цены и открывали веса флагманов, американские резали прайс и уходили в free на consumer-слое. Это две стороны одной борьбы. Предыдущие продуктовые заметки: релиз Qwen3.8-Max и цены DeepSeek V4 GA.

Ключевые даты, июль–август 2026
Дата Событие
16 июля 2026 Moonshot AI выкладывает веса Kimi K3 (2,8T параметров); модель попадает под US security scrutiny
2–3 августа 2026 Alibaba показывает preview, затем запускает Qwen3.8-Max как hosted API
10 августа 2026 Meta выпускает Muse Glimmer (30B, Apache 2.0) и анонсирует open weights для флагмана Muse Spark 1.2
12 августа 2026 Alibaba публикует Qwen3.8-2.4T-A95B на Hugging Face / ModelScope; xAI выпускает Grok 4.6
13 августа 2026 DeepSeek-V4-Pro выходит в GA и объявляет повышение цен с 17 августа; Google выпускает discounted Gemini 3.7 Flash
14 августа 2026 Zhipu выпускает GLM-5.3 на том же 743B base, что GLM-5.2
17 августа 2026, 00:00 по Пекину Вступают в силу новые тарифы DeepSeek

SECTION 03 Цифры: тарифы DeepSeek, спецификации Qwen, бенчмарки GLM-5.3

Новые тарифы DeepSeek действуют с 17 августа, 00:00 по пекинскому времени. Пиковые часы — 9:00–12:00 и 14:00–18:00 по Пекину. Заголовок про 1 100 % относится к peak cache-hit input — строке, которая раньше была ближе всего к нулю. Output, который доминирует в большинстве реальных счетов, вырос на 350 %. Независимое моделирование стоимости для тяжёлой нагрузки (примерно 84M токенов/месяц, в основном off-peak, половина cache hits) даёт рост счёта ближе к 1,8×.

Подорожание DeepSeek, за 1M токенов (CNY)
Статья биллинга Было Новый off-peak Новый peak Рост в peak
V4-Flash cache hit (input) ¥0.02 ¥0.05 ¥0.10 ~400%
V4-Flash cache miss (input) ¥1.0 ¥1.5 ¥3.0 200%
V4-Flash output ¥2.0 ¥4.5 ¥9.0 350%
V4-Pro cache hit (input) ¥0.025 ¥0.15 ¥0.30 ~1,100%
V4-Pro cache miss (input) ¥3.0 ¥4.5 ¥9.0 200%
V4-Pro output ¥6.0 ¥13.5 ¥27.0 350%
Qwen3.8-2.4T-A95B (open weights Qwen3.8-Max)
Параметр Значение
Параметры 2,4T всего, 95B active на токен (MoE, 512 experts, 10 routed + 1 shared)
Контекст 262 144 токена native (open checkpoint), расширяется до ~1,01M; hosted Max по умолчанию 1M
Каденция релиза Preview 2 августа → API 3 августа → open weights 12 августа
API (international) $2/M input, $6/M output
Лицензия Не Apache 2.0 — отдельная Qwen3.8-Max License
Почему это важно Первый раз Alibaba выложила веса Max-tier флагмана; Qwen3.5/3.6/3.7 Max оставались только API
GLM-5.3 vs GLM-5.2: тот же base, только post-training (цифры Zhipu)
Бенчмарк GLM-5.2 GLM-5.3 Изменение
Terminal-Bench 3.0 4.6% 28.3% +23.7 pts
DeepSWE v1.1 46.2% 66.9% +20.7 pts
Agents' Last Exam (CLI) 23.8% 28.5% +4.7 pts
CyberGym 77.2% 84.5% +7.3 pts
AutomationBench 26.2% 48.2% +22.0 pts

Это собственные цифры Zhipu. На Terminal-Bench 3.0 GLM-5.3 всё ещё отстаёт от GPT-5.6 Sol (34.6%) и Claude Fable 5 (33.7%). Это сильный open-weight результат, не абсолютная победа на frontier.

SECTION 04 Три стратегии: time-of-day тариф, лицензия на веса, post-training

DeepSeek: с плоского дешёвого тарифа на time-of-day — это дефицит compute, не смена бренда. Лёгкое чтение: «самая дешёвая китайская модель наконец сдалась». Структура ближе к явному дефициту мощности. Плоский always-cheap прайс работал как acquisition, пока GPU-supply успевал. Когда usage рос экспоненциально, а ёмкость — нет, какую-то ось пришлось сделать явной. «Более гибкое планирование нагрузки» в корпоративном языке означает scarce peak-hour compute. В пике официальный API больше не самый дешёвый способ гонять DeepSeek. Это допущение сломалось.

Alibaba: веса покупают mindshare; кастомная лицензия держит потолок выручки. Публикация 2,4T-чекпоинта и кастомная лицензия — один ход. Любой бизнес Model-as-a-Service или AI Work Assistant с выручкой свыше $50 million за любые 12 месяцев обязан отдельно согласовать коммерческую лицензию. Продукты с 100M+ monthly active users или $20M+ месячной выручки должны показывать имя модели. Ставка: забрать международных разработчиков и сохранить рычаг над теми, кто продаёт inference сверху. Это другая ставка, чем Muse Glimmer у Meta под unrestricted Apache 2.0. Слух про geo-ban ложен — смотрите файл LICENSE, не тред анонса. Репозиторий чекпоинта лежит на Hugging Face и ModelScope.

GLM-5.3: новый base не нужен, ставка на post-training больше. Тот же 743B, что у GLM-5.2, без retraining, и примерно 6× на Terminal-Bench 3.0 (4.6% → 28.3%) за счёт масштабирования RL-окружений. Когда законы масштабирования pretraining выполаживаются, post-training RL становится отдельным рычагом с более низким cost floor, чем новая foundation-модель. Mid-tier лаборатории всё ещё могут закрывать разрыв на agentic и coding benches без pretrain-бюджета масштаба OpenAI.

SECTION 05 Остаётся ли DeepSeek самым дешёвым frontier: аудит из 6 шагов

Курс RMB/USD около ¥7.15/$1, оценка. Off-peak V4-Pro всё ещё заметно ниже Claude Opus 5, но это уже не безусловный минимум. International pricing Qwen3.8-Max и Luna у OpenAI оба подрезают off-peak DeepSeek. Формула «китайская модель = самая дешёвая» держалась большую часть 2025 и начала 2026. Сейчас это небезопасное допущение. Контекст американского среза: GPT-5.6 Luna минус 80 %.

Input / output за 1M токенов
Модель Input Output Open weights?
DeepSeek V4-Pro (peak) ¥9.0 (~$1.26) ¥27.0 (~$3.78) Нет
DeepSeek V4-Pro (off-peak) ¥4.5 (~$0.63) ¥13.5 (~$1.89) Нет
Qwen3.8-Max (international API) $2.00 $6.00 Да (кастомная лицензия)
OpenAI GPT-5.6 Luna $0.20 $1.20 Нет
Claude Opus 5 (implied, по сравнению Alibaba) ~$5.00 ~$25.00 Нет

Если стек нужно вывести на этой неделе, аудит идёт в шесть шагов, а не умножением заголовка:

  1. Разделение счёта по строкам биллинга: последние 30 дней делятся на cache-hit input, cache-miss input и output. Новая карточка применяется к каждой строке. Весь счёт на 1 100 % не умножается.
  2. Разметка пиковых часов Пекина: 9:00–12:00 и 14:00–18:00 по пекинскому времени. В анонсе просили более гибкий scheduling не случайно.
  3. Сравнение официального API и реселлеров: в пике проверяется, держат ли GMI Cloud, Novita или другой реселлер котировку ниже официального peak DeepSeek.
  4. Проверка файла LICENSE: до скачивания Qwen3.8-2.4T-A95B подтверждаются пороги $50M / 100M MAU / $20M месячной выручки. Треды про geo-ban игнорируются.
  5. Оценка GLM-5.3 как post-training дельты: тот же base, что у 5.2, только vendor benches. Свои terminal- и SWE-задачи прогоняются до замены.
  6. Маршрутизация запросов по слоям стека: дешёвый consumer text — на Luna; веса и экосистема — на Qwen; сдвигаемый по времени frontier inference — на DeepSeek off-peak; long-horizon агенты и iOS CI — на физический Mac, не на гипервизор.
deepseek-bill-estimate.py
peak = {"in_miss": 9.0, "in_hit": 0.30, "out": 27.0}
off  = {"in_miss": 4.5, "in_hit": 0.15, "out": 13.5}

tokens_m = {"in_miss": 40, "in_hit": 40, "out": 4}
def bill(rate, t):
    return t["in_miss"]*rate["in_miss"] + t["in_hit"]*rate["in_hit"] + t["out"]*rate["out"]

print("off-peak CNY", round(bill(off, tokens_m), 2))
print("peak CNY", round(bill(peak, tokens_m), 2))

SECTION 06 Что не верифицировано и какие источники открыть заново

  • Заголовок 1 100 % точен и неполон: это только peak cache-hit input. Output — строка, которая доминирует в большинстве счетов — вырос на 350 %.
  • Утверждения про Zhenwu M890 / Pangu AL128: ряд китайских финансовых изданий пишет, что часть inference Qwen3.8-Max идёт на собственных чипах Alibaba. Alibaba не публиковала независимую техническую документацию и сторонние бенчмарки. Статус: не верифицировано.
  • GLM-5.3 и «серьёзная уязвимость Cursor»: VentureBeat плюс собственный disclosure Zhipu. Технических деталей в открытом доступе нет. Читать как vendor-sourced, без независимого аудита.
  • Ответные export controls: сообщения, что Министерство коммерции КНР может готовить контрмеры по AI/полупроводникам, — спекулятивные медиа, не официальный анонс.

За последний месяц топ-лаборатории Китая выкладывали релизы в темпе, который местная финансовая пресса называет «три обновления модели в неделю» (一周三更) — DeepSeek, Alibaba, Zhipu, плюс Kimi K3 от Moonshot (веса 16 июля, 2,8T) и MiniMax H3. Китайское покрытие формулирует это как open-weight релизы, которые принуждают к глобальному пересчёту цен. US-лаборатории на consumer-слое сыграли наоборот: срез Luna на 80 %, затем free unlimited text; Gemini 3.7 Flash за полцены 13 августа. Флагманские веса плюс ступенчатый, более высокий прайс на compute-constrained вершине; free и cheap на consumer-конце. Оба хода реальны. Они оптимизируют разные части воронки.

Есть и геополитический слой. Kimi K3 уже попал под US security scrutiny. Часть аналитиков читает 2,4T-релиз Alibaba в этом окне как фиксацию международного mindshare и нарратива «технологического паритета» до любого ужесточения регуляторики. Это обоснованная интерпретация, не подтверждённый факт — и её легко пропустить, если читать только английские product-посты.

Официальные и перекрёстно проверенные источники. Эти страницы стоит открыть заново до того, как перепубликовать цены или условия лицензии:

Официальные тарифы DeepSeek API (карточка peak / off-peak)

Alibaba Cloud Community: заметка о запуске Qwen3.8-Max

Hugging Face: репозиторий чекпоинта Qwen3.8-2.4T-A95B

Reuters / MarketScreener: DeepSeek поднимает цены V4 API

MarkTechPost: GLM-5.3, тот же base, только post-training

Самостоятельный хостинг MoE на 2,4 трлн параметров или подключение агента к Xcode и iOS CI накладывает потери гипервизора поверх только что выросшего счёта за токены. Для нативной мощности без потерь, стабильного iOS CI/CD и круглосуточной автоматизации агентов облачный физический узел MACNOX обычно надёжнее в production: оригинальное железо Apple, полный Root, без гипервизора, оплата за день / неделю / месяц. Контекст по трафику: рейтинги OpenRouter за июль.

SECTION 07 Часто задаваемые вопросы

DeepSeek после повышения всё ещё дешевле GPT-5.6 и Claude?

Off-peak по-прежнему дешевле Claude Opus 5, но это уже не единственный минимум по рынку. GPT-5.6 Luna у OpenAI ($0.20/$1.20 за миллион токенов) и international pricing Qwen3.8-Max у Alibaba ($2/$6) подрезают новый off-peak DeepSeek хотя бы по одной оси. Для frontier-класса DeepSeek всё ещё относительно дешёв, просто больше не безусловный минимум.

Можно ли бесплатно ставить open weights Qwen3.8-Max в коммерческий продукт?

Да, для большинства сценариев — личные проекты и внутреннее корпоративное использование не затрагиваются. Ограничение срабатывает только если вы ведёте бизнес Model-as-a-Service или AI Work Assistant с выручкой свыше $50 million за любые последовательные 12 месяцев; этому tier нужна отдельная коммерческая лицензия Alibaba. Продукты с 100M+ MAU или $20M+ месячной выручки должны показывать имя модели.

Qwen3.8-Max запрещён или ограничен для пользователей США, ЕС или Великобритании?

Нет. Утверждение ходило в сети, но оно ложно: в опубликованной лицензии нет географического ограничения любого вида. Ограничения завязаны на выручку, не на то, где находитесь вы или ваши пользователи.

Чем GLM-5.3 фактически отличается от GLM-5.2?

На уровне base-модели — ничем: оба используют один и тот же foundation на 743 миллиарда параметров. Прирост (примерно 6× на Terminal-Bench 3.0) целиком из масштабирования reinforcement learning на этапе post-training, без retraining базовой модели.

Meta действительно откроет веса флагмана, а не только Muse Glimmer?

Пока нет. Muse Glimmer — distilled-модель на 30B, не настоящий флагман Meta. Марк Цукерберг говорил, что open weights для более крупной закрытой Muse Spark 1.2 появятся «скоро». Если это случится, это будет первый US flagship-tier релиз в открытую. На момент публикации это заявленное намерение, не подтверждённый факт.