Главная / Блог / DeepSeek V4
ENGINEERING_BLOG · 2026.07.20

DeepSeek V4 GA:
цены, архитектура и разрыв с GPT-5.6

После трёх месяцев ожидания DeepSeek V4 GA (General Availability) вышел 20 июля 2026. Относительно апрельской preview GA даёт измеримый прирост в оркестрации агентов, математическом reasoning и генерации кода, плюс впервые — тарифы peak/off-peak. Инди-разработчики, AI-инженеры и команды на deepseek-chat получают здесь полную базу для решения: таймлайн preview→GA, архитектура V4-Pro/Flash (CSA+HCA, mHC, Muon), матрица бенчмарков, сравнение с GPT-5.6 / Claude Fable 5, стратегия peak/off-peak, 6 шагов миграции API до 24 июля, цитируемые метрики и FAQ.

SECTION 01 Какие проблемы закрывает DeepSeek V4 GA — и какие добавляет

  • Legacy API отключается: deepseek-chat и deepseek-reasoner навсегда уходят 24 июля 2026, 23:59 (Пекин) — немигрированный prod упадёт;
  • Сложность peak/off-peak: будни 09:00–12:00 и 14:00–18:00 (Пекин) удваивают тариф; batch-inference без планирования бьёт по бюджету;
  • Разрыв preview vs GA: preview была сильной, но GA заметно улучшает agent chains и длинные code paths — документация апреля недооценивает GA;
  • Давление closed-source цен: Claude Fable 5 output ~$50/M, GPT-5.6 Sol ~$15/M — высокочастотным командам нужна MIT-альтернатива с self-hosting;
  • Порог 1M контекста: узкое место — память KV Cache, а не маркетинговая цифра; CSA+HCA сжимает её до 10% от V3.2.

Суть: DeepSeek V4 GA — один из ключевых open-source рубежей 2026 года: при 1/10–1/100 стоимости closed flagship даёт лучшую совокупную производительность среди open models (SWE-bench Verified 80,6%, рекорд) и впервые вводит дисциплинированную peak/off-peak модель.

SECTION 02 Таймлайн DeepSeek V4: от preview к GA

Ключевые вехи DeepSeek V4 (2026)
Дата Событие
24 апреля Preview V4 в open source (MIT): V4-Pro (1,6T) и V4-Flash (284B)
Май Production-tuned V4-Flash и V4-Pro, API в общем доступе
Июнь Постоянное снижение output V4-Pro на 75% ($0,87/M tokens)
29 июня Email всем API-пользователям: GA в середине июля, первое объявление peak/off-peak
19 июля Grayscale GA для части разработчиков; пресса: «полная версия завтра»
20 июля GA live (дата публикации статьи)
24 июля Окончательное отключение deepseek-chat и deepseek-reasoner

SECTION 03 V4-Pro vs V4-Flash: архитектура CSA+HCA для 1M контекста

Спецификации семейства DeepSeek V4
Параметр V4-Pro V4-Flash
Всего параметров 1,6 трлн (1,6T) 284 млрд (284B)
Активных параметров/token 49 млрд (49B) 13 млрд (13B)
Слои Transformer 61 43
Окно контекста 1 000 000 tokens 1 000 000 tokens
Макс. output 384K tokens 384K tokens
Точность FP4 (experts) + FP8 (остальное) FP4 + FP8 mixed
Pretrain data 33T+ tokens 32T+ tokens
Лицензия MIT MIT

Классический Transformer линейно раздувает KV Cache — 1M tokens было практически нереализуемо. DeepSeek V4 решает это тремя слоями инженерии:

  • Hybrid Attention (CSA + HCA): Compressed Sparse Attention (CSA) сжимает KV-последовательность через Softmax-gating в 4×, выбирает top-k через FP4 «Lightning Indexer» (Pro: 1024, Flash: 512) и держит sliding window 128 tokens; Heavy Compressed Attention (HCA) сжимает в 128× для глобальной dense attention, чередуясь с CSA. На 1M: inference FLOPs 27% от V3.2, память KV Cache 10% (Flash: 7%).
  • Manifold-Constrained Hyper-Connections (mHC): четырёхканальный residual stream + doubly-stochastic matrix (Birkhoff polytope) стабилизирует сигнал через 61 слой.
  • Оптимизатор Muon: обучение на Muon вместо AdamW; Newton-Schulz ортogonalization градиентов — быстрее и стабильнее сходимость.
Три режима inference
Режим Характеристики Сценарий
Non-think Без chain-of-thought, максимальная скорость Простые Q&A, routing
Think High Явный reasoning (CoT tags) Средняя сложность, debug кода
Think Max Максимальная глубина reasoning, контекст 384K+ Математика, длинные agent chains

Официальные sampling-параметры: temperature=1.0, top_p=1.0 (все режимы).

SECTION 04 Бенчмарки: V4-Pro как лидер open source

Ключевые результаты V4-Pro
Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80,6% (рекорд open source) 96,0% не опубликован отдельно ~69%
SWE-bench Pro 55,4% 80,3% 78,1% 69,2%
LiveCodeBench (Pass@1) 93,5% 88,1% 87,4% 83,2%
Codeforces Elo 3 206
Terminal-Bench 2.1 83,9% 88,0% 85,1% 82,7%

По Artificial Analysis: Claude Fable 5 на Strategy & Ops Index — $3,48 за прогон (score 50), DeepSeek V4-Pro — $0,03 (score 38): разрыв стоимости ×116 при ~12 пунктах score (~31%). V4-Flash держится ниже $0,04 во всех шести категориях index.

SECTION 05 DeepSeek V4 vs GPT-5.6 и Claude Fable 5: матрица выбора

Три flagship в сравнении
Измерение DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open source / self-hosting MIT, да Closed source Closed source
Окно контекста 1M tokens не раскрыто 1M tokens
API output (off-peak) $0,87/M ~$15/M $50/M
API output (peak) $1,74/M
Code capability Очень сильная (близко к Fable 5) Очень сильная Максимальная (SWE-bench Pro лидирует)
Приватность данных Private deployment возможен Только cloud Только cloud
  • Бюджет / высокая частота / self-hosting: V4-Pro или V4-Flash;
  • Максимум code quality, цена вторична: Claude Fable 5 (SWE-bench Pro 80,3%);
  • Алгоритмы + математика: GPT-5.6 Sol / Ultra;
  • Массовая обработка логов/docs: V4-Flash cache hit input $0,0028/M.

SECTION 06 Peak/off-peak тарифы: расчёт и четыре рычага экономии

Новинка GA: как почасовое электричество — будни peak удваивают тариф (Пекин 09:00–12:00, 14:00–18:00).

Полная таблица V4-Pro / V4-Flash (за миллион tokens)
Модель Позиция Off-peak Peak
V4-Pro Input (cache hit) ¥0,025 / $0,0035 ×2
V4-Pro Input (cache miss) ¥3,00 / $0,435 ¥6,00 / $0,87
V4-Pro Output ¥6,00 / $0,87 ¥12,00 / $1,74
V4-Flash Input (cache hit) ¥0,02 / $0,0028 ×2
V4-Flash Input (cache miss) ¥1,00 / $0,14 ¥2,00 / $0,28
V4-Flash Output ¥2,00 / $0,28 ¥4,00 / $0,56
  • Batch в off-peak: документы, разметка, code review после 18:00 или до 09:00;
  • Prompt Cache: V4-Flash cache hit $0,0028/M — system prompts структурировать в начале;
  • Flash как router: простые intents → V4-Flash, сложный reasoning → V4-Pro;
  • Email-уведомления: DeepSeek предупреждает за 24 часа до изменения тарифов.

Даже в peak: output V4-Pro $1,74/M остаётся в 8,6× дешевле Claude Opus 4.8 ($15/M) и GPT-5.6 Sol (~$15/M).

SECTION 07 Миграция API до отключения deepseek-chat: 6 шагов

Важно: deepseek-chat и deepseek-reasoner прекращают работу 24 июля 2026, 15:59 UTC (23:59 Пекин).

Mapping миграции
Legacy модель Новая модель Примечание
deepseek-chat deepseek-v4-flash (non-think) Быстро, лёгкие задачи
deepseek-reasoner deepseek-v4-flash (think mode) Или upgrade на deepseek-v4-pro
  1. Поиск legacy имён: deepseek-chat и deepseek-reasoner в коде, CI и env vars.
  2. Выбор целевой модели: лёгкий диалог → deepseek-v4-flash; сложный reasoning → deepseek-v4-pro + think.
  3. Обновление OpenAI SDK: менять только model, base_url остаётся https://api.deepseek.com.
  4. Настройка think mode: через extra_body, budget от 8000 tokens.
  5. Staging validation: E2E regression до 24 июля, фокус на agent chains и cache hits.
  6. Production rollout: canary, мониторинг peak/off-peak cost и latency.
migrate_api.py
LEGACY — недействительно после 24 июля
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

НОВЫЙ — V4-Pro с think mode
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 поддерживает OpenAI ChatCompletions и Anthropic Messages — в Anthropic SDK достаточно обновить model и base_url=https://api.deepseek.com.

SECTION 08 Цитируемые метрики и источники

  • Рекорд open source: SWE-bench Verified 80,6%, наравне с Gemini 3.1 Pro среди open models.
  • Эффективность контекста: KV Cache на 1M tokens — 10% от V3.2 (Flash: 7%).
  • Price/performance: output V4-Pro off-peak $0,87/M, peak $1,74/M.
  • Deadline миграции: 2026-07-24 23:59 Пекин.
  • Лицензия: V4-Pro и V4-Flash — MIT, коммерческое использование разрешено.
  • Sampling: официально temperature=1.0, top_p=1.0.

После релиза перепроверьте технические детали и benchmarks по официальным источникам:

DeepSeek API — официальная документация

arXiv:2606.19348 — технический paper DeepSeek V4

Hugging Face — репозиторий моделей DeepSeek

Artificial Analysis — Intelligence Index и сравнение стоимости

DeepSeek V4 GA пока не обгоняет Claude Fable 5 или GPT-5.6 по всем benchmarks — его ценность в лучшей open-source производительности при минимальной стоимости. Но для iOS CI/CD на Mac, Metal-ускоренного inference или 7×24 agent pipelines чистый API упирается в потолок: data residency, локальный Mac offline, VM без native Metal и overhead гипервизора на macOS. Для нативной Apple compute без потерь, стабильного iOS CI/CD и agent automation физические облачные Mac MACNOX — более надёжный production path: 100% Apple hardware, полный Root, нулевой hypervisor overhead, гибкая аренда по дням/неделям/месяцам. См. также обзор Kimi K3 open source, custom silicon DeepSeek и inference stack, GPT-5.6 Sol Ultra и математический reasoning.

SECTION 09 Часто задаваемые вопросы

Чем GA отличается от preview DeepSeek V4?

Та же MoE + CSA/HCA архитектура; GA оптимизирует agents, математику и code generation и вводит peak/off-peak. Preview была сильной — GA добавляет production stability и коммерциализацию.

Когда действует peak-тариф?

Будни, Пекин 09:00–12:00 и 14:00–18:00 — тариф ×2. Выходные и праздники — off-peak.

V4-Pro или V4-Flash?

Flash: дешевле и быстрее — routing и лёгкие задачи. Pro: сильнее reasoning — сложный код и длинные agent chains. Рекомендация: Flash фильтрует, Pro эскалирует.

Сколько ещё работает deepseek-chat?

До 24 июля 2026, 23:59 Пекин. Мигрируйте на deepseek-v4-flash или deepseek-v4-pro заранее.

Побеждает ли DeepSeek V4 GPT-5.6?

Closed flagship впереди в aggregate benchmarks — но V4-Pro лидирует LiveCodeBench и Codeforces при ~1/17 стоимости GPT-5.6. Выбор по сценарию и бюджету, не одному score.

Можно ли self-host DeepSeek V4?

Да — MIT, weights на Hugging Face. Production MoE 1,6T требует крупный GPU cluster; подробности в inference stack DeepSeek.