После трёх месяцев ожидания DeepSeek V4 GA (General Availability) вышел 20 июля 2026. Относительно апрельской preview GA даёт измеримый прирост в оркестрации агентов, математическом reasoning и генерации кода, плюс впервые — тарифы peak/off-peak. Инди-разработчики, AI-инженеры и команды на deepseek-chat получают здесь полную базу для решения: таймлайн preview→GA, архитектура V4-Pro/Flash (CSA+HCA, mHC, Muon), матрица бенчмарков, сравнение с GPT-5.6 / Claude Fable 5, стратегия peak/off-peak, 6 шагов миграции API до 24 июля, цитируемые метрики и FAQ.
SECTION 01 Какие проблемы закрывает DeepSeek V4 GA — и какие добавляет
- Legacy API отключается:
deepseek-chatиdeepseek-reasonerнавсегда уходят 24 июля 2026, 23:59 (Пекин) — немигрированный prod упадёт; - Сложность peak/off-peak: будни 09:00–12:00 и 14:00–18:00 (Пекин) удваивают тариф; batch-inference без планирования бьёт по бюджету;
- Разрыв preview vs GA: preview была сильной, но GA заметно улучшает agent chains и длинные code paths — документация апреля недооценивает GA;
- Давление closed-source цен: Claude Fable 5 output ~$50/M, GPT-5.6 Sol ~$15/M — высокочастотным командам нужна MIT-альтернатива с self-hosting;
- Порог 1M контекста: узкое место — память KV Cache, а не маркетинговая цифра; CSA+HCA сжимает её до 10% от V3.2.
Суть: DeepSeek V4 GA — один из ключевых open-source рубежей 2026 года: при 1/10–1/100 стоимости closed flagship даёт лучшую совокупную производительность среди open models (SWE-bench Verified 80,6%, рекорд) и впервые вводит дисциплинированную peak/off-peak модель.
SECTION 02 Таймлайн DeepSeek V4: от preview к GA
| Дата | Событие |
|---|---|
| 24 апреля | Preview V4 в open source (MIT): V4-Pro (1,6T) и V4-Flash (284B) |
| Май | Production-tuned V4-Flash и V4-Pro, API в общем доступе |
| Июнь | Постоянное снижение output V4-Pro на 75% ($0,87/M tokens) |
| 29 июня | Email всем API-пользователям: GA в середине июля, первое объявление peak/off-peak |
| 19 июля | Grayscale GA для части разработчиков; пресса: «полная версия завтра» |
| 20 июля | GA live (дата публикации статьи) |
| 24 июля | Окончательное отключение deepseek-chat и deepseek-reasoner |
SECTION 03 V4-Pro vs V4-Flash: архитектура CSA+HCA для 1M контекста
| Параметр | V4-Pro | V4-Flash |
|---|---|---|
| Всего параметров | 1,6 трлн (1,6T) | 284 млрд (284B) |
| Активных параметров/token | 49 млрд (49B) | 13 млрд (13B) |
| Слои Transformer | 61 | 43 |
| Окно контекста | 1 000 000 tokens | 1 000 000 tokens |
| Макс. output | 384K tokens | 384K tokens |
| Точность | FP4 (experts) + FP8 (остальное) | FP4 + FP8 mixed |
| Pretrain data | 33T+ tokens | 32T+ tokens |
| Лицензия | MIT | MIT |
Классический Transformer линейно раздувает KV Cache — 1M tokens было практически нереализуемо. DeepSeek V4 решает это тремя слоями инженерии:
- Hybrid Attention (CSA + HCA): Compressed Sparse Attention (CSA) сжимает KV-последовательность через Softmax-gating в 4×, выбирает top-k через FP4 «Lightning Indexer» (Pro: 1024, Flash: 512) и держит sliding window 128 tokens; Heavy Compressed Attention (HCA) сжимает в 128× для глобальной dense attention, чередуясь с CSA. На 1M: inference FLOPs 27% от V3.2, память KV Cache 10% (Flash: 7%).
- Manifold-Constrained Hyper-Connections (mHC): четырёхканальный residual stream + doubly-stochastic matrix (Birkhoff polytope) стабилизирует сигнал через 61 слой.
- Оптимизатор Muon: обучение на Muon вместо AdamW; Newton-Schulz ортogonalization градиентов — быстрее и стабильнее сходимость.
| Режим | Характеристики | Сценарий |
|---|---|---|
| Non-think | Без chain-of-thought, максимальная скорость | Простые Q&A, routing |
| Think High | Явный reasoning (CoT tags) | Средняя сложность, debug кода |
| Think Max | Максимальная глубина reasoning, контекст 384K+ | Математика, длинные agent chains |
Официальные sampling-параметры: temperature=1.0, top_p=1.0 (все режимы).
SECTION 04 Бенчмарки: V4-Pro как лидер open source
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6% (рекорд open source) | 96,0% | не опубликован отдельно | ~69% |
| SWE-bench Pro | 55,4% | 80,3% | 78,1% | 69,2% |
| LiveCodeBench (Pass@1) | 93,5% | 88,1% | 87,4% | 83,2% |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9% | 88,0% | 85,1% | 82,7% |
По Artificial Analysis: Claude Fable 5 на Strategy & Ops Index — $3,48 за прогон (score 50), DeepSeek V4-Pro — $0,03 (score 38): разрыв стоимости ×116 при ~12 пунктах score (~31%). V4-Flash держится ниже $0,04 во всех шести категориях index.
SECTION 05 DeepSeek V4 vs GPT-5.6 и Claude Fable 5: матрица выбора
| Измерение | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open source / self-hosting | MIT, да | Closed source | Closed source |
| Окно контекста | 1M tokens | не раскрыто | 1M tokens |
| API output (off-peak) | $0,87/M | ~$15/M | $50/M |
| API output (peak) | $1,74/M | — | — |
| Code capability | Очень сильная (близко к Fable 5) | Очень сильная | Максимальная (SWE-bench Pro лидирует) |
| Приватность данных | Private deployment возможен | Только cloud | Только cloud |
- Бюджет / высокая частота / self-hosting: V4-Pro или V4-Flash;
- Максимум code quality, цена вторична: Claude Fable 5 (SWE-bench Pro 80,3%);
- Алгоритмы + математика: GPT-5.6 Sol / Ultra;
- Массовая обработка логов/docs: V4-Flash cache hit input $0,0028/M.
SECTION 06 Peak/off-peak тарифы: расчёт и четыре рычага экономии
Новинка GA: как почасовое электричество — будни peak удваивают тариф (Пекин 09:00–12:00, 14:00–18:00).
| Модель | Позиция | Off-peak | Peak |
|---|---|---|---|
| V4-Pro | Input (cache hit) | ¥0,025 / $0,0035 | ×2 |
| V4-Pro | Input (cache miss) | ¥3,00 / $0,435 | ¥6,00 / $0,87 |
| V4-Pro | Output | ¥6,00 / $0,87 | ¥12,00 / $1,74 |
| V4-Flash | Input (cache hit) | ¥0,02 / $0,0028 | ×2 |
| V4-Flash | Input (cache miss) | ¥1,00 / $0,14 | ¥2,00 / $0,28 |
| V4-Flash | Output | ¥2,00 / $0,28 | ¥4,00 / $0,56 |
- Batch в off-peak: документы, разметка, code review после 18:00 или до 09:00;
- Prompt Cache: V4-Flash cache hit $0,0028/M — system prompts структурировать в начале;
- Flash как router: простые intents → V4-Flash, сложный reasoning → V4-Pro;
- Email-уведомления: DeepSeek предупреждает за 24 часа до изменения тарифов.
Даже в peak: output V4-Pro $1,74/M остаётся в 8,6× дешевле Claude Opus 4.8 ($15/M) и GPT-5.6 Sol (~$15/M).
SECTION 07 Миграция API до отключения deepseek-chat: 6 шагов
Важно: deepseek-chat и deepseek-reasoner прекращают работу 24 июля 2026, 15:59 UTC (23:59 Пекин).
| Legacy модель | Новая модель | Примечание |
|---|---|---|
deepseek-chat |
deepseek-v4-flash (non-think) |
Быстро, лёгкие задачи |
deepseek-reasoner |
deepseek-v4-flash (think mode) |
Или upgrade на deepseek-v4-pro |
- Поиск legacy имён:
deepseek-chatиdeepseek-reasonerв коде, CI и env vars. - Выбор целевой модели: лёгкий диалог →
deepseek-v4-flash; сложный reasoning →deepseek-v4-pro+ think. - Обновление OpenAI SDK: менять только
model,base_urlостаётсяhttps://api.deepseek.com. - Настройка think mode: через
extra_body, budget от 8000 tokens. - Staging validation: E2E regression до 24 июля, фокус на agent chains и cache hits.
- Production rollout: canary, мониторинг peak/off-peak cost и latency.
LEGACY — недействительно после 24 июля
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
НОВЫЙ — V4-Pro с think mode
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
V4 поддерживает OpenAI ChatCompletions и Anthropic Messages — в Anthropic SDK достаточно обновить model и base_url=https://api.deepseek.com.
SECTION 08 Цитируемые метрики и источники
- Рекорд open source: SWE-bench Verified 80,6%, наравне с Gemini 3.1 Pro среди open models.
- Эффективность контекста: KV Cache на 1M tokens — 10% от V3.2 (Flash: 7%).
- Price/performance: output V4-Pro off-peak $0,87/M, peak $1,74/M.
- Deadline миграции: 2026-07-24 23:59 Пекин.
- Лицензия: V4-Pro и V4-Flash — MIT, коммерческое использование разрешено.
- Sampling: официально
temperature=1.0, top_p=1.0.
После релиза перепроверьте технические детали и benchmarks по официальным источникам:
DeepSeek API — официальная документация
arXiv:2606.19348 — технический paper DeepSeek V4
Hugging Face — репозиторий моделей DeepSeek
Artificial Analysis — Intelligence Index и сравнение стоимости
DeepSeek V4 GA пока не обгоняет Claude Fable 5 или GPT-5.6 по всем benchmarks — его ценность в лучшей open-source производительности при минимальной стоимости. Но для iOS CI/CD на Mac, Metal-ускоренного inference или 7×24 agent pipelines чистый API упирается в потолок: data residency, локальный Mac offline, VM без native Metal и overhead гипервизора на macOS. Для нативной Apple compute без потерь, стабильного iOS CI/CD и agent automation физические облачные Mac MACNOX — более надёжный production path: 100% Apple hardware, полный Root, нулевой hypervisor overhead, гибкая аренда по дням/неделям/месяцам. См. также обзор Kimi K3 open source, custom silicon DeepSeek и inference stack, GPT-5.6 Sol Ultra и математический reasoning.
SECTION 09 Часто задаваемые вопросы
Чем GA отличается от preview DeepSeek V4?
Та же MoE + CSA/HCA архитектура; GA оптимизирует agents, математику и code generation и вводит peak/off-peak. Preview была сильной — GA добавляет production stability и коммерциализацию.
Когда действует peak-тариф?
Будни, Пекин 09:00–12:00 и 14:00–18:00 — тариф ×2. Выходные и праздники — off-peak.
V4-Pro или V4-Flash?
Flash: дешевле и быстрее — routing и лёгкие задачи. Pro: сильнее reasoning — сложный код и длинные agent chains. Рекомендация: Flash фильтрует, Pro эскалирует.
Сколько ещё работает deepseek-chat?
До 24 июля 2026, 23:59 Пекин. Мигрируйте на deepseek-v4-flash или deepseek-v4-pro заранее.
Побеждает ли DeepSeek V4 GPT-5.6?
Closed flagship впереди в aggregate benchmarks — но V4-Pro лидирует LiveCodeBench и Codeforces при ~1/17 стоимости GPT-5.6. Выбор по сценарию и бюджету, не одному score.
Можно ли self-host DeepSeek V4?
Да — MIT, weights на Hugging Face. Production MoE 1,6T требует крупный GPU cluster; подробности в inference stack DeepSeek.