31 июля 2026 DeepSeek вывел deepseek-v4-flash в официальный публичный API-build (V4-Flash-0731): та же 284B-архитектура, что и в апрельской preview, изменилось только post-training. На Agent-бенчмарках модель теперь обгоняет собственный более крупный V4-Pro preview примерно за 1/36–1/179 list price Claude Opus 4.8. Разбор для команд, которые оценивают миграцию на DeepSeek API и экономику китайских open-weight LLM: timeline апрель–август, ценовые таблицы, архитектурные детали, сравнение с Kimi K3 и Qwen3.8-Max, caveats Harness и китайский framing «kill line». Flagship V4-Pro GA и собственный Agent-framework Harness на 5 августа по-прежнему не shipped.
SECTION 01 Почему заголовки про V4-Flash путают production-команды
- «Официальный» — не новая модель: 0731 идентичен по размеру и структуре апрельской preview; прирост — из свежего post-training pass, не из scale-up;
- V4-Pro GA всё ещё нет: существует только апрельская preview API; changelog говорит «as soon as possible» без даты; слухи про окно 10–20 августа DeepSeek не подтвердил;
- Agent-скоры зависят от harness: цифры Terminal Bench 2.0 используют ещё не выпущенный Harness «minimal mode»; changelog DeepSeek предупреждает, что скоры крайне чувствительны к выбору harness;
- Legacy-алиасы мертвы:
deepseek-chatиdeepseek-reasonerсняты 24 июля; немигрированные production-вызовы ломаются; - Только API rollout: обновление 31 июля затронуло только API; consumer app и web chat на момент публикации не менялись;
- Не #1 на независимых индексах: Artificial Analysis Intelligence Index ставит V4-Flash на ~50, ниже Kimi K3 (~57) и GLM-5.2 — DeepSeek оптимизирует под «достаточно хорошо + минимальная цена», а не под корону leaderboard.
Суть: 284B/13B active модель теперь бьёт 1.6T/49B preview из той же семьи на нескольких Agent-задачах — качество post-training в конце 2026 конкурирует с сырым числом параметров.
SECTION 02 Timeline и snapshot цен вендора (5 августа 2026)
- 24 апреля 2026: V4 preview — V4-Pro (1.6T/49B active) и V4-Flash (284B/13B active), контекст 1M, MIT open weights;
- 24 июля 2026: legacy-алиасы сняты; трафик маршрутизируется на V4-именование;
- 27 июля 2026: Moonshot AI open weights Kimi K3 (2.8T), усиливает конкурентное давление;
- 31 июля 2026: публичная API-beta V4-Flash-0731; MIT weights на Hugging Face; changelog называет Harness Agent framework «to be released soon»;
- 5 августа 2026: V4-Pro GA всё ещё не подтверждён; китайские СМИ цитируют анонимные источники про внутреннее тестирование и окно 10–20 августа — считать слухом до подтверждения DeepSeek.
| Модель | Статус | Total / active | Input ($/M, miss / hit) | Output ($/M) |
|---|---|---|---|---|
| V4-Flash-0731 | Официальный | 284B / 13B | $0.14 / $0.0028 | $0.28 |
| V4-Pro | Только preview | 1.6T / 49B | $0.435 / $0.003625 | $0.87 |
| Kimi K3 | Open weights (27 июля) | 2.8T / ~104B (оценка комьюнити) | $3.00 / $0.30 | $15.00 |
| GLM-5.2 | Open (июнь 2026) | ~744B / ~40B | Здесь не верифицировано | Здесь не верифицировано |
| Qwen3.8-Max | API GA (2 авг.); weights pending | 2.4T / 95B | $2.00 / ~$0.17–0.25 | $6.00 |
| Примечание | Все list prices вендора; DeepSeek анонсировал будущую 2×-надбавку в пиковые часы (Пекин 9:00–12:00, 14:00–18:00) без даты вступления | |||
SECTION 03 Та же архитектура, новое обучение: CSA+HCA, mHC, Muon и Harness
V4-Flash-0731 идентичен по числу параметров и структуре апрельской preview. DeepSeek объясняет скачок Agent-бенчмарков полностью повторным post-training. Technical report «DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence» описывает три архитектурных изменения из preview:
- Hybrid attention (CSA + HCA): позиционируется как DSA sparse attention для снижения compute и памяти на длинном контексте;
- Manifold-Constrained Hyper-Connections (mHC): усиление residual connections;
- Muon optimizer: более быстрая сходимость и стабильность обучения.
Заявленная вендором эффективность (независимого воспроизведения не видели): на 1M tokens V4-Pro требует 27 % per-token FLOPs V3.2 и 10 % KV cache footprint.
31 июля — первое официальное упоминание DeepSeek Harness, in-house Agent framework против Claude Code. Ранние Agent-работы опирались на Claude Code и OpenCode. Опубликованные Agent-скоры (Terminal Bench 2.0, Toolathlon) гонялись в Harness minimal mode (max effort, top_p 0.95, temperature 1.0) до публичного релиза. Changelog DeepSeek: Agent-скоры «extremely sensitive to harness choice».
| Модель | Intelligence Index | Сред. стоимость / задача | Стоимость vs V4-Flash |
|---|---|---|---|
| V4-Flash-0731 | 50 | $0.03 | 1× |
| Kimi K3 | 57 | $0.86 | ~29× |
| GPT-5.6 Sol | на 9+ pts выше | $1.86 | ~62× |
| Claude Fable 5 | на 9+ pts выше | $3.15 | ~105× |
| Вывод | Не самый умный скор, но самый дешёвый за задачу — заточен под high-volume Agent и batch workloads | ||
SECTION 04 Caveats бенчмарков и 6-step чеклист миграции API
Отделить от маркетингового нарратива:
- Harness lock-in: V4-Flash-0731 Terminal Bench 2.0 на 82.7 (vs V4-Pro preview 67.9) использовал unreleased Harness minimal mode — не переносить слепо в Claude Code или Cursor;
- Жалобы на usability: 21st Century Business Herald, со ссылкой на зарубежный dev feedback, сообщает о низких cache-hit rates на input и occasional safety-classifier timeouts в официальном build;
- Слухи о финансировании / IPO: СМИ цитируют раунд ~$7.4B при оценке ~$48.7B из анонимных источников — не подтверждено DeepSeek или регуляторными filings.
- Проверить имя модели: production должен вызывать
deepseek-v4-flash(роутит на 0731); вывести из эксплуатацииdeepseek-chat/deepseek-reasoner; - Проверить совместимость SDK: OpenAI ChatCompletions и Anthropic-format endpoints работают без структурных изменений кода;
- Оптимизировать кэш: cache-hit input — $0.0028/M; мониторить hit rates (по отчётам комьюнити они могут быть низкими);
- Учесть peak pricing: анонсированная 2×-надбавка в будние часы по пекинскому времени — batch jobs вне 9:00–12:00 и 14:00–18:00;
- A/B на своей workload: blind-test против Kimi K3 и Qwen3.8-Max; не доверять только vendor Harness scores;
- Разделить API и consumer: 31 июля затронул только API — end-user app experience валидировать отдельно.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Сравнить V4-Flash-0731 и preview."}]
)
print(response.choices[0].message.content)
SECTION 05 Китайская kill line, цитируемые факты и источники
- 284B / 13B active, MIT weights: официальные веса 0731 на Hugging Face, commercial fine-tune и redistribution разрешены;
- vs list price Claude Opus 4.8: 21st Century Business Herald называет ~36× дешевле на cache-miss input, ~179× на cache-hit, ~89× на output (vendor prices, не аудированы);
- Семь недель на вершине OpenRouter: preview V4-Flash, по отчётам, лидировал в usage rankings семь недель подряд — рыночное доказательство стратегии «достаточно хорошо + самый дешёвый»;
- «Kill line» (斩杀线): китайский dev-сленг для ценово-производительной планки DeepSeek — конкуренты должны явно выигрывать по capability или снижать цену; помогает объяснить 80%-срез цены GPT-5.6 Luna в том же окне;
- Сдержанная реакция чип-сектора: Nvidia, Broadcom, AMD 31 июля почти не сдвинулись — рынки воспринимают «DeepSeek efficiency» как нормальную инженерию, в отличие от selloff R1 в 2025.
До релиза 0731 форумы насмехались над основателем Liang Wenfeng как над «Liang Baikai» (пустое обещание) из-за сорванных сроков V4-Pro; после того как Flash-build превзошёл ожидания, прозвища вернулись к «Liang Sheng» (мудрец) — быстрый барометр настроений.
Официальные и сторонние источники — проверять после любого upstream update:
Официальная документация DeepSeek API и changelog
Hugging Face: model card deepseek-ai/DeepSeek-V4-Flash
Artificial Analysis: независимый Intelligence Index
Agent pipelines на DeepSeek V4 всё равно требуют стабильного macOS CI для Xcode builds, Metal и iOS automation. Virtualized Mac environments добавляют hypervisor overhead и compatibility risk. Для production-команд, которым нужен zero-loss native Apple silicon, stable iOS CI/CD и 24/7 Agent automation, выделенные физические Mac-ноды MACNOX обычно лучший fit: genuine Apple hardware, full root, no hypervisor tax, flexible daily/weekly/monthly terms. См. также DeepSeek V4 GA pricing и architecture и разбор OpenRouter July rankings.
SECTION 07 Часто задаваемые вопросы
Что изменилось от V3.2 к V4?
Нативный 1M-token context с существенно меньшим long-context compute и памятью (vendor data: V4-Pro на 1M tokens использует 27 % FLOPs V3.2 и 10 % KV cache). V4 добавляет agent-focused training и работает с Claude Code, OpenCode и похожими инструментами.
V4 Flash или V4 Pro для ежедневной работы?
Для chat, batch jobs или high-volume low-cost agents официальный V4-Flash-0731 — лучшее соотношение цены и качества и уже обгоняет V4-Pro preview на Agent-скорах. Для deepest world knowledge и complex reasoning с запасом бюджета — V4-Pro preview до официального GA.
V4-Pro GA уже доступен?
Нет на 5 августа 2026. Официален только V4-Flash-0731, API-only. V4-Pro GA и Harness — «as soon as possible» без подтверждённой даты; слухи про 10–20 августа не верифицированы.
Можно ли доверять benchmark numbers DeepSeek?
Частично. Широко принятые third-party benchmarks вроде SWE-bench Verified весят больше. Agent-скоры (Terminal Bench 2.0 и др.) использовали unreleased Harness — ждать independent reproduction с Claude Code, Cursor или другими harnesses.
Что это значит для моей API-интеграции?
Клиенты OpenAI и Anthropic format не требуют изменений кода — deepseek-v4-flash auto-updates на 0731. Если вы всё ещё вызываете снятые deepseek-chat или deepseek-reasoner, мигрируйте немедленно (сняты 24 июля).