Главная / Блог / V4 Flash
ENGINEERING_BLOG · 2026.08.05

DeepSeek в 100 раз дешевле
Claude? Разбор бенчмарков V4-Flash

31 июля 2026 DeepSeek вывел deepseek-v4-flash в официальный публичный API-build (V4-Flash-0731): та же 284B-архитектура, что и в апрельской preview, изменилось только post-training. На Agent-бенчмарках модель теперь обгоняет собственный более крупный V4-Pro preview примерно за 1/36–1/179 list price Claude Opus 4.8. Разбор для команд, которые оценивают миграцию на DeepSeek API и экономику китайских open-weight LLM: timeline апрель–август, ценовые таблицы, архитектурные детали, сравнение с Kimi K3 и Qwen3.8-Max, caveats Harness и китайский framing «kill line». Flagship V4-Pro GA и собственный Agent-framework Harness на 5 августа по-прежнему не shipped.

SECTION 01 Почему заголовки про V4-Flash путают production-команды

  • «Официальный» — не новая модель: 0731 идентичен по размеру и структуре апрельской preview; прирост — из свежего post-training pass, не из scale-up;
  • V4-Pro GA всё ещё нет: существует только апрельская preview API; changelog говорит «as soon as possible» без даты; слухи про окно 10–20 августа DeepSeek не подтвердил;
  • Agent-скоры зависят от harness: цифры Terminal Bench 2.0 используют ещё не выпущенный Harness «minimal mode»; changelog DeepSeek предупреждает, что скоры крайне чувствительны к выбору harness;
  • Legacy-алиасы мертвы: deepseek-chat и deepseek-reasoner сняты 24 июля; немигрированные production-вызовы ломаются;
  • Только API rollout: обновление 31 июля затронуло только API; consumer app и web chat на момент публикации не менялись;
  • Не #1 на независимых индексах: Artificial Analysis Intelligence Index ставит V4-Flash на ~50, ниже Kimi K3 (~57) и GLM-5.2 — DeepSeek оптимизирует под «достаточно хорошо + минимальная цена», а не под корону leaderboard.

Суть: 284B/13B active модель теперь бьёт 1.6T/49B preview из той же семьи на нескольких Agent-задачах — качество post-training в конце 2026 конкурирует с сырым числом параметров.

SECTION 02 Timeline и snapshot цен вендора (5 августа 2026)

  • 24 апреля 2026: V4 preview — V4-Pro (1.6T/49B active) и V4-Flash (284B/13B active), контекст 1M, MIT open weights;
  • 24 июля 2026: legacy-алиасы сняты; трафик маршрутизируется на V4-именование;
  • 27 июля 2026: Moonshot AI open weights Kimi K3 (2.8T), усиливает конкурентное давление;
  • 31 июля 2026: публичная API-beta V4-Flash-0731; MIT weights на Hugging Face; changelog называет Harness Agent framework «to be released soon»;
  • 5 августа 2026: V4-Pro GA всё ещё не подтверждён; китайские СМИ цитируют анонимные источники про внутреннее тестирование и окно 10–20 августа — считать слухом до подтверждения DeepSeek.
Цены и параметры моделей (опубликовано вендором, на 5 августа 2026)
Модель Статус Total / active Input ($/M, miss / hit) Output ($/M)
V4-Flash-0731 Официальный 284B / 13B $0.14 / $0.0028 $0.28
V4-Pro Только preview 1.6T / 49B $0.435 / $0.003625 $0.87
Kimi K3 Open weights (27 июля) 2.8T / ~104B (оценка комьюнити) $3.00 / $0.30 $15.00
GLM-5.2 Open (июнь 2026) ~744B / ~40B Здесь не верифицировано Здесь не верифицировано
Qwen3.8-Max API GA (2 авг.); weights pending 2.4T / 95B $2.00 / ~$0.17–0.25 $6.00
Примечание Все list prices вендора; DeepSeek анонсировал будущую 2×-надбавку в пиковые часы (Пекин 9:00–12:00, 14:00–18:00) без даты вступления

SECTION 03 Та же архитектура, новое обучение: CSA+HCA, mHC, Muon и Harness

V4-Flash-0731 идентичен по числу параметров и структуре апрельской preview. DeepSeek объясняет скачок Agent-бенчмарков полностью повторным post-training. Technical report «DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence» описывает три архитектурных изменения из preview:

  • Hybrid attention (CSA + HCA): позиционируется как DSA sparse attention для снижения compute и памяти на длинном контексте;
  • Manifold-Constrained Hyper-Connections (mHC): усиление residual connections;
  • Muon optimizer: более быстрая сходимость и стабильность обучения.

Заявленная вендором эффективность (независимого воспроизведения не видели): на 1M tokens V4-Pro требует 27 % per-token FLOPs V3.2 и 10 % KV cache footprint.

31 июля — первое официальное упоминание DeepSeek Harness, in-house Agent framework против Claude Code. Ранние Agent-работы опирались на Claude Code и OpenCode. Опубликованные Agent-скоры (Terminal Bench 2.0, Toolathlon) гонялись в Harness minimal mode (max effort, top_p 0.95, temperature 1.0) до публичного релиза. Changelog DeepSeek: Agent-скоры «extremely sensitive to harness choice».

Индекс Artificial Analysis vs стоимость за задачу (независимая фирма, через финансовые СМИ)
Модель Intelligence Index Сред. стоимость / задача Стоимость vs V4-Flash
V4-Flash-0731 50 $0.03
Kimi K3 57 $0.86 ~29×
GPT-5.6 Sol на 9+ pts выше $1.86 ~62×
Claude Fable 5 на 9+ pts выше $3.15 ~105×
Вывод Не самый умный скор, но самый дешёвый за задачу — заточен под high-volume Agent и batch workloads

SECTION 04 Caveats бенчмарков и 6-step чеклист миграции API

Отделить от маркетингового нарратива:

  • Harness lock-in: V4-Flash-0731 Terminal Bench 2.0 на 82.7 (vs V4-Pro preview 67.9) использовал unreleased Harness minimal mode — не переносить слепо в Claude Code или Cursor;
  • Жалобы на usability: 21st Century Business Herald, со ссылкой на зарубежный dev feedback, сообщает о низких cache-hit rates на input и occasional safety-classifier timeouts в официальном build;
  • Слухи о финансировании / IPO: СМИ цитируют раунд ~$7.4B при оценке ~$48.7B из анонимных источников — не подтверждено DeepSeek или регуляторными filings.
  1. Проверить имя модели: production должен вызывать deepseek-v4-flash (роутит на 0731); вывести из эксплуатации deepseek-chat / deepseek-reasoner;
  2. Проверить совместимость SDK: OpenAI ChatCompletions и Anthropic-format endpoints работают без структурных изменений кода;
  3. Оптимизировать кэш: cache-hit input — $0.0028/M; мониторить hit rates (по отчётам комьюнити они могут быть низкими);
  4. Учесть peak pricing: анонсированная 2×-надбавка в будние часы по пекинскому времени — batch jobs вне 9:00–12:00 и 14:00–18:00;
  5. A/B на своей workload: blind-test против Kimi K3 и Qwen3.8-Max; не доверять только vendor Harness scores;
  6. Разделить API и consumer: 31 июля затронул только API — end-user app experience валидировать отдельно.
deepseek-v4-flash-api.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Сравнить V4-Flash-0731 и preview."}]
)
print(response.choices[0].message.content)

SECTION 05 Китайская kill line, цитируемые факты и источники

  • 284B / 13B active, MIT weights: официальные веса 0731 на Hugging Face, commercial fine-tune и redistribution разрешены;
  • vs list price Claude Opus 4.8: 21st Century Business Herald называет ~36× дешевле на cache-miss input, ~179× на cache-hit, ~89× на output (vendor prices, не аудированы);
  • Семь недель на вершине OpenRouter: preview V4-Flash, по отчётам, лидировал в usage rankings семь недель подряд — рыночное доказательство стратегии «достаточно хорошо + самый дешёвый»;
  • «Kill line» (斩杀线): китайский dev-сленг для ценово-производительной планки DeepSeek — конкуренты должны явно выигрывать по capability или снижать цену; помогает объяснить 80%-срез цены GPT-5.6 Luna в том же окне;
  • Сдержанная реакция чип-сектора: Nvidia, Broadcom, AMD 31 июля почти не сдвинулись — рынки воспринимают «DeepSeek efficiency» как нормальную инженерию, в отличие от selloff R1 в 2025.

До релиза 0731 форумы насмехались над основателем Liang Wenfeng как над «Liang Baikai» (пустое обещание) из-за сорванных сроков V4-Pro; после того как Flash-build превзошёл ожидания, прозвища вернулись к «Liang Sheng» (мудрец) — быстрый барометр настроений.

Официальные и сторонние источники — проверять после любого upstream update:

Официальная документация DeepSeek API и changelog

Hugging Face: model card deepseek-ai/DeepSeek-V4-Flash

Artificial Analysis: независимый Intelligence Index

Agent pipelines на DeepSeek V4 всё равно требуют стабильного macOS CI для Xcode builds, Metal и iOS automation. Virtualized Mac environments добавляют hypervisor overhead и compatibility risk. Для production-команд, которым нужен zero-loss native Apple silicon, stable iOS CI/CD и 24/7 Agent automation, выделенные физические Mac-ноды MACNOX обычно лучший fit: genuine Apple hardware, full root, no hypervisor tax, flexible daily/weekly/monthly terms. См. также DeepSeek V4 GA pricing и architecture и разбор OpenRouter July rankings.

SECTION 07 Часто задаваемые вопросы

Что изменилось от V3.2 к V4?

Нативный 1M-token context с существенно меньшим long-context compute и памятью (vendor data: V4-Pro на 1M tokens использует 27 % FLOPs V3.2 и 10 % KV cache). V4 добавляет agent-focused training и работает с Claude Code, OpenCode и похожими инструментами.

V4 Flash или V4 Pro для ежедневной работы?

Для chat, batch jobs или high-volume low-cost agents официальный V4-Flash-0731 — лучшее соотношение цены и качества и уже обгоняет V4-Pro preview на Agent-скорах. Для deepest world knowledge и complex reasoning с запасом бюджета — V4-Pro preview до официального GA.

V4-Pro GA уже доступен?

Нет на 5 августа 2026. Официален только V4-Flash-0731, API-only. V4-Pro GA и Harness — «as soon as possible» без подтверждённой даты; слухи про 10–20 августа не верифицированы.

Можно ли доверять benchmark numbers DeepSeek?

Частично. Широко принятые third-party benchmarks вроде SWE-bench Verified весят больше. Agent-скоры (Terminal Bench 2.0 и др.) использовали unreleased Harness — ждать independent reproduction с Claude Code, Cursor или другими harnesses.

Что это значит для моей API-интеграции?

Клиенты OpenAI и Anthropic format не требуют изменений кода — deepseek-v4-flash auto-updates на 0731. Если вы всё ещё вызываете снятые deepseek-chat или deepseek-reasoner, мигрируйте немедленно (сняты 24 июля).