13 августа 2026 года DeepSeek выкатил GA DeepSeek-V4-Pro на веб, в приложение и в API. Это не апрельский Preview и не июльский Flash. В официальном changelog модель называют DeepSeek-V4-Pro-0813, строка API прежняя: deepseek-v4-pro. Чат: chat.deepseek.com.
В пересказах уже «вошла в топ к Kimi K3 и GLM-5.2» и «соберёт комплексный проект за секунды». В changelog этого нет. Есть три конкретные вещи: агентные бенчмарки, нативный OpenAI Responses API плюс Codex, и три уровня thinking effort. Ниже только это.
Что вышло на самом деле
24 апреля 2026 был Preview. 31 июля обновили только Flash: Pro и веб тогда не трогали, «официальный Pro скоро». 13 августа этот «скоро» случился. Баннер на deepseek.com повторяет то же: усиленные агентные возможности, Responses API, интеграция с Codex, доступ на web, app и API.
По странице моделей: контекст 1M токенов, максимум ответа 384K, thinking по умолчанию включён, есть non-thinking. JSON, tool calls, Responses API, Anthropic API. FIM только в non-thinking. Лимит конкурентности у Pro: 500, у Flash: 2500.
Три уровня рассуждений
Thinking mode у V4-Pro и V4-Flash теперь явно режется на low / high / max. Документация советует так: low для простых задач, high для повседневных агентных, max для сложных. Дефолт: thinking включён, effort high. none в Responses API выключает thinking.
Маппинг чужих имён: medium, high и xhigh схлопываются в high. Настоящий потолок только у max.
Пример через OpenAI SDK (параметр thinking в extra_body):
from openai import OpenAI
client = OpenAI(api_key="sk-...", base_url="https://api.deepseek.com")
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Найди, где в репозитории собирается sitemap"}],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}},
)
print(response.choices[0].message.content)
Цепочка рассуждений приходит в reasoning_content. Если модель звала инструменты, этот блок нужно отдавать обратно в следующих запросах, иначе API ответит 400. Без tool calls промежуточный CoT можно не таскать.
Low снижает расход не магией, а более коротким размышлением. На практике это не «всегда дешевле в два раза»: на простых запросах low иногда болтает дольше high. Имеет смысл мерить на своих задачах, а не верить подписи кнопки.
Агент: цифры DeepSeek, не «за секунды»
GA, пишет компания, сильнее в проде. Они сами опубликовали набор агентных оценок (часть публичная, DSBench внутренний):
- HLE без инструментов / с инструментами: 42.7 / 60.0
- Terminal Bench 2.1: 87.9
- NL2Repo: 61.5
- Cybergym: 83.3
- DeepSWE: 62.7
- Toolathlon-Verified: 74.1
- Agents’ Last Exam: 25.7
- AutomationBench (Public): 31.8
- DSBench-FullStack: 71.1
- DSBench-Hard: 67.2
Для сравнения, у официального Flash-0731 на тех же публичных наборах Terminal Bench 2.1 был 82.7, NL2Repo 54.2, Cybergym 76.7. Про вырос. Это не доказательство, что он обошёл GPT-5.6 Sol или Fable 5: в changelog таких пар нет. Kimi K3 и GLM-5.2 в том же поле, но место в «топе» лучше смотреть на живом лидерборде, а не в телеграм-карточке.
Собрать лендинг или починить баг модель может. «Комплексный проект за секунды» в документах не обещают. Агент ходит циклами reasoning + tool calls и в конце отдаёт ответ. Это ближе к Codex / Claude Code, чем к чату «напиши сайт целиком».
Responses API и Codex
API теперь нативно понимает формат OpenAI Responses API и заточен под Codex (CLI, десктоп ChatGPT, расширение VS Code). Один конфиг в ~/.codex.
Официальный скрипт (сначала поставьте Codex и один раз его запустите, чтобы появился каталог). Это curl | bash: перед продом читайте скрипт, не гоняйте вслепую на машине с ключами.
# macOS / Linux bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)
Скрипт бэкапит ~/.codex/config.toml в ~/.codex/backup-deepseek/, пишет каталог моделей и секцию провайдера. Ключ берётся с platform.deepseek.com. Повторный запуск умеет переключить модель или откатить конфиг.
Цены и пик с 16 августа
Сейчас, за 1M токенов у deepseek-v4-pro: cache hit 0.003625 $, cache miss 0.435 $, output 0.87 $. Flash дешевле примерно втрое.
С 16 августа 2026, 16:00 UTC, включат пик и ночь. Off-peak у Pro: 0.022 / 0.66 / 1.98 $. Peak (01:00–04:00 и 06:00–10:00 UTC): 0.044 / 1.32 / 3.96 $. Off-peak ровно половина пика. Для Москвы пик, это примерно 04:00–07:00 и 09:00–13:00. Ночные прогоны агента после 16 августа станут заметно дешевле дневных.
Кому это трогать руками
- Чат без ключа: chat.deepseek.com.
- Свой агент / Codex:
model=deepseek-v4-pro, effort подобрать с low, не сразу max. - Нужен дешевле и быстрее: сначала Flash, Pro на тяжёлые прогоны.
- Сравнение с закрытыми флагманами: смотрите живые бенчи, не чужой скрин «топ». Рядом по рынку сейчас как раз GLM-5.2, Kimi K3, GPT-5.6 Sol, Fable 5 и Grok 4.6.
Про китайские coding-модели на сайте уже был разбор GLM 5.2 против Fable 5. V4-Pro GA садится в ту же полку, только уже как агент с нормальным Responses API, а не только как чат.
Вывод
13 августа Pro перестал быть превью. Три ручки effort, агентные цифры выше июльского Flash, Codex подключается скриптом, с 16 августа цены режутся на день и ночь. «Монстр собрал проект за секунды» оставьте мемам. Для работы достаточно: чат на deepseek.com, в API строка deepseek-v4-pro, max только когда high уже не тянет.