DeepSeek V4 Flash 0731: та же цена, агентные навыки как у флагманов

Обновили каталог: добавили DeepSeek V4 Flash 0731. Случай нетипичный, поэтому расскажем подробнее. Модель не стала больше, не подорожала, но по агентным задачам прибавила так, что обошла собственную старшую версию.
Переучили, а не раздули
Обычно новое поколение это больше параметров и больше денег за токен. Здесь иначе. Архитектура и размер у сборки 0731 ровно те же, что у предыдущей V4 Flash. Вся разница в пост-тренировке: в DeepSeek доучили модель на агентных сценариях, а потом свели отдельных доменных экспертов обратно в одну сеть.
Что из этого вышло, по данным самого разработчика:
| Бенчмарк | 0731 | прошлая сборка Flash | старшая V4 Pro Preview |
|---|---|---|---|
| Terminal Bench 2.1 | 82,7 | 61,8 | 72,1 |
| DeepSWE | 54,4 | 7,3 | нет данных |
| DSBench-FullStack | 68,7 | 37,0 | нет данных |
DeepSWE с 7,3 до 54,4. Это уже не про проценты улучшения, это смена уровня. И посмотрите на третью колонку: младшая, самая дешёвая модель линейки обошла старшую Pro-версию. Так на всех девяти агентных бенчмарках, которые показал разработчик.
Есть и сравнение с тяжёлой артиллерией. На Terminal Bench 2.1 у Flash 82,7 против 85,0 у Claude Opus 4.8. На Agents' Last Exam 25,2 против 25,7. Разрыв в пределах погрешности. А вот в цене разрыв совсем не в пределах погрешности: Opus 4.8 в нашем каталоге стоит 750 ₽ за миллион входных токенов и 3750 ₽ за миллион выходных. У Flash 21 и 42 ₽.
Обычные бенчмарки тоже подтянуты
Агентами дело не ограничивается. Заявленные разработчиком цифры: MMLU-Pro 86,4, GPQA Diamond 87,4, LiveCodeBench 88,4, SWE-bench Verified 78,6.
Последняя тут самая интересная. SWE-bench Verified под 79 у модели за 21 ₽ это уже повод попробовать её на реальном коде, а не на демо-примерах.
Цена и что за неё дают
21 ₽ за миллион входных токенов, 42 ₽ за миллион выходных. Минимальный баланс 0,5 ₽.
Ступенчатого тарифа у модели нет. Цена одна на любой длине запроса, хоть на полном миллионе токенов контекста. У части моделей на длинном контексте тариф скачет в несколько раз, и это тот самый неприятный сюрприз в конце месяца. Тут такого нет.
Что стоит примерно столько же:
| Модель | Вход ₽/1M | Выход ₽/1M | Контекст |
|---|---|---|---|
| DeepSeek V4 Flash 0731 | 21 | 42 | 1M |
| Google Gemma 4 31B | 21 | 60 | 262K |
| Qwen3.5-35B-A3B | 21 | 150 | 262K |
| GPT-4.1 Nano | 15 | 60 | 1M |
На этой полке у новинки самый дешёвый выход и самый большой контекст.
Независимый рейтинг Artificial Analysis ставит модель на 50 баллов по своему индексу интеллекта, при медиане 17 у моделей сопоставимой цены. На графике она тёмно-синяя точка внутри зелёной зоны «самого выгодного квадранта»: одна задача обходится примерно в $0,028. Всё, что заметно умнее (57-60 баллов), живёт правее, в районе от $0,8 до $3 за задачу. За прибавку в качестве процентов на пятнадцать платить придётся в десятки раз больше.
Соотношение качества и стоимости задачи. По данным сайта artificialanalysis.ai.
Что внутри
Модель разреженная, архитектуры Mixture-of-Experts: 284 млрд параметров всего, но на каждый токен работают только 13 млрд. Отсюда и цена, считается малая часть сети.
За длинный контекст отвечает гибридное внимание, два механизма сжатия. Они и позволяют держать миллион токенов без взрывного роста стоимости. Предобучение шло на 32 с лишним триллионах токенов, веса выложены под лицензией MIT.
Контекст 1 048 576 токенов, это примерно полторы тысячи страниц A4 за один запрос. На выход можно получить до 384 000 токенов.
Ложка дёгтя: модель многословна
Скажем честно. При прогоне того же индекса Artificial Analysis модель выдала 210 млн токенов там, где сопоставимые обходятся 62 млн. Она рассуждает подробно. Очень подробно.
На практике это значит вот что: низкая цена за токен не переносится напрямую в низкий счёт. Гоняете задачи с включёнными рассуждениями, выходных токенов будет заметно больше обычного, и итоговая сумма окажется выше, чем прикидка «42 ₽ за миллион». Всё равно дёшево. Но прикидывать стоит с запасом.
Зачем нужен суффикс 0731
Цифры в названии это дата сборки. Такие версии не меняются под вами: если разработчик завтра выкатит обновление, эта сборка останется прежней.
Для продакшена вещь полезная. Промпты обычно подгоняют под конкретное поведение модели, и когда модель тихо обновляется, поведение уплывает. А вместе с ним и результаты. Закреплённая версия от этого страхует.
Кому пригодится
Разработчикам с агентными сценариями: работа с кодом, разбор больших репозиториев. Сильные агентные метрики плюс миллион контекста за небольшие деньги, сочетание редкое.
Ещё она хороша там, где много текста. Анализ длинных документов, сводки по массиву, разбор архивов переписки.
Автоматизация тоже: вызов функций поддерживается.
А вот кому не подойдёт. Модель только текстовая, картинки и аудио на вход не принимает. И если нужен короткий ответ без долгих размышлений, вернитесь на раздел выше.
Как обратиться
Модель уже в каталоге. ID для API: deepseek/deepseek-v4-flash-0731, короткий алиас: deepseek-v4-flash-0731. Оплата, как обычно, в рублях с баланса GPTIK.





