Назад к статьям

DeepSeek V4 Flash 0731: та же цена, агентные навыки как у флагманов

Команда GPTIK
DeepSeek V4 Flash 0731: та же цена, агентные навыки как у флагманов

Обновили каталог: добавили DeepSeek V4 Flash 0731. Случай нетипичный, поэтому расскажем подробнее. Модель не стала больше, не подорожала, но по агентным задачам прибавила так, что обошла собственную старшую версию.

Переучили, а не раздули

Обычно новое поколение это больше параметров и больше денег за токен. Здесь иначе. Архитектура и размер у сборки 0731 ровно те же, что у предыдущей V4 Flash. Вся разница в пост-тренировке: в DeepSeek доучили модель на агентных сценариях, а потом свели отдельных доменных экспертов обратно в одну сеть.

Что из этого вышло, по данным самого разработчика:

Бенчмарк0731прошлая сборка Flashстаршая V4 Pro Preview
Terminal Bench 2.182,761,872,1
DeepSWE54,47,3нет данных
DSBench-FullStack68,737,0нет данных

DeepSWE с 7,3 до 54,4. Это уже не про проценты улучшения, это смена уровня. И посмотрите на третью колонку: младшая, самая дешёвая модель линейки обошла старшую Pro-версию. Так на всех девяти агентных бенчмарках, которые показал разработчик.

Есть и сравнение с тяжёлой артиллерией. На Terminal Bench 2.1 у Flash 82,7 против 85,0 у Claude Opus 4.8. На Agents' Last Exam 25,2 против 25,7. Разрыв в пределах погрешности. А вот в цене разрыв совсем не в пределах погрешности: Opus 4.8 в нашем каталоге стоит 750 ₽ за миллион входных токенов и 3750 ₽ за миллион выходных. У Flash 21 и 42 ₽.

Обычные бенчмарки тоже подтянуты

Агентами дело не ограничивается. Заявленные разработчиком цифры: MMLU-Pro 86,4, GPQA Diamond 87,4, LiveCodeBench 88,4, SWE-bench Verified 78,6.

Последняя тут самая интересная. SWE-bench Verified под 79 у модели за 21 ₽ это уже повод попробовать её на реальном коде, а не на демо-примерах.

Цена и что за неё дают

21 ₽ за миллион входных токенов, 42 ₽ за миллион выходных. Минимальный баланс 0,5 ₽.

Ступенчатого тарифа у модели нет. Цена одна на любой длине запроса, хоть на полном миллионе токенов контекста. У части моделей на длинном контексте тариф скачет в несколько раз, и это тот самый неприятный сюрприз в конце месяца. Тут такого нет.

Что стоит примерно столько же:

МодельВход ₽/1MВыход ₽/1MКонтекст
DeepSeek V4 Flash 073121421M
Google Gemma 4 31B2160262K
Qwen3.5-35B-A3B21150262K
GPT-4.1 Nano15601M

На этой полке у новинки самый дешёвый выход и самый большой контекст.

Независимый рейтинг Artificial Analysis ставит модель на 50 баллов по своему индексу интеллекта, при медиане 17 у моделей сопоставимой цены. На графике она тёмно-синяя точка внутри зелёной зоны «самого выгодного квадранта»: одна задача обходится примерно в $0,028. Всё, что заметно умнее (57-60 баллов), живёт правее, в районе от $0,8 до $3 за задачу. За прибавку в качестве процентов на пятнадцать платить придётся в десятки раз больше.

Соотношение качества и стоимости задачи. По данным сайта artificialanalysis.ai.

Что внутри

Модель разреженная, архитектуры Mixture-of-Experts: 284 млрд параметров всего, но на каждый токен работают только 13 млрд. Отсюда и цена, считается малая часть сети.

За длинный контекст отвечает гибридное внимание, два механизма сжатия. Они и позволяют держать миллион токенов без взрывного роста стоимости. Предобучение шло на 32 с лишним триллионах токенов, веса выложены под лицензией MIT.

Контекст 1 048 576 токенов, это примерно полторы тысячи страниц A4 за один запрос. На выход можно получить до 384 000 токенов.

Ложка дёгтя: модель многословна

Скажем честно. При прогоне того же индекса Artificial Analysis модель выдала 210 млн токенов там, где сопоставимые обходятся 62 млн. Она рассуждает подробно. Очень подробно.

На практике это значит вот что: низкая цена за токен не переносится напрямую в низкий счёт. Гоняете задачи с включёнными рассуждениями, выходных токенов будет заметно больше обычного, и итоговая сумма окажется выше, чем прикидка «42 ₽ за миллион». Всё равно дёшево. Но прикидывать стоит с запасом.

Зачем нужен суффикс 0731

Цифры в названии это дата сборки. Такие версии не меняются под вами: если разработчик завтра выкатит обновление, эта сборка останется прежней.

Для продакшена вещь полезная. Промпты обычно подгоняют под конкретное поведение модели, и когда модель тихо обновляется, поведение уплывает. А вместе с ним и результаты. Закреплённая версия от этого страхует.

Кому пригодится

Разработчикам с агентными сценариями: работа с кодом, разбор больших репозиториев. Сильные агентные метрики плюс миллион контекста за небольшие деньги, сочетание редкое.

Ещё она хороша там, где много текста. Анализ длинных документов, сводки по массиву, разбор архивов переписки.

Автоматизация тоже: вызов функций поддерживается.

А вот кому не подойдёт. Модель только текстовая, картинки и аудио на вход не принимает. И если нужен короткий ответ без долгих размышлений, вернитесь на раздел выше.

Как обратиться

Модель уже в каталоге. ID для API: deepseek/deepseek-v4-flash-0731, короткий алиас: deepseek-v4-flash-0731. Оплата, как обычно, в рублях с баланса GPTIK.

Claude Opus 5 и свежие Gemini в GPTIK: от флагмана до модели за 45 ₽

Claude Opus 5 и свежие Gemini в GPTIK: от флагмана до модели за 45 ₽

27 июля 2026 г. Команда GPTIK

Добавили в каталог четыре модели: Claude Opus 5 и его быстрый вариант, Gemini 3.6 Flash и Gemini 3.5 Flash Lite. Разбираем, чем они отличаются, что показывают на бенчмарках и под какие задачи брать каждую.

Kimi K3 в GPTIK: гигантская модель для кода и агентов

Kimi K3 в GPTIK: гигантская модель для кода и агентов

21 июля 2026 г. Команда GPTIK

Добавили в каталог MoonshotAI Kimi K3 — многомодальную модель на 2,8 триллиона параметров с контекстом почти в миллион токенов. Рассказываем, что она умеет и кому пригодится.

Qwen3.7 Flash и пакетный Gemini: две новые модели в каталоге

Qwen3.7 Flash и пакетный Gemini: две новые модели в каталоге

29 июля 2026 г. Команда GPTIK

Добавили Qwen3.7 Flash — дешёвую мультимодальную модель с контекстом в миллион токенов и ступенчатым ценником, и пакетный режим Gemini 3.6 Flash, который считает вдвое дешевле обычного. Разбираем, что они умеют и кому пригодятся.

Grok STT 1.0 в GPTIK: распознавание речи за 15 рублей в час

Grok STT 1.0 в GPTIK: распознавание речи за 15 рублей в час

27 июля 2026 г. Команда GPTIK

Добавили в каталог Grok STT 1.0 - модель распознавания речи от SpaceXAI, создателей Grok. Точность на уровне лидеров рынка, а час аудио стоит 15 рублей - в три с половиной раза дешевле Whisper. Рассказываем, что она умеет и кому пригодится.

Новые модели в GPTIK: серия GPT-5.6 от OpenAI (Sol, Terra, Luna)

Новые модели в GPTIK: серия GPT-5.6 от OpenAI (Sol, Terra, Luna)

10 июля 2026 г. Команда GPTIK

Добавили в каталог все шесть моделей серии GPT-5.6: флагманский Sol, сбалансированный Terra, экономичный Luna и их Pro-версии. Рассказываем, что они умеют, сколько стоят и кому пригодятся.

Grok 4.5 в GPTIK: новый флагман SpaceXAI для кода и рассуждений

Grok 4.5 в GPTIK: новый флагман SpaceXAI для кода и рассуждений

9 июля 2026 г. Команда GPTIK

Добавили в каталог Grok 4.5, свежую модель SpaceXAI (создатели Grok). Сильна в коде, рассуждениях и STEM, понимает картинки и файлы, контекст на 500K токенов. Рассказываем, что умеет и сколько стоит.