Назад к статьям

Три новые модели: GLM-5.3-Flash, Qwen3.8 Flash и DeepSeek V4 Flash Vision

Команда GPTIK
Три новые модели: GLM-5.3-Flash, Qwen3.8 Flash и DeepSeek V4 Flash Vision

Добавили в каталог три новые модели: GLM-5.3-Flash от Z.ai, Qwen3.8 Flash от Alibaba и экспериментальную DeepSeek V4 Flash Vision. Все три вышли на одной неделе и оказались похожи по замыслу: миллион токенов контекста, понимание картинок, вызов функций. Каждой можно показать экран и попросить разобраться, что там происходит.

Дальше по порядку, от самой дешёвой к самой дорогой.

GLM-5.3-Flash: 11,25 ₽ за миллион токенов на входе

Самая дешёвая новинка каталога и при этом самая высокая по независимым оценкам. Вход 11,25 ₽ за миллион токенов, выход 37,5 ₽, чтение из кеша 2,25 ₽. Контекст 1 310 720 токенов, ответ до 131 072.

Artificial Analysis ставит модели индекс интеллекта 57: третье место из 110 моделей при медиане 28 по выборке. По их же оценке это уровень Claude Opus 4.8 примерно за десятую часть денег.

Дело в архитектуре. Z.ai впервые в серии GLM смешала два вида внимания: линейное держит локальные связи через компактное состояние, разреженное выборочно достаёт нужное из всего окна. По заявлению разработчика это втрое меньше вычислений на внимание и в 4,4 раза меньший кеш ключей, чем у старшей GLM-5.3. Миллионный контекст перестаёт быть строчкой в спецификации и становится тем, за что не страшно платить.

Ещё деталь: Flash обучали с нуля, на своей архитектуре, мультимодальной с самого начала. Со старшей GLM-5.3 её роднит разве что имя семейства. Веса открыты под лицензией MIT.

На графике GLM-5.3-Flash сравнивают с предыдущей GLM-5.2 и с флагманами: Claude Opus 4.8, GPT-5.6 Terra, Gemini 3.7 Flash. Заодно там есть DeepSeek V4 Vision Exp, вторая наша новинка. На агентных задачах (DeepSWE, AutomationBench) Flash обходит Opus 4.8, на терминальных сценариях идёт вровень, а на GDPVal-AA v2 показывает лучший результат в таблице. Оговорка: пять прогонов из шести разработчик делал сам, своими средствами. Независимо подтверждён только GDPVal-AA v2.

Сравнение GLM-5.3-Flash с другими моделями по шести бенчмаркам. По данным Z.ai.

За что хвалят на практике: соблюдает строгие JSON-схемы, пишет рабочий код, не ведётся на попытки подменить инструкцию прямо в тексте запроса. Заточка понятная: программирование, ревью кода, длинные агентные циклы. Z.ai обучала модель на задачах, где агенту дают кодовую базу с документацией и просят самому найти проблему, внести правку и показать измеримое улучшение.

Минус честный: модель неторопливая. Около 50 токенов в секунду, это 47-е место по скорости. В длинном агентном цикле разница чувствуется.

Qwen3.8 Flash: вдвое дороже, зато видит видео

Вход 22,5 ₽ за миллион токенов, выход 70,5 ₽, чтение из кеша 2,4 ₽. Контекст миллион токенов, ответ до 131 072. Понимает текст, картинки и видео.

Внутри архитектура MoE: около 125 миллиардов параметров, но на каждый токен активируется порядка шести миллиардов. Отсюда и сочетание «умная, но недорогая». Alibaba заявляет, что обучение обошлось примерно в девять раз дешевле, чем у старшей Qwen3.7-Plus, а качество при этом выше, заметнее всего в программировании и офисных задачах.

Здесь нужна оговорка. Опубликованные бенчмарки относятся к варианту с открытыми весами, Qwen3.8-Flash-Next. У нас в каталоге продакшен-версия того же семейства, с миллионным контекстом по умолчанию. Цифры годятся как ориентир, но получены на открытом варианте.

Artificial Analysis даёт индекс 56, четвёртое место из 110 моделей. Решение одной задачи их набора обошлось примерно в десять центов.

Самое интересное в Qwen3.8 Flash даже не кодинг. По цифрам Alibaba самые большие отрывы от Claude Opus 4.6 Max получились на визуальных и агентных задачах: управление интерфейсом телефона 84,5 против 62,0, понимание длинного видео 76,6 против 63,0, вопросы по реальным фотографиям 88,5 против 73,9. Разработчик называет и слабое место: на задачах широкой эрудиции высшего уровня модель отстаёт от Opus.

Инженеры NVIDIA отдельно проверили длинный контекст: на миллионе токенов разреженное внимание ускоряет обработку промпта до 7,6 раза. То есть миллион тут действительно работает.

Куда её ставить: разбор документов и кодовых баз, агент, который ходит по интерфейсам, анализ графиков и длинного видео.

DeepSeek V4 Flash Vision: быстрый отклик и очень длинный ответ

Вход 66 ₽ за миллион токенов, выход 198 ₽, чтение из кеша 2,1 ₽. Контекст 1 048 576 токенов, а вот ответ до 384 000 токенов, заметно больше, чем у двух других новинок. И только эта из трёх не работает с видео: текст и картинки.

Это версия с добавленным зрением поверх текстовой DeepSeek V4 Flash. Разработчик заявлял, что по тексту она просто не хуже базовой. По его же цифрам вышло лучше: vision-версия обгоняет текстовую на шести текстовых бенчмарках из семи.

В таблице одиннадцать бенчмарков двумя группами: текстовые агентные задачи и мультимодальные. Модель обходит Claude Opus 4.8 на трёх из них (DeepSWE, Agents' Last Exam, ZeroBench) и заметно отстаёт на двух: работе с репозиторием целиком и сложных задачах анализа данных. Две строки в мультимодальной группе читайте с поправкой: там базовую текстовую модель сравнивают на задачах, где она в принципе не видит картинок, поэтому разрыв завышен.

Результаты DeepSeek V4 Flash Vision Exp в сравнении с базовой версией и Claude Opus 4.8. По данным DeepSeek.

Artificial Analysis даёт индекс 51, пятое место из 176 моделей, и отдельно отмечает скорость: 117,6 токена в секунду, первый токен приходит через 1,19 секунды при медиане 2,04. Отвечать начинает быстрее большинства.

Теперь про ограничение, о котором лучше знать заранее. Картинки перед обработкой ужимаются примерно до 800×800 пикселей, и любое изображение стоит не больше 384 токенов. Для графиков, диаграмм и общего понимания скриншотов это отлично и дёшево. Для мелкого шрифта на чеке, плотной электрической схемы или показаний аналоговой шкалы плохо: детали просто не доедут.

И слово «экспериментальная» в названии тут не для красоты. Даты версии в идентификаторе нет, поведение может меняться. Строите на ней что-то рабочее, прикройте тестами.

Как выбирать

Разброс цен между новинками почти шестикратный: 11,25 ₽ у GLM против 66 ₽ у DeepSeek за вход. А по независимому индексу интеллекта они стоят рядом: 57, 56 и 51. Дороже здесь не значит умнее.

Есть и общая черта, которая влияет на бюджет. Все три модели многословны: на одном и том же наборе задач они выдают заметно больше выходных токенов, чем средняя модель, иногда вдвое. Поэтому считать имеет смысл не цену за токен, а стоимость решённой задачи. Разница выходит ощутимая.

Если совсем коротко. GLM-5.3-Flash берите, когда важна цена и работа с кодом, а лишние секунды ожидания терпимы. Qwen3.8 Flash нужен там, где есть видео, скриншоты интерфейсов и агент с инструментами. А DeepSeek V4 Flash Vision выигрывает, когда нужен быстрый отклик и очень длинный ответ, и когда картинки это графики и схемы, а не мелкий шрифт.

Все три уже в каталоге, оплата в рублях с баланса GPTIK. Заходите и пробуйте.

Две новые модели в GPTIK: Qwen3.8 27B и GLM-5.3

Две новые модели в GPTIK: Qwen3.8 27B и GLM-5.3

19 августа 2026 г. Команда GPTIK

Добавили в каталог Qwen3.8 27B, компактную модель, которая видит изображения и видео, и GLM-5.3 с контекстом в миллион токенов для работы с кодом. Рассказываем, что умеют, сколько стоят и кому пригодятся.

Семь новых моделей в GPTIK: Grok 4.6, Gemini 3.7 Flash, гигант Qwen3.8 и дешёвое распознавание речи

Семь новых моделей в GPTIK: Grok 4.6, Gemini 3.7 Flash, гигант Qwen3.8 и дешёвое распознавание речи

14 августа 2026 г. Команда GPTIK

Обновили каталог: флагман Grok 4.6 со ступенчатым тарифом, быстрая Gemini 3.7 Flash, открытый гигант Qwen3.8 на 2,4 триллиона параметров, DeepSeek V4 Pro 0813 по старой цене и посекундная транскрибация Qwen3 ASR. Разбираем, что умеет каждая и кому пригодится.

Новые модели в GPTIK: Grok 4.6, Qwen3.8 и дешёвая расшифровка аудио

Новые модели в GPTIK: Grok 4.6, Qwen3.8 и дешёвая расшифровка аудио

13 августа 2026 г. Команда GPTIK

Добавили в каталог пять моделей: флагман SpaceXAI для долгих агентных прогонов, открытый Qwen3.8 на 2,4 триллиона параметров, вышедший из preview DeepSeek V4 Pro и две модели распознавания речи, которые дешевле Whisper в 13 и 30 раз.

Qwen3.7 Flash и пакетный Gemini: две новые модели в каталоге

Qwen3.7 Flash и пакетный Gemini: две новые модели в каталоге

29 июля 2026 г. Команда GPTIK

Добавили Qwen3.7 Flash — дешёвую мультимодальную модель с контекстом в миллион токенов и ступенчатым ценником, и пакетный режим Gemini 3.6 Flash, который считает вдвое дешевле обычного. Разбираем, что они умеют и кому пригодятся.

Пересчитали цены: DeepSeek, Kimi и Qwen3 VL подешевели

Пересчитали цены: DeepSeek, Kimi и Qwen3 VL подешевели

13 августа 2026 г. Команда GPTIK

Снизили цены на три модели, у Qwen3 VL выход подешевел почти вдвое. Заодно рассказываем, что случилось с GLM 5.2: акция закончилась, но новый тариф вышел ниже, чем был до неё.

Новые модели в GPTIK: Qwen3.8 Max и GPT Transcribe

Новые модели в GPTIK: Qwen3.8 Max и GPT Transcribe

9 августа 2026 г. Команда GPTIK

Добавили в каталог флагман Alibaba на 2,4 триллиона параметров с контекстом в миллион токенов и новое распознавание речи от OpenAI, которое стало точнее и дешевле прошлого поколения. Разбираем, что они умеют и где реально пригодятся.