Три новые модели: GLM-5.3-Flash, Qwen3.8 Flash и DeepSeek V4 Flash Vision

Добавили в каталог три новые модели: GLM-5.3-Flash от Z.ai, Qwen3.8 Flash от Alibaba и экспериментальную DeepSeek V4 Flash Vision. Все три вышли на одной неделе и оказались похожи по замыслу: миллион токенов контекста, понимание картинок, вызов функций. Каждой можно показать экран и попросить разобраться, что там происходит.
Дальше по порядку, от самой дешёвой к самой дорогой.
GLM-5.3-Flash: 11,25 ₽ за миллион токенов на входе
Самая дешёвая новинка каталога и при этом самая высокая по независимым оценкам. Вход 11,25 ₽ за миллион токенов, выход 37,5 ₽, чтение из кеша 2,25 ₽. Контекст 1 310 720 токенов, ответ до 131 072.
Artificial Analysis ставит модели индекс интеллекта 57: третье место из 110 моделей при медиане 28 по выборке. По их же оценке это уровень Claude Opus 4.8 примерно за десятую часть денег.
Дело в архитектуре. Z.ai впервые в серии GLM смешала два вида внимания: линейное держит локальные связи через компактное состояние, разреженное выборочно достаёт нужное из всего окна. По заявлению разработчика это втрое меньше вычислений на внимание и в 4,4 раза меньший кеш ключей, чем у старшей GLM-5.3. Миллионный контекст перестаёт быть строчкой в спецификации и становится тем, за что не страшно платить.
Ещё деталь: Flash обучали с нуля, на своей архитектуре, мультимодальной с самого начала. Со старшей GLM-5.3 её роднит разве что имя семейства. Веса открыты под лицензией MIT.
На графике GLM-5.3-Flash сравнивают с предыдущей GLM-5.2 и с флагманами: Claude Opus 4.8, GPT-5.6 Terra, Gemini 3.7 Flash. Заодно там есть DeepSeek V4 Vision Exp, вторая наша новинка. На агентных задачах (DeepSWE, AutomationBench) Flash обходит Opus 4.8, на терминальных сценариях идёт вровень, а на GDPVal-AA v2 показывает лучший результат в таблице. Оговорка: пять прогонов из шести разработчик делал сам, своими средствами. Независимо подтверждён только GDPVal-AA v2.
Сравнение GLM-5.3-Flash с другими моделями по шести бенчмаркам. По данным Z.ai.
За что хвалят на практике: соблюдает строгие JSON-схемы, пишет рабочий код, не ведётся на попытки подменить инструкцию прямо в тексте запроса. Заточка понятная: программирование, ревью кода, длинные агентные циклы. Z.ai обучала модель на задачах, где агенту дают кодовую базу с документацией и просят самому найти проблему, внести правку и показать измеримое улучшение.
Минус честный: модель неторопливая. Около 50 токенов в секунду, это 47-е место по скорости. В длинном агентном цикле разница чувствуется.
Qwen3.8 Flash: вдвое дороже, зато видит видео
Вход 22,5 ₽ за миллион токенов, выход 70,5 ₽, чтение из кеша 2,4 ₽. Контекст миллион токенов, ответ до 131 072. Понимает текст, картинки и видео.
Внутри архитектура MoE: около 125 миллиардов параметров, но на каждый токен активируется порядка шести миллиардов. Отсюда и сочетание «умная, но недорогая». Alibaba заявляет, что обучение обошлось примерно в девять раз дешевле, чем у старшей Qwen3.7-Plus, а качество при этом выше, заметнее всего в программировании и офисных задачах.
Здесь нужна оговорка. Опубликованные бенчмарки относятся к варианту с открытыми весами, Qwen3.8-Flash-Next. У нас в каталоге продакшен-версия того же семейства, с миллионным контекстом по умолчанию. Цифры годятся как ориентир, но получены на открытом варианте.
Artificial Analysis даёт индекс 56, четвёртое место из 110 моделей. Решение одной задачи их набора обошлось примерно в десять центов.
Самое интересное в Qwen3.8 Flash даже не кодинг. По цифрам Alibaba самые большие отрывы от Claude Opus 4.6 Max получились на визуальных и агентных задачах: управление интерфейсом телефона 84,5 против 62,0, понимание длинного видео 76,6 против 63,0, вопросы по реальным фотографиям 88,5 против 73,9. Разработчик называет и слабое место: на задачах широкой эрудиции высшего уровня модель отстаёт от Opus.
Инженеры NVIDIA отдельно проверили длинный контекст: на миллионе токенов разреженное внимание ускоряет обработку промпта до 7,6 раза. То есть миллион тут действительно работает.
Куда её ставить: разбор документов и кодовых баз, агент, который ходит по интерфейсам, анализ графиков и длинного видео.
DeepSeek V4 Flash Vision: быстрый отклик и очень длинный ответ
Вход 66 ₽ за миллион токенов, выход 198 ₽, чтение из кеша 2,1 ₽. Контекст 1 048 576 токенов, а вот ответ до 384 000 токенов, заметно больше, чем у двух других новинок. И только эта из трёх не работает с видео: текст и картинки.
Это версия с добавленным зрением поверх текстовой DeepSeek V4 Flash. Разработчик заявлял, что по тексту она просто не хуже базовой. По его же цифрам вышло лучше: vision-версия обгоняет текстовую на шести текстовых бенчмарках из семи.
В таблице одиннадцать бенчмарков двумя группами: текстовые агентные задачи и мультимодальные. Модель обходит Claude Opus 4.8 на трёх из них (DeepSWE, Agents' Last Exam, ZeroBench) и заметно отстаёт на двух: работе с репозиторием целиком и сложных задачах анализа данных. Две строки в мультимодальной группе читайте с поправкой: там базовую текстовую модель сравнивают на задачах, где она в принципе не видит картинок, поэтому разрыв завышен.
Результаты DeepSeek V4 Flash Vision Exp в сравнении с базовой версией и Claude Opus 4.8. По данным DeepSeek.
Artificial Analysis даёт индекс 51, пятое место из 176 моделей, и отдельно отмечает скорость: 117,6 токена в секунду, первый токен приходит через 1,19 секунды при медиане 2,04. Отвечать начинает быстрее большинства.
Теперь про ограничение, о котором лучше знать заранее. Картинки перед обработкой ужимаются примерно до 800×800 пикселей, и любое изображение стоит не больше 384 токенов. Для графиков, диаграмм и общего понимания скриншотов это отлично и дёшево. Для мелкого шрифта на чеке, плотной электрической схемы или показаний аналоговой шкалы плохо: детали просто не доедут.
И слово «экспериментальная» в названии тут не для красоты. Даты версии в идентификаторе нет, поведение может меняться. Строите на ней что-то рабочее, прикройте тестами.
Как выбирать
Разброс цен между новинками почти шестикратный: 11,25 ₽ у GLM против 66 ₽ у DeepSeek за вход. А по независимому индексу интеллекта они стоят рядом: 57, 56 и 51. Дороже здесь не значит умнее.
Есть и общая черта, которая влияет на бюджет. Все три модели многословны: на одном и том же наборе задач они выдают заметно больше выходных токенов, чем средняя модель, иногда вдвое. Поэтому считать имеет смысл не цену за токен, а стоимость решённой задачи. Разница выходит ощутимая.
Если совсем коротко. GLM-5.3-Flash берите, когда важна цена и работа с кодом, а лишние секунды ожидания терпимы. Qwen3.8 Flash нужен там, где есть видео, скриншоты интерфейсов и агент с инструментами. А DeepSeek V4 Flash Vision выигрывает, когда нужен быстрый отклик и очень длинный ответ, и когда картинки это графики и схемы, а не мелкий шрифт.
Все три уже в каталоге, оплата в рублях с баланса GPTIK. Заходите и пробуйте.





