Новые модели в GPTIK: Grok 4.6, Qwen3.8 и дешёвая расшифровка аудио

Пополнение сразу на пять моделей, и поводы тут разные. Сверху флагман для агентов и кода, следом две большие модели с открытыми весами и контекстом в миллион токенов. А расшифровка аудио подешевела так, что цифры проще показать, чем объяснить: час записи теперь стоит меньше двух рублей.
Grok 4.6: 61 балл по индексу качества и 500 тысяч контекста
SpaceXAI выложила модель 12 августа. Заявка простая: долгие агентные прогоны. Исследовать тему в много шагов, разбираться в большой кодовой базе, доводить сырую продуктовую идею до рабочего прототипа.
Контекст 500 тысяч токенов. На вход идут картинки и файлы, вызов функций на месте.
По независимому индексу Artificial Analysis модель набирает 61 балл. Столько же у GPT-5.6 Sol, на балл больше у Claude Fable 5. То есть Grok 4.6 сидит вплотную к верхушке.
Прогресс относительно Grok 4.5 виден там, где он важнее всего для агентных сценариев. DeepSWE, правка кода прямо в репозитории: было 54, стало 65,9. APEX-Agents: было 47,1, стало 57,5. Подробный разбор бенчмарков вышел на DEV, цифры оттуда.
Тариф ступенчатый, и это важно
Здесь важный момент, на котором легко просчитаться.
До 200 тысяч токенов в запросе цена такая: 300 ₽ за миллион входных, 900 ₽ за миллион выходных. Дальше срабатывает вторая ступень: 600 ₽ и 1800 ₽ соответственно, чтение из кеша 150 ₽ за миллион.
Ключевое: ступень применяется ко всему запросу целиком, вместе с ответом. Не к хвосту, который вылез за порог, а ко всему. Перевалили за 200 тысяч, значит весь запрос пересчитывается по удвоенному тарифу. Контекст в 500 тысяч у модели есть, но верхняя его половина обходится вдвое дороже, чем кажется по базовой цене.
Qwen3.8 2.4T A95B: Qwen-Max с открытыми весами
Alibaba впервые отдала в открытые веса модель своего флагманского класса. Раньше линейка Qwen-Max была закрытой.
Архитектура разреженная MoE: 2,4 триллиона параметров всего, 95 миллиардов активируются на токен. Нативный контекст 262 тысячи, растянут до миллиона. Максимум ответа 52 тысячи токенов. Внутри интересная смесь: линейное внимание Gated DeltaNet чередуется с обычным gated attention.
Цена: 300 ₽ за миллион входа, 900 ₽ за миллион выхода. Ступеней нет, от длины запроса не растёт, и в этом её преимущество перед Grok 4.6 на длинных промптах.
Построена на базе Qwen3.5, прирост заявлен в коде, ресёрче и долгих агентных задачах. Формулировка из карточки модели показательна: упор не на то, чтобы отвечать на более сложные вопросы, а на то, чтобы доводить многошаговые задачи до конца и не разваливаться на середине.
DeepSeek V4 Pro 0813 вышел из preview
Флагман DeepSeek получил официальный статус. В июле то же самое произошло с младшей Flash-моделью, теперь очередь дошла до старшей.
Масштаб: 1,6 триллиона параметров, около 49 миллиардов активных, предобучение больше чем на 32 триллионах токенов. Гибридное внимание сделано ровно затем, чтобы инференс на длинном контексте не разорял. Контекст 1 048 576 токенов, ответ до 384 тысяч, пишет GMI Cloud.
Цена в GPTIK: 65,25 ₽ за миллион входа, 130,5 ₽ за миллион выхода. Это в 4,6 раза дешевле Grok 4.6 на входе и почти в 7 раз на выходе. При 53 баллах индекса качества, это второй результат среди моделей с открытыми весами после Kimi K3.
Одна оговорка, о которой честнее сказать сразу. DeepSeek предупредила, что собирается заметно поднять цены на свой API. Ни ставок, ни даты пока не назвали, писал об этом Wccftech. Так что нынешний ценник, скорее всего, временный.
На графике видно, куда встают обе новинки. Grok 4.6 с 61 баллом входит в первую четвёрку рядом с Claude Opus 5, Claude Fable 5 и GPT-5.6 Sol. DeepSeek V4 Pro 0813 с 53 баллами держится вровень с GLM-5.2 и обходит по этому показателю GPT-5.6 Luna и Gemini 3.6 Flash, при цене в разы ниже.
Индекс качества актуальных моделей. По данным сайта artificialanalysis.ai.
Две модели распознавания речи: расшифровка подешевела в разы
Если вы расшифровываете созвоны, интервью или подкасты, дальше про деньги.
Добавили Qwen3 ASR в двух размерах, 1.7B и 0.6B. Обе только переводят речь в текст, в чате не работают. Поддерживают 52 языка и диалекта, включая 22 китайских, обучены на базе аудио-модели Qwen3-Omni.
Теперь цифры. Час записи:
| Модель | За минуту | За час |
|---|---|---|
| Whisper (OpenAI) | 0,9 ₽ | ≈ 54 ₽ |
| Qwen3 ASR 1.7B | 0,07 ₽ | ≈ 4 ₽ |
| Qwen3 ASR 0.6B | 0,03 ₽ | ≈ 1,8 ₽ |
Тринадцать раз и тридцать раз дешевле Whisper соответственно. Не проценты, а порядок.
При этом 1.7B, по техническому отчёту Qwen, показывает лучший результат среди ASR-моделей с открытым кодом и тягается с сильнейшими проприетарными API. Версия 0.6B берёт другим: время до первого токена от 92 мс, а при 128 параллельных запросах она расшифровывает 2000 секунд речи за секунду. То есть годится и для потоковой расшифровки на лету, и для того, чтобы разом прогнать архив записей за пару лет.
Обе умеют и потоковый режим, и оффлайн.
Кому что брать
Нужен агент, который сутками ковыряет большой репозиторий, и бюджет позволяет верхнюю планку? Grok 4.6. Только держите в голове порог в 200 тысяч токенов, за ним счётчик крутится вдвое быстрее.
Qwen3.8 2.4T A95B удобнее, когда промпты стабильно длинные. Цена ровная, миллион контекста на месте, сюрпризов на длинных запросах не будет.
А вот DeepSeek V4 Pro 0813 берут за другое: очень много модели за очень скромные деньги, плюс ответ до 384 тысяч токенов, что для отчётов и переводов целых книг решает. С поправкой на обещанное подорожание.
Про ASR даже думать особо не о чем. Если аудио идёт потоком, экономия перестаёт быть строчкой в смете и становится видна в счёте за месяц.
Все пять уже в каталоге. Оплата в рублях с баланса, отдельных подписок заводить не нужно.





