Назад к статьям

Grok STT 1.0 в GPTIK: распознавание речи за 15 рублей в час

Команда GPTIK
Grok STT 1.0 в GPTIK: распознавание речи за 15 рублей в час

Добавили в каталог новую модель - Grok STT 1.0 от SpaceXAI (это команда, которая делает Grok). Модель переводит аудио в текст: созвоны, подкасты, лекции, телефонные разговоры. Час записи обойдётся в 15 рублей.

Что за модель

STT расшифровывается как speech-to-text: загружаете аудио, на выходе получаете текст. Казалось бы, задача давно решённая, Whisper с ней справляется уже несколько лет. Но у Grok STT есть пара козырей:

  • Метки времени по словам. Каждое слово привязано к секунде записи, из этого собираются субтитры без ручной возни.
  • Диаризация спикеров: модель сама разбирается, кто из участников что сказал. Для протоколов встреч незаменимая вещь.
  • Многоканальный звук. Телефония пишет каждого собеседника в отдельную дорожку - модель это понимает и не путает голоса.
  • Числа, даты и суммы приводятся к нормальному письменному виду: «двадцать пятого мая» превращается в «25 мая», а не остаётся словесной кашей.

В анонсе SpaceXAI пишет, что модель построена на том же стеке, который работает в голосовом Grok, машинах Tesla и поддержке Starlink. То есть это не лабораторный прототип, а система, которая уже перемалывает тысячи часов живой речи каждый день. Форматов аудио поддерживается 12, файлы - до 500 МБ, языков - больше 25, русский в их числе.

Насколько точно распознаёт

Сама SpaceXAI приводит такие цифры: на распознавании сущностей в телефонных звонках (имена, номера, адреса) Grok STT ошибается в 5% случаев против 12% у ElevenLabs и 13.5% у Deepgram. На видео и подкастах - 2.4%, наравне с ElevenLabs. Это заявления вендора, к ним полагается скепсис: свои бенчмарки все рисуют красиво.

Поэтому полезнее независимый замер artificialanalysis.ai: там у Grok STT индекс ошибок 4.0%. Для сравнения: Whisper Large v3 - 4.1%, Deepgram Nova-3 - 5.2%, ElevenLabs Scribe v2 - 2.2%. Точность на уровне Whisper, до ElevenLabs не дотягивает. А теперь цены: ElevenLabs просит $3.67 за тысячу минут распознавания, Grok - $1.67. Вдвое дешевле при разнице в пару процентов ошибок.

На графике - соотношение точности и цены у популярных STT-моделей: чем ниже и левее точка, тем модель точнее и дешевле. Зелёная зона - выгодный квадрант. Точка SpaceXAI сидит как раз там, рядом с Whisper, только точность чуть лучше.

Word Error Rate против цены за 1000 минут аудио. По данным сайта artificialanalysis.ai.

Сколько стоит в GPTIK

15 рублей за час аудио. Тарификация по длительности записи, токены считать не нужно.

Для сравнения: whisper-1 в нашем каталоге стоит 0.9 ₽ за минуту, то есть 54 рубля за тот же час. Grok STT дешевле в три с половиной раза при сопоставимой точности.

Что это значит на практике: расшифровка часового созвона - 15 рублей. Месяц ежедневных часовых встреч - около 450 рублей. Архив подкаста на сто выпусков - полторы тысячи. Раньше такие объёмы отдавали расшифровщикам на аутсорс совсем за другие деньги.

Кому пригодится

  • Транскрибация созвонов и интервью с разбивкой по спикерам: протокол встречи собирается из готового текста.
  • Субтитры к видео - метки времени по словам дают точную синхронизацию.
  • Колл-центрам. Многоканальный звук плюс сильное распознавание имён и номеров - ровно тот сценарий, где вендор показывает самый большой отрыв от конкурентов.
  • Массовая обработка аудиоархивов, которую раньше было дорого даже начинать.

Модель уже доступна в каталоге по имени grok-stt-1.0, оплата в рублях с баланса GPTIK. Заходите и пробуйте.

Семь новых моделей в GPTIK: Grok 4.6, Gemini 3.7 Flash, гигант Qwen3.8 и дешёвое распознавание речи

Семь новых моделей в GPTIK: Grok 4.6, Gemini 3.7 Flash, гигант Qwen3.8 и дешёвое распознавание речи

14 августа 2026 г. Команда GPTIK

Обновили каталог: флагман Grok 4.6 со ступенчатым тарифом, быстрая Gemini 3.7 Flash, открытый гигант Qwen3.8 на 2,4 триллиона параметров, DeepSeek V4 Pro 0813 по старой цене и посекундная транскрибация Qwen3 ASR. Разбираем, что умеет каждая и кому пригодится.

Новые модели в GPTIK: Grok 4.6, Qwen3.8 и дешёвая расшифровка аудио

Новые модели в GPTIK: Grok 4.6, Qwen3.8 и дешёвая расшифровка аудио

13 августа 2026 г. Команда GPTIK

Добавили в каталог пять моделей: флагман SpaceXAI для долгих агентных прогонов, открытый Qwen3.8 на 2,4 триллиона параметров, вышедший из preview DeepSeek V4 Pro и две модели распознавания речи, которые дешевле Whisper в 13 и 30 раз.

Grok 4.5 в GPTIK: новый флагман SpaceXAI для кода и рассуждений

Grok 4.5 в GPTIK: новый флагман SpaceXAI для кода и рассуждений

9 июля 2026 г. Команда GPTIK

Добавили в каталог Grok 4.5, свежую модель SpaceXAI (создатели Grok). Сильна в коде, рассуждениях и STEM, понимает картинки и файлы, контекст на 500K токенов. Рассказываем, что умеет и сколько стоит.

Новые модели в GPTIK: Qwen3.8 Max и GPT Transcribe

Новые модели в GPTIK: Qwen3.8 Max и GPT Transcribe

9 августа 2026 г. Команда GPTIK

Добавили в каталог флагман Alibaba на 2,4 триллиона параметров с контекстом в миллион токенов и новое распознавание речи от OpenAI, которое стало точнее и дешевле прошлого поколения. Разбираем, что они умеют и где реально пригодятся.

Три новые модели: GLM-5.3-Flash, Qwen3.8 Flash и DeepSeek V4 Flash Vision

Три новые модели: GLM-5.3-Flash, Qwen3.8 Flash и DeepSeek V4 Flash Vision

28 августа 2026 г. Команда GPTIK

Добавили в каталог три мультимодальные модели с контекстом около миллиона токенов. Разбираем, чем они отличаются, где сильны и почему самая дорогая из них не самая умная.

Две новые модели в GPTIK: Qwen3.8 27B и GLM-5.3

Две новые модели в GPTIK: Qwen3.8 27B и GLM-5.3

19 августа 2026 г. Команда GPTIK

Добавили в каталог Qwen3.8 27B, компактную модель, которая видит изображения и видео, и GLM-5.3 с контекстом в миллион токенов для работы с кодом. Рассказываем, что умеют, сколько стоят и кому пригодятся.