Grok STT 1.0 в GPTIK: распознавание речи за 15 рублей в час

Добавили в каталог новую модель - Grok STT 1.0 от SpaceXAI (это команда, которая делает Grok). Модель переводит аудио в текст: созвоны, подкасты, лекции, телефонные разговоры. Час записи обойдётся в 15 рублей.
Что за модель
STT расшифровывается как speech-to-text: загружаете аудио, на выходе получаете текст. Казалось бы, задача давно решённая, Whisper с ней справляется уже несколько лет. Но у Grok STT есть пара козырей:
- Метки времени по словам. Каждое слово привязано к секунде записи, из этого собираются субтитры без ручной возни.
- Диаризация спикеров: модель сама разбирается, кто из участников что сказал. Для протоколов встреч незаменимая вещь.
- Многоканальный звук. Телефония пишет каждого собеседника в отдельную дорожку - модель это понимает и не путает голоса.
- Числа, даты и суммы приводятся к нормальному письменному виду: «двадцать пятого мая» превращается в «25 мая», а не остаётся словесной кашей.
В анонсе SpaceXAI пишет, что модель построена на том же стеке, который работает в голосовом Grok, машинах Tesla и поддержке Starlink. То есть это не лабораторный прототип, а система, которая уже перемалывает тысячи часов живой речи каждый день. Форматов аудио поддерживается 12, файлы - до 500 МБ, языков - больше 25, русский в их числе.
Насколько точно распознаёт
Сама SpaceXAI приводит такие цифры: на распознавании сущностей в телефонных звонках (имена, номера, адреса) Grok STT ошибается в 5% случаев против 12% у ElevenLabs и 13.5% у Deepgram. На видео и подкастах - 2.4%, наравне с ElevenLabs. Это заявления вендора, к ним полагается скепсис: свои бенчмарки все рисуют красиво.
Поэтому полезнее независимый замер artificialanalysis.ai: там у Grok STT индекс ошибок 4.0%. Для сравнения: Whisper Large v3 - 4.1%, Deepgram Nova-3 - 5.2%, ElevenLabs Scribe v2 - 2.2%. Точность на уровне Whisper, до ElevenLabs не дотягивает. А теперь цены: ElevenLabs просит $3.67 за тысячу минут распознавания, Grok - $1.67. Вдвое дешевле при разнице в пару процентов ошибок.
На графике - соотношение точности и цены у популярных STT-моделей: чем ниже и левее точка, тем модель точнее и дешевле. Зелёная зона - выгодный квадрант. Точка SpaceXAI сидит как раз там, рядом с Whisper, только точность чуть лучше.
Word Error Rate против цены за 1000 минут аудио. По данным сайта artificialanalysis.ai.
Сколько стоит в GPTIK
15 рублей за час аудио. Тарификация по длительности записи, токены считать не нужно.
Для сравнения: whisper-1 в нашем каталоге стоит 0.9 ₽ за минуту, то есть 54 рубля за тот же час. Grok STT дешевле в три с половиной раза при сопоставимой точности.
Что это значит на практике: расшифровка часового созвона - 15 рублей. Месяц ежедневных часовых встреч - около 450 рублей. Архив подкаста на сто выпусков - полторы тысячи. Раньше такие объёмы отдавали расшифровщикам на аутсорс совсем за другие деньги.
Кому пригодится
- Транскрибация созвонов и интервью с разбивкой по спикерам: протокол встречи собирается из готового текста.
- Субтитры к видео - метки времени по словам дают точную синхронизацию.
- Колл-центрам. Многоканальный звук плюс сильное распознавание имён и номеров - ровно тот сценарий, где вендор показывает самый большой отрыв от конкурентов.
- Массовая обработка аудиоархивов, которую раньше было дорого даже начинать.
Модель уже доступна в каталоге по имени grok-stt-1.0, оплата в рублях с баланса GPTIK. Заходите и пробуйте.





