Назад к статьям

Grok STT 1.0 в GPTIK: распознавание речи за 15 рублей в час

Команда GPTIK
Grok STT 1.0 в GPTIK: распознавание речи за 15 рублей в час

Добавили в каталог новую модель - Grok STT 1.0 от SpaceXAI (это команда, которая делает Grok). Модель переводит аудио в текст: созвоны, подкасты, лекции, телефонные разговоры. Час записи обойдётся в 15 рублей.

Что за модель

STT расшифровывается как speech-to-text: загружаете аудио, на выходе получаете текст. Казалось бы, задача давно решённая, Whisper с ней справляется уже несколько лет. Но у Grok STT есть пара козырей:

  • Метки времени по словам. Каждое слово привязано к секунде записи, из этого собираются субтитры без ручной возни.
  • Диаризация спикеров: модель сама разбирается, кто из участников что сказал. Для протоколов встреч незаменимая вещь.
  • Многоканальный звук. Телефония пишет каждого собеседника в отдельную дорожку - модель это понимает и не путает голоса.
  • Числа, даты и суммы приводятся к нормальному письменному виду: «двадцать пятого мая» превращается в «25 мая», а не остаётся словесной кашей.

В анонсе SpaceXAI пишет, что модель построена на том же стеке, который работает в голосовом Grok, машинах Tesla и поддержке Starlink. То есть это не лабораторный прототип, а система, которая уже перемалывает тысячи часов живой речи каждый день. Форматов аудио поддерживается 12, файлы - до 500 МБ, языков - больше 25, русский в их числе.

Насколько точно распознаёт

Сама SpaceXAI приводит такие цифры: на распознавании сущностей в телефонных звонках (имена, номера, адреса) Grok STT ошибается в 5% случаев против 12% у ElevenLabs и 13.5% у Deepgram. На видео и подкастах - 2.4%, наравне с ElevenLabs. Это заявления вендора, к ним полагается скепсис: свои бенчмарки все рисуют красиво.

Поэтому полезнее независимый замер artificialanalysis.ai: там у Grok STT индекс ошибок 4.0%. Для сравнения: Whisper Large v3 - 4.1%, Deepgram Nova-3 - 5.2%, ElevenLabs Scribe v2 - 2.2%. Точность на уровне Whisper, до ElevenLabs не дотягивает. А теперь цены: ElevenLabs просит $3.67 за тысячу минут распознавания, Grok - $1.67. Вдвое дешевле при разнице в пару процентов ошибок.

На графике - соотношение точности и цены у популярных STT-моделей: чем ниже и левее точка, тем модель точнее и дешевле. Зелёная зона - выгодный квадрант. Точка SpaceXAI сидит как раз там, рядом с Whisper, только точность чуть лучше.

Word Error Rate против цены за 1000 минут аудио. По данным сайта artificialanalysis.ai.

Сколько стоит в GPTIK

15 рублей за час аудио. Тарификация по длительности записи, токены считать не нужно.

Для сравнения: whisper-1 в нашем каталоге стоит 0.9 ₽ за минуту, то есть 54 рубля за тот же час. Grok STT дешевле в три с половиной раза при сопоставимой точности.

Что это значит на практике: расшифровка часового созвона - 15 рублей. Месяц ежедневных часовых встреч - около 450 рублей. Архив подкаста на сто выпусков - полторы тысячи. Раньше такие объёмы отдавали расшифровщикам на аутсорс совсем за другие деньги.

Кому пригодится

  • Транскрибация созвонов и интервью с разбивкой по спикерам: протокол встречи собирается из готового текста.
  • Субтитры к видео - метки времени по словам дают точную синхронизацию.
  • Колл-центрам. Многоканальный звук плюс сильное распознавание имён и номеров - ровно тот сценарий, где вендор показывает самый большой отрыв от конкурентов.
  • Массовая обработка аудиоархивов, которую раньше было дорого даже начинать.

Модель уже доступна в каталоге по имени grok-stt-1.0, оплата в рублях с баланса GPTIK. Заходите и пробуйте.

Grok 4.5 в GPTIK: новый флагман SpaceXAI для кода и рассуждений

Grok 4.5 в GPTIK: новый флагман SpaceXAI для кода и рассуждений

9 июля 2026 г. Команда GPTIK

Добавили в каталог Grok 4.5, свежую модель SpaceXAI (создатели Grok). Сильна в коде, рассуждениях и STEM, понимает картинки и файлы, контекст на 500K токенов. Рассказываем, что умеет и сколько стоит.

Claude Opus 5 и свежие Gemini в GPTIK: от флагмана до модели за 45 ₽

Claude Opus 5 и свежие Gemini в GPTIK: от флагмана до модели за 45 ₽

27 июля 2026 г. Команда GPTIK

Добавили в каталог четыре модели: Claude Opus 5 и его быстрый вариант, Gemini 3.6 Flash и Gemini 3.5 Flash Lite. Разбираем, чем они отличаются, что показывают на бенчмарках и под какие задачи брать каждую.

Kimi K3 в GPTIK: гигантская модель для кода и агентов

Kimi K3 в GPTIK: гигантская модель для кода и агентов

21 июля 2026 г. Команда GPTIK

Добавили в каталог MoonshotAI Kimi K3 — многомодальную модель на 2,8 триллиона параметров с контекстом почти в миллион токенов. Рассказываем, что она умеет и кому пригодится.

Новые модели в GPTIK: серия GPT-5.6 от OpenAI (Sol, Terra, Luna)

Новые модели в GPTIK: серия GPT-5.6 от OpenAI (Sol, Terra, Luna)

10 июля 2026 г. Команда GPTIK

Добавили в каталог все шесть моделей серии GPT-5.6: флагманский Sol, сбалансированный Terra, экономичный Luna и их Pro-версии. Рассказываем, что они умеют, сколько стоят и кому пригодятся.

Новые модели в GPTIK: Claude Sonnet 5 и Nano Banana 2 Lite

Новые модели в GPTIK: Claude Sonnet 5 и Nano Banana 2 Lite

1 июля 2026 г. Команда GPTIK

Добавили в каталог две свежие нейросети: мощный Claude Sonnet 5 от Anthropic для кода и агентов и быструю модель генерации картинок Nano Banana 2 Lite от Google. Рассказываем, что умеют и кому пригодятся.

Новые модели генерации изображений в GPTIK: GPT Image 2 и GPT Image 1 Mini

Новые модели генерации изображений в GPTIK: GPT Image 2 и GPT Image 1 Mini

27 июня 2026 г. Команда GPTIK

Добавили в каталог две свежие модели OpenAI для работы с картинками. GPT Image 2 — флагман по качеству, GPT Image 1 Mini — бюджетный вариант для объёма. Рассказываем, что они умеют и кому пригодятся.