• Виктор
  • Блог
  • 3 мин. чтения

Grok научился расшифровывать речь вдвое точнее и за те же деньги


SpaceXAI выпустила Grok Voice Transcribe 2.0, модель для перевода речи в текст. По внутренним тестам компании она вдвое точнее первой версии на телефонных звонках, диктовке номеров и коротких голосовых командах, а стоит столько же. Модель уже доступна в API и понимает русский язык.

Grok научился расшифровывать речь вдвое точнее и за те же деньги

Grok Voice Transcribe — сервис распознавания речи от SpaceXAI, компании Илона Маска, которая выпускает Grok. Он превращает аудио и видео в текст и работает через API, то есть встраивается в чужие продукты, например в колл-центры, видеосервисы и голосовых ассистентов. Вторая версия вышла 18 сентября и сразу доступна разработчикам.

Звонки, акценты и продиктованные адреса

Grok Voice Transcribe 2.0 собрана на той же аудиомодели, что и голосовой режим Grok. По данным SpaceXAI, эта основа уже обслуживает десятки тысяч звонков в поддержку в день, расшифровала миллионы часов закадрового текста в видео и работает в ассистенте Grok в автомобилях Tesla.

Дообучали модель на «грязном» живом звуке. Это телефонная линия с плохим качеством, фоновый шум, акценты, люди, которые говорят одновременно, и самое неудобное для любой расшифровки — продиктованные номера телефонов, адреса почты и короткие команды вроде «включи музыку». Именно на таких сценариях SpaceXAI и замеряла прирост.

Вдвое точнее, но по своим тестам

Компания сравнила версии на четырёх наборах записей из реального трафика. В них вошли звонки в поддержку, разговоры с Grok, диктовка учётных данных и короткие фразы для голосового ассистента. Вторая версия выиграла у первой на всех четырёх, а на телефонии, по словам SpaceXAI, обошла все модели, которые компания тестировала.

Точная цифра в анонсе одна. На коротких фразах на 19 языках доля ошибочно распознанных слов (WER, главный показатель качества расшифровки) упала с 20,6% до 6,8%. Остальные результаты показаны только на графиках, и все четыре набора собраны внутри компании.

Для внешней проверки SpaceXAI ссылается на рейтинг Artificial Analysis, где Grok Voice Transcribe 2.0 заняла первое место по точности среди 32 моделей потоковой расшифровки. В соседней таблице того же рейтинга, где сравнивают расшифровку готовых файлов, картина скромнее. Там у модели 2,3% ошибок и пятое место из 61, впереди модели Alibaba, Microsoft и ElevenLabs с результатом от 1,7% до 2,2%. Если верить заявлению компании, в потоковой расшифровке Grok лидирует, а в обработке записей держится в сильной группе.

Русский в списке из 25 языков

Самый большой прирост SpaceXAI записывает на счёт многоязычности. Grok Voice Transcribe 2.0 сама определяет язык записи и замечает, когда собеседник переходит на другой прямо посреди разговора. Точного числа языков в анонсе нет, но в документации перечислены 25, и русский среди них есть.

Функции Grok Voice Transcribe без доплаты

  • Два режима. Расшифровка готовых файлов и ссылок либо потоковая, в реальном времени.
  • Разметка по спикерам. Модель помечает, какую реплику произнёс какой человек, это входит в базовую цену.
  • Время каждого слова. У каждого слова есть отметки начала и конца, удобно для субтитров и поиска по записи.
  • До восьми каналов. Каждая дорожка расшифровывается отдельно, например оператор и клиент в записи звонка.
  • Словарь терминов. До 100 слов на запрос, которые модель должна узнавать точно, от названий продуктов до медицинской лексики.
  • Чистый текст. Числа, даты, суммы, телефоны и адреса почты приходят в письменном виде, слова-паразиты вроде «эм» убираются.
  • Конец реплики. Для голосовых агентов модель определяет, договорил ли человек, чтобы ассистент не перебивал.

В анонсе обещаны и оценки уверенности для каждого слова, но в примере ответа из документации такого поля пока нет. Тем, кому оно важно, стоит проверить на своих записях.

Loom передаёт расшифровку прямо в Cursor

Первым крупным клиентом SpaceXAI называет Atlassian. Компания перевела на Grok Voice Transcribe 2.0 расшифровку всех видео в Loom, сервисе коротких записей экрана, потому что новая модель оказалась точнее прежнего решения. Сценарий выглядит так. Разработчик надиктовывает в Loom план изменений, расшифровка уходит в редактор кода Cursor , и тот сам правит программу.

«Grok отвечает за распознавание речи в Loom, Cursor превращает его в код, и мы замыкаем цикл от контекста до кода. Записываешь, что имеешь в виду, и работа сделана»,

– говорит Санчан Саксена, старший вице-президент Atlassian.

Час записи за десять центов

Цены остались прежними. Расшифровка готовых файлов стоит 0,10 доллара за час аудио, потоковая 0,20 доллара, разметка спикеров, временные метки и словарь терминов включены. В пересчёте Artificial Analysis это 1,67 доллара за тысячу минут записи.

Модель уже работает в Speech-to-Text API под именем grok-voice-transcribe-2.0. По умолчанию API пока отдаёт первую версию, вторая станет основной «в ближайшее время», а первую отключат в течение нескольких недель. Точных дат SpaceXAI не называет. Кто уже подключён, получит прирост точности без правок в коде, когда смена произойдёт.

Как попробовать Grok Voice Transcribe 2.0

Живую демонстрацию и ключи дают в консоли разработчика console.x.ai. Для проверки второй версии до смены умолчания модель нужно указать в запросе явно. API принимает файлы до 500 МБ в 12 форматах, включая MP3, WAV, OGG, MP4 и M4A. Для оплаты из России, как и с другими зарубежными API, понадобится иностранная карта. Готового приложения для обычного пользователя у сервиса нет, это инструмент для тех, кто встраивает расшифровку в свой продукт или автоматизацию.

Кому Grok Voice Transcribe 2.0 пригодится

Для владельцев сайтов и авторов практический смысл в цене. Расшифровка часового интервью или вебинара обходится в десять центов, и это делает автоматический перевод видео в статьи, субтитры и конспекты почти бесплатным. Прежде чем переводить на Grok поток русскоязычных записей, стоит прогнать пару своих файлов. Громкие цифры SpaceXAI получены в основном на английском, а по русскому отдельных результатов нет.

Сильна там, где звонят и диктуют

В обработке записей Grok Voice Transcribe 2.0 уступает лидерам, зато хорошо закрывает свою нишу. Модель сильна там, где звук плохой, а ошибка в одной цифре телефона обходится дороже всего остального текста. В паре с низкой ценой это серьёзная заявка на колл-центры и голосовых агентов. Проверкой станут ближайшие недели, когда вторая версия станет стандартом для всех клиентов API и её начнут сравнивать на чужих записях.

Источник:
SpaceXAI — Introducing Grok Voice Transcribe 2.0



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Как пользоваться Nano Banana 2 Lite бесплатно — гайд

Недавно Google выпустил нейросеть Nano Banana 2 Lite — облегчённую версию генератора изображений на базе Gemini. ИИ-модель быстро...

Perplexity встроила слайдер вычислительных усилий в агентный сервис Computer

Perplexity добавила слайдер управления вычислительными усилиями в агентный сервис Computer. Пользователи веб-версии платформы могут выбирать глубину рассуждений и...

Anthropic выпустила Claude Opus 5.5 — модель стала быстрее и дешевле 

Anthropic выпустила Claude Opus 5.5 для Claude, Claude Code и Claude Platform. Новая модель генерирует ответы более чем...

Sora 2 увеличила длину видео до 25 секунд и позволила прописывать сценарий по кадрам

Компания OpenAI обновила видеогенератор «Sora 2»: базовые пользователи теперь могут создавать ролики до 15 секунд, а подписчики «ChatGPT...

Grok 4.7 обогнал более дорогих конкурентов в юридических задачах

SpaceXAI выпустила Grok 4.7 - флагманскую модель для программирования и долгой рабочей рутины. Она заметно прибавила против Grok...

Gemini взломала три компании на испытаниях и остановилась сама

Gemini во время майских кибериспытаний вошла в системы трёх реальных компаний. В одном случае модель подобрала пароль, в...

YouTube запустил генерацию видео с помощью Veo 2 для Shorts

YouTube представил новую функцию для генерации коротких роликов в Shorts, интегрировав ИИ-модель Veo 2 от Google в инструмент...

Яндекс сводит аналитику данных в одну платформу

Yandex B2B Tech анонсировала DataLens Platform, платформу для работы с корпоративными данными от загрузки и хранения до отчётов...

Alibaba выложила Qwen-Image-2.1 – картинки с прозрачным фоном из коробки

Команда Qwen выложила в открытый доступ Qwen-Image-2.1 - модель, которая рисует изображения сразу с прозрачным фоном и правит...

DeepSeek представила DeepSeek-OCR — новую модель для сжатия визуального контекста в LLM

Компания DeepSeek показала DeepSeek-OCR — OCR-модель, созданную специально для больших языковых моделей. Вместо обычного распознавания текста она сжимает...

ElevenLabs открыла общий доступ к Eleven v3 Conversational

ElevenLabs открыла общий доступ к Eleven v3 Conversational — модели синтеза речи для диалогов в реальном времени. Она...

Google довела ролики Gemini Omni до сорока секунд и сделала черновики втрое дешевле

Gemini Omni 1.1 Flash научилась достраивать снятую сцену продолжениями и доводить ролик до сорока секунд, а перед чистовой...

Sakana Fugu: ИИ, который учится управлять другими ИИ

22 июня 2026 года японская лаборатория Sakana AI (Токио) представила свой новый коммерческий продукт под названием Sakana Fugu....

Вышла новая ChatGPT Images 2.5 которая правит картинку по комментариям и наброску

OpenAI выпустила ChatGPT Images 2.5 - обновление генератора картинок с правками по комментариям прямо на изображении, режимом рисования...

Стал известен размер экрана iPhone 20 Pro и Pro Max

В сети появились первые подробности об экранах iPhone 20 Pro и iPhone 20 Pro Max. По данным инсайдера...

Google запускает Nano Banana – новая эра редактирования изображений

Google представила модель искусственного интеллекта Nano Banana - предварительную версию Gemini 2.5 Flash Image, которая уже доступна пользователям...

ElevenLabs выпустила Music v2.5 с улучшенным звуком и точным следованием запросу

ElevenLabs представила Music v2.5 — новую версию модели для генерации музыки. Она создаёт более многослойные композиции, точнее следует...

Нейросеть Sora 2: как пользоваться, где взять инвайт, возможности, как скачать

OpenAI представила Sora 2 — новую версию своей видеомодели, которая автоматически генерирует короткие ролики со звуком и синхронной...

Suno выпустила бесплатную модель «v4.5-all» — нейросеть создаёт топовую музыку и вокал

Нейросеть Suno AI официально заменила старую модель «v3.5» на более новую «v4.5-all» в бесплатной версии сервиса. Теперь пользователи...

Сверхработоспособный Qwen 3.7 Max. Китайский ИИ, который трудится 35 часов без остановки

Среди всего того, что Alibaba представила на своем облачном саммите в мае 2026 года, флагманская языковая модель Qwen...