• Виктор
  • Блог
  • 3 мин. чтения

Grok научился расшифровывать речь вдвое точнее и за те же деньги


SpaceXAI выпустила Grok Voice Transcribe 2.0, модель для перевода речи в текст. По внутренним тестам компании она вдвое точнее первой версии на телефонных звонках, диктовке номеров и коротких голосовых командах, а стоит столько же. Модель уже доступна в API и понимает русский язык.

Grok научился расшифровывать речь вдвое точнее и за те же деньги

Grok Voice Transcribe — сервис распознавания речи от SpaceXAI, компании Илона Маска, которая выпускает Grok. Он превращает аудио и видео в текст и работает через API, то есть встраивается в чужие продукты, например в колл-центры, видеосервисы и голосовых ассистентов. Вторая версия вышла 18 сентября и сразу доступна разработчикам.

Звонки, акценты и продиктованные адреса

Grok Voice Transcribe 2.0 собрана на той же аудиомодели, что и голосовой режим Grok. По данным SpaceXAI, эта основа уже обслуживает десятки тысяч звонков в поддержку в день, расшифровала миллионы часов закадрового текста в видео и работает в ассистенте Grok в автомобилях Tesla.

Дообучали модель на «грязном» живом звуке. Это телефонная линия с плохим качеством, фоновый шум, акценты, люди, которые говорят одновременно, и самое неудобное для любой расшифровки — продиктованные номера телефонов, адреса почты и короткие команды вроде «включи музыку». Именно на таких сценариях SpaceXAI и замеряла прирост.

Вдвое точнее, но по своим тестам

Компания сравнила версии на четырёх наборах записей из реального трафика. В них вошли звонки в поддержку, разговоры с Grok, диктовка учётных данных и короткие фразы для голосового ассистента. Вторая версия выиграла у первой на всех четырёх, а на телефонии, по словам SpaceXAI, обошла все модели, которые компания тестировала.

Точная цифра в анонсе одна. На коротких фразах на 19 языках доля ошибочно распознанных слов (WER, главный показатель качества расшифровки) упала с 20,6% до 6,8%. Остальные результаты показаны только на графиках, и все четыре набора собраны внутри компании.

Для внешней проверки SpaceXAI ссылается на рейтинг Artificial Analysis, где Grok Voice Transcribe 2.0 заняла первое место по точности среди 32 моделей потоковой расшифровки. В соседней таблице того же рейтинга, где сравнивают расшифровку готовых файлов, картина скромнее. Там у модели 2,3% ошибок и пятое место из 61, впереди модели Alibaba, Microsoft и ElevenLabs с результатом от 1,7% до 2,2%. Если верить заявлению компании, в потоковой расшифровке Grok лидирует, а в обработке записей держится в сильной группе.

Русский в списке из 25 языков

Самый большой прирост SpaceXAI записывает на счёт многоязычности. Grok Voice Transcribe 2.0 сама определяет язык записи и замечает, когда собеседник переходит на другой прямо посреди разговора. Точного числа языков в анонсе нет, но в документации перечислены 25, и русский среди них есть.

Функции Grok Voice Transcribe без доплаты

  • Два режима. Расшифровка готовых файлов и ссылок либо потоковая, в реальном времени.
  • Разметка по спикерам. Модель помечает, какую реплику произнёс какой человек, это входит в базовую цену.
  • Время каждого слова. У каждого слова есть отметки начала и конца, удобно для субтитров и поиска по записи.
  • До восьми каналов. Каждая дорожка расшифровывается отдельно, например оператор и клиент в записи звонка.
  • Словарь терминов. До 100 слов на запрос, которые модель должна узнавать точно, от названий продуктов до медицинской лексики.
  • Чистый текст. Числа, даты, суммы, телефоны и адреса почты приходят в письменном виде, слова-паразиты вроде «эм» убираются.
  • Конец реплики. Для голосовых агентов модель определяет, договорил ли человек, чтобы ассистент не перебивал.

В анонсе обещаны и оценки уверенности для каждого слова, но в примере ответа из документации такого поля пока нет. Тем, кому оно важно, стоит проверить на своих записях.

Loom передаёт расшифровку прямо в Cursor

Первым крупным клиентом SpaceXAI называет Atlassian. Компания перевела на Grok Voice Transcribe 2.0 расшифровку всех видео в Loom, сервисе коротких записей экрана, потому что новая модель оказалась точнее прежнего решения. Сценарий выглядит так. Разработчик надиктовывает в Loom план изменений, расшифровка уходит в редактор кода Cursor , и тот сам правит программу.

«Grok отвечает за распознавание речи в Loom, Cursor превращает его в код, и мы замыкаем цикл от контекста до кода. Записываешь, что имеешь в виду, и работа сделана»,

– говорит Санчан Саксена, старший вице-президент Atlassian.

Час записи за десять центов

Цены остались прежними. Расшифровка готовых файлов стоит 0,10 доллара за час аудио, потоковая 0,20 доллара, разметка спикеров, временные метки и словарь терминов включены. В пересчёте Artificial Analysis это 1,67 доллара за тысячу минут записи.

Модель уже работает в Speech-to-Text API под именем grok-voice-transcribe-2.0. По умолчанию API пока отдаёт первую версию, вторая станет основной «в ближайшее время», а первую отключат в течение нескольких недель. Точных дат SpaceXAI не называет. Кто уже подключён, получит прирост точности без правок в коде, когда смена произойдёт.

Как попробовать Grok Voice Transcribe 2.0

Живую демонстрацию и ключи дают в консоли разработчика console.x.ai. Для проверки второй версии до смены умолчания модель нужно указать в запросе явно. API принимает файлы до 500 МБ в 12 форматах, включая MP3, WAV, OGG, MP4 и M4A. Для оплаты из России, как и с другими зарубежными API, понадобится иностранная карта. Готового приложения для обычного пользователя у сервиса нет, это инструмент для тех, кто встраивает расшифровку в свой продукт или автоматизацию.

Кому Grok Voice Transcribe 2.0 пригодится

Для владельцев сайтов и авторов практический смысл в цене. Расшифровка часового интервью или вебинара обходится в десять центов, и это делает автоматический перевод видео в статьи, субтитры и конспекты почти бесплатным. Прежде чем переводить на Grok поток русскоязычных записей, стоит прогнать пару своих файлов. Громкие цифры SpaceXAI получены в основном на английском, а по русскому отдельных результатов нет.

Сильна там, где звонят и диктуют

В обработке записей Grok Voice Transcribe 2.0 уступает лидерам, зато хорошо закрывает свою нишу. Модель сильна там, где звук плохой, а ошибка в одной цифре телефона обходится дороже всего остального текста. В паре с низкой ценой это серьёзная заявка на колл-центры и голосовых агентов. Проверкой станут ближайшие недели, когда вторая версия станет стандартом для всех клиентов API и её начнут сравнивать на чужих записях.

Источник:
SpaceXAI — Introducing Grok Voice Transcribe 2.0



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Grok Imagine научился править картинку по кускам: xAI открыла Image 2.0 всем пользователям

xAI открыла общий доступ к Imagine Image 2.0 - новому режиму Quality в Grok Imagine на сайте и...

Обзор платформы lava.top

lava.top — это международная платформа для продажи контента, позволяющая создавать и продавать цифровые продукты без подключения дополнительных платежных...

ElevenLabs выпустили Eleven v4 и v4 Turbo — ИИ для озвучки с управлением эмоциями и манерой речи

ElevenLabs представила новые модели синтеза речи Eleven v4 и Eleven v4 Turbo. Они построены на новой архитектуре и...

Kling представила Avatar 2.0 — длина видео до 5 минут, «чистый» липсинк и «живая» мимика 

Разработчики Kling AI (Kuaishou) выпустили модель Avatar 2.0 — обновление инструмента для создания говорящих цифровых аватаров. Релиз состоялся...

Яндекс Люмен: что за подписка, сколько стоит, как подключить/отключить

«Яндекс Люмен» появился летом 2026 года. Сначала его запустили в Яндекс Музыке, затем добавили функции в Яндекс Книги....

Яндекс сводит аналитику данных в одну платформу

Yandex B2B Tech анонсировала DataLens Platform, платформу для работы с корпоративными данными от загрузки и хранения до отчётов...

Anthropic объединила чат с Cowork и встроила редакторы документов и слайдов прямо в Claude

Anthropic объединила стандартный диалоговый чат и рабочий режим Cowork в единый интерфейс Claude. Модель теперь сама определяет характер...

OpenAI выпустила GPT-6 Sol и Luna и вдвое снизила цены

OpenAI выпустила GPT-6 Sol и GPT-6 Luna, среднюю и младшую модели поколения GPT-6. Они построены на наработках флагманской...

Килиан Мбаппе ушёл от Nike и стал амбассадором бренда On

Швейцарский производитель спортивной одежды и обуви On заключил контракт с нападающим «Реала» и сборной Франции Килианом Мбаппе. Футболист...

Runway выпустила Aleph 2.0: точечное ИИ-редактирование видео по одному кадру

Американская компания Runway представила Aleph 2.0 - крупное обновление своей ИИ-модели для точечного изменения видеоматериалов. Инструмент, встроенный в...

OpenAI снова столкнулась с неконтролируемым поведением ИИ-агентов

OpenAI оказалась в центре ещё одного инцидента с роем ИИ-агентов. По словам исследователей, внутренние агенты компании в мае...

Perplexity встроила слайдер вычислительных усилий в агентный сервис Computer

Perplexity добавила слайдер управления вычислительными усилиями в агентный сервис Computer. Пользователи веб-версии платформы могут выбирать глубину рассуждений и...

Kling представил VIDEO 2.6 — ИИ-модель, которая генерирует видео и звук за один прогон

Kling запустил модель VIDEO 2.6 — свой первый генератор, который создаёт картинку и звук одновременно. Один запрос превращается...

Нейросеть для сложных расчётов: чек-лист для новичка

Недавно нейросеть Claude посчитала физическую задачу, с которой годами возились специалисты — расчёт на девять петель в квантовой...

Google показала проекты на Gemini 3.8 Flash

Google показала четыре проекта, собранных разработчиками на Gemini 3.8 Flash. Модель вышла в начале сентября и, по заявлению...

Промты для коллажей — как сделать коллаж по фото с помощью ИИ

Хотите красивые фоточки для соцсетей, но без одинаковых селфи? Держите 5 промтов для трендовых коллажей: неон ночью, дождь...

Конспект видео нейросетью: чек-лист для новичка

Часовая запись вебинара, лекция на полтора часа, интервью на YouTube, которое нужно пересказать коллеге за пять минут —...

Google запускает Nano Banana – новая эра редактирования изображений

Google представила модель искусственного интеллекта Nano Banana - предварительную версию Gemini 2.5 Flash Image, которая уже доступна пользователям...

Claude Mythos 5. ИИ, который обычным пользователям не продадут

Существует целый класс программ, которые не рекламируют широко. Не потому, что они плохи, а ровно наоборот. Claude Mythos...

Pika превратила генератор видео в платформу с набором приложений и мультимодельным стеком

Компания Pika запустила обновленную креативную платформу на pika.art. Сервис перестроили вокруг специализированных мини-приложений для видеомонтажа, ретуши и работы...