• Виктор
  • Блог
  • 1 мин. чтения

От Google Translate к Gemini. Новая модель приближает синхронный перевод к живому диалогу


Двадцать лет назад Google Translate был всего лишь одним из первых машинных экспериментов с языком. Сначала он переводил коряво и смешно, потом сносно. Потом вполне прилично. Но одна проблема долгое время оставалась нерешенной: система всегда ждала, пока собеседник закончит говорить, и только потом начинала переводить. Разговор через такой переводчик напоминал не живую беседу, а сеанс связи с задержкой, в котором каждый участник вынужден терпеть паузы и смотреть в потолок. 9 июня 2026 года Google представила новую аудиомодель для перевода речи в режиме реального времени более чем на 70 языков. Именно она должна наконец закрыть этот раздражающий пробел.

Как работает потоковый перевод

Основополагающее отличие от предыдущих подходов кроется в принципе обработки звука. Классический машинный перевод работает пошагово: система ждет окончания предложения, обрабатывает его и только потом выдает переведенную версию. Это вводит паузу, которая разрушает ритм диалога. Новая модель Live Translate устроена иначе. Система обрабатывает речь по мере поступления аудиосигнала и выдает перевод с задержкой в несколько секунд. Такой подход помогает снизить количество пауз и разрывов в диалоге.

Здесь есть тонкий момент, который Google признает открыто. Модель балансирует между двумя противоположными требованиями: с одной стороны, нужно дождаться достаточного контекста, чтобы перевести качественно, потому что многие языки ставят глагол или отрицание в конце предложения. С другой, нужно выдавать перевод немедленно, чтобы оставаться в синхроне с говорящим. Найти равновесие между этими двумя требованиями – в этом и состоит главная инженерная задача, которую пришлось решать разработчикам.

 

 

Отдельная деталь, которая делает результат ощутимо человечнее: нейросеть автоматически распознает более 70 языков, и при этом сохраняются оригинальная интонация, а также темп речи и высота голоса говорящего. То есть, это уже не просто перевод слов. Система пытается передать эмоциональную окраску речи, а не выдать одинаково ровный роботизированный голос вне зависимости от того, кто и с какими интонациями говорит на входе.

 

 

Где появится и как использовать

Обозреваемая функция уже начала внедряться в экосистему Google и появляется сразу в нескольких сервисах. В приложении Google Translate функция Live Translate интегрирована в привычный интерфейс и не требует сложной настройки. Перевод запускается прямо во время разговора и может выводиться через подключенные наушники, что делает общение более естественным и непрерывным. Система автоматически подстраивает голос перевода под исходную речь, стараясь сохранить интонации и ритм говорящего. Если гарнитура недоступна, предусмотрен альтернативный режим: перевод можно слушать через динамик смартфона, просто приблизив устройство к уху во время диалога.

Обновление можно считать особенно значимым в плане корпоративного использования. В Google Meet поддержка языков расширяется с пяти до более чем 70, а количество языковых комбинаций внутри одной встречи превышает 2000. Предыдущая версия системы требовала обязательного наличия английского языка. Теперь данное ограничение снимается. Международный созвон с участниками из разных стран, каждый из которых говорит на родном языке, перестает быть коммуникативным кошмаром.

Кто уже тестирует и что с ограничениями

Среди первых партнеров, тестирующих технологию, значится малайзийская технологическая компания Grab. Организация использует модель для голосового общения между водителями и пассажирами в режиме реального времени в многоязычной среде. Там таких звонков происходит более десяти миллионов в месяц. Запрос живой: людям нужно быстро объяснить маршрут или место встречи, не переключаясь на текстовые переписки и не ища переводчика в браузере.

Через API сторонние разработчики получают возможность встраивать синхронный перевод в собственные приложения. По сути, компания открывает технологию синхронного перевода для любого приложения, которое занимается голосовыми коммуникациями.

При этом Google не скрывает ограничений и минусов своего продукта. Система не идеальна: сгенерированные голоса могут быть непоследовательными и слегка менять тембр на протяжении сессии. Автоматическое распознавание языка может давать сбои при нестандартном акценте, при языках, схожих друг с другом, или когда говорящий быстро переключается с одного языка на другой. Но такое признание скорее внушает доверие, чем разочаровывает.

Разумеется, эта функция не решает проблему языкового барьера раз и навсегда. Но это первый инструмент, который всерьез приближается к тому, чтобы сделать разговор между людьми, говорящими на разных языках, похожим на обычную беседу, а не на упражнение в терпении.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

OpenAI выпустила GPT-6 Sol и GPT-6 Luna — новые модели уже доступны в ChatGPT и Codex

OpenAI начала развёртывание GPT-6 Sol и GPT-6 Luna. Новые модели уже появляются в ChatGPT Work и Codex, а...

DeepSeek API: как получить ключ, как пользоваться бесплатно, как оплатить из России

DeepSeek API – это облачный сервис, который позволяет подключать ИИ-модели к внешним проектам. С его помощью можно интегрировать...

Лучшие агрегаторы нейросетей в России — 11 сервисов для генерации изображений, видео, текста

Агрегаторы ИИ в России позволяют получить доступ к ChatGPT, Claude, Gemini, Grok, Midjourney, Seedance, Kling и другим зарубежным...

OpenAI выпустила GPT-6 Sol и Luna и вдвое снизила цены

OpenAI выпустила GPT-6 Sol и GPT-6 Luna, среднюю и младшую модели поколения GPT-6. Они построены на наработках флагманской...

Yandex AI Studio позволит создавать ИИ-агентов на базе DeepSeek-V3.2

Yandex B2B Tech представила обновление Yandex AI Studio — платформы для разработки ИИ-приложений. Главное изменение: бизнес получил возможность...

Tencent выпустила Hy Image 3.5 Preview для генерации и редактирования изображений

Tencent открыла доступ к Hy Image 3.5 Preview — модели, которая создаёт изображения по тексту и референсам, а...

Обзор платформы lava.top

lava.top — это международная платформа для продажи контента, позволяющая создавать и продавать цифровые продукты без подключения дополнительных платежных...

OpenAI уберёт GPT-5.5 из ChatGPT и Codex 14 октября

OpenAI предупредила о завершении поддержки GPT-5.5 в ChatGPT, ChatGPT Work и Codex. Модель уберут из этих продуктов 14...

Perplexity открыла исходный код Lily — движка для локальной работы ИИ на Mac

Perplexity открыла исходный код Lily — лёгкого движка инференса для локальной работы с моделями в Perplexity Computer. Он...

15+ способов продвижения сообщества ВКонтакте в 2026 году

ВКонтакте постоянно меняется: обновляются алгоритмы рекомендаций, появляются новые форматы контента и способы взаимодействия с аудиторией. Поэтому схема «создать...

ByteDance выпустила Seedream 5.0 Pro для инфографики и точного редактирования изображений

ByteDance Seed 8 июля 2026 года представила Seedream 5.0 Pro - мультимодальную модель для генерации и редактирования изображений....

Krea открыла API для Krea 2 с переносом стиля и мудбордами

Krea открыла API для Krea 2 - своей первой базовой модели генерации изображений, обученной с нуля. Анонс опубликован...

DeepSeek выпустила V4.1 Flash — открытую ИИ-модель с контекстом до 1 млн токенов

DeepSeek выпустила DeepSeek V4.1 Flash и открыла веса модели на Hugging Face. Она принимает текст и изображения, отвечает...

Apple ведёт переговоры с издателями о выплатах за актуальные новости для Siri

Согласно информации The Wall Street Journal, Apple ведёт переговоры о выплатах издателям за использование их контента для работы будущего...

OpenAI выпустила ChatGPT Images 2.5 — генерация стала быстрее, а изображения можно точечно доработать

OpenAI выпустила ChatGPT Images 2.5 — обновлённую модель для генерации и редактирования изображений в ChatGPT. Компания заявляет, что...

ComfyUI заморозила новые бесплатные аккаунты в Comfy Cloud из-за злоупотреблений видеомоделями

ComfyUI временно остановила создание новых бесплатных аккаунтов в Comfy Cloud. Причина - инцидент со злоупотреблениями, в котором атаковали...

Razer выпустила одноручный кейпад Tartarus V2 Pro

Razer начала продажи Tartarus V2 Pro — одноручного игрового кейпада с 31 программируемым элементом управления. Устройство рассчитано на...

DeepSeek выпустила Harness v0.2 — приложение для macOS и Windows

У ИИ-агента DeepSeek Harness появилась настольная версия. Теперь его можно установить как обычную программу и поручать ему работу...

Nvidia «достигла AGI», но никто не знает, что это значит

В среду на отчётной конференции Nvidia Дженсен Хуанг заявил, что компания «достигла AGI» — искусственного общего интеллекта, одной...

⚔️ Тестиум: ChatGPT или DeepSeek — кто лучше пишет тексты?

Привет! Меня зовут Анатолий Чупин. Я редактор сайта Postium, исследователь ИИ и автор Telegram-канала «Промты — и точка»....