• Виктор
  • Блог
  • 1 мин. чтения

От Google Translate к Gemini. Новая модель приближает синхронный перевод к живому диалогу


Двадцать лет назад Google Translate был всего лишь одним из первых машинных экспериментов с языком. Сначала он переводил коряво и смешно, потом сносно. Потом вполне прилично. Но одна проблема долгое время оставалась нерешенной: система всегда ждала, пока собеседник закончит говорить, и только потом начинала переводить. Разговор через такой переводчик напоминал не живую беседу, а сеанс связи с задержкой, в котором каждый участник вынужден терпеть паузы и смотреть в потолок. 9 июня 2026 года Google представила новую аудиомодель для перевода речи в режиме реального времени более чем на 70 языков. Именно она должна наконец закрыть этот раздражающий пробел.

Как работает потоковый перевод

Основополагающее отличие от предыдущих подходов кроется в принципе обработки звука. Классический машинный перевод работает пошагово: система ждет окончания предложения, обрабатывает его и только потом выдает переведенную версию. Это вводит паузу, которая разрушает ритм диалога. Новая модель Live Translate устроена иначе. Система обрабатывает речь по мере поступления аудиосигнала и выдает перевод с задержкой в несколько секунд. Такой подход помогает снизить количество пауз и разрывов в диалоге.

Здесь есть тонкий момент, который Google признает открыто. Модель балансирует между двумя противоположными требованиями: с одной стороны, нужно дождаться достаточного контекста, чтобы перевести качественно, потому что многие языки ставят глагол или отрицание в конце предложения. С другой, нужно выдавать перевод немедленно, чтобы оставаться в синхроне с говорящим. Найти равновесие между этими двумя требованиями – в этом и состоит главная инженерная задача, которую пришлось решать разработчикам.

 

 

Отдельная деталь, которая делает результат ощутимо человечнее: нейросеть автоматически распознает более 70 языков, и при этом сохраняются оригинальная интонация, а также темп речи и высота голоса говорящего. То есть, это уже не просто перевод слов. Система пытается передать эмоциональную окраску речи, а не выдать одинаково ровный роботизированный голос вне зависимости от того, кто и с какими интонациями говорит на входе.

 

 

Где появится и как использовать

Обозреваемая функция уже начала внедряться в экосистему Google и появляется сразу в нескольких сервисах. В приложении Google Translate функция Live Translate интегрирована в привычный интерфейс и не требует сложной настройки. Перевод запускается прямо во время разговора и может выводиться через подключенные наушники, что делает общение более естественным и непрерывным. Система автоматически подстраивает голос перевода под исходную речь, стараясь сохранить интонации и ритм говорящего. Если гарнитура недоступна, предусмотрен альтернативный режим: перевод можно слушать через динамик смартфона, просто приблизив устройство к уху во время диалога.

Обновление можно считать особенно значимым в плане корпоративного использования. В Google Meet поддержка языков расширяется с пяти до более чем 70, а количество языковых комбинаций внутри одной встречи превышает 2000. Предыдущая версия системы требовала обязательного наличия английского языка. Теперь данное ограничение снимается. Международный созвон с участниками из разных стран, каждый из которых говорит на родном языке, перестает быть коммуникативным кошмаром.

Кто уже тестирует и что с ограничениями

Среди первых партнеров, тестирующих технологию, значится малайзийская технологическая компания Grab. Организация использует модель для голосового общения между водителями и пассажирами в режиме реального времени в многоязычной среде. Там таких звонков происходит более десяти миллионов в месяц. Запрос живой: людям нужно быстро объяснить маршрут или место встречи, не переключаясь на текстовые переписки и не ища переводчика в браузере.

Через API сторонние разработчики получают возможность встраивать синхронный перевод в собственные приложения. По сути, компания открывает технологию синхронного перевода для любого приложения, которое занимается голосовыми коммуникациями.

При этом Google не скрывает ограничений и минусов своего продукта. Система не идеальна: сгенерированные голоса могут быть непоследовательными и слегка менять тембр на протяжении сессии. Автоматическое распознавание языка может давать сбои при нестандартном акценте, при языках, схожих друг с другом, или когда говорящий быстро переключается с одного языка на другой. Но такое признание скорее внушает доверие, чем разочаровывает.

Разумеется, эта функция не решает проблему языкового барьера раз и навсегда. Но это первый инструмент, который всерьез приближается к тому, чтобы сделать разговор между людьми, говорящими на разных языках, похожим на обычную беседу, а не на упражнение в терпении.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

ElevenLabs теперь можно подключить к Claude через MCP

ElevenLabs представила MCP-сервер для Claude. Он позволяет управлять агентами ElevenLabs из чата в Claude. Коннектор уже появился в...

Midjourney V8.1 ускорилась и вернула стиль

Midjourney выпустила альфа-версию V8.1, в которой разработчики сделали ставку на баланс: вернули фирменный визуальный стиль, ускорили генерацию и...

DeepSeek API: как получить ключ, как пользоваться бесплатно, как оплатить из России

DeepSeek API – это облачный сервис, который позволяет подключать ИИ-модели к внешним проектам. С его помощью можно интегрировать...

⚔️ Тестиум: ChatGPT или DeepSeek — кто лучше пишет тексты?

Привет! Меня зовут Анатолий Чупин. Я редактор сайта Postium, исследователь ИИ и автор Telegram-канала «Промты — и точка»....

Perplexity Computer научилась создавать видео для кампаний и соцсетей

Perplexity добавила генерацию видео в ИИ-агента Computer. Сервис использует модели MiniMax H3 и ByteDance Seedance 2.5 и может...

Miu Miu и New Balance выпустили балетную версию кроссовок 530 SL

Miu Miu и New Balance выпустили балетки на основе 530 SL. От кроссовок модели достались шнуровка, резиновая подошва...

Вышла нейросеть Suno 5.5 — ИИ генерирует треки с вашим голосом

Suno AI выпустила модель v5.5 и вместе с ней набор функций, которые меняют логику сервиса. Теперь это не...

Runway представила Multi-Shot App: от одного промпта к полноценной многосценной истории с диалогами, звуком и монтажом

Runway представила новый инструмент, который заметно упрощает создание видеоконтента с помощью нейросетей. Multi-Shot App превращает один текстовый запрос...

Perplexity встроила слайдер вычислительных усилий в агентный сервис Computer

Perplexity добавила слайдер управления вычислительными усилиями в агентный сервис Computer. Пользователи веб-версии платформы могут выбирать глубину рассуждений и...

Гайд по размерам для YouTube: шапка канала, обложка видео, Shorts, аватар, лого

Если вы загружаете ролики на YouTube и оформляете канал, размеры лучше определить заранее. Иначе шапка обрежется на смартфоне,...

GLM 5.3: мощнее в коде и кибербезопасности

14 августа 2026 года уже упоминавшаяся нами в предыдущих обзорах компания Zhipu AI представила следующую версию своей флагманской...

Qwen выпустила Qwen-Image-3.0 — модель генерирует сложные макеты и текст от 10 пикселей

Qwen представила Qwen-Image-3.0 — третье поколение модели для генерации и редактирования изображений. Она принимает инструкции объёмом до 4,5...

Обновлённый Reve: свобода творчества без технических барьеров

Reve представила обновлённую платформу для генерации и редактирования изображений, стремясь сделать визуальное творчество доступным без технических барьеров. Новый...

Alibaba открыла QwenWork по всему миру — ИИ-агент работает в браузере и на компьютере

Alibaba открыла международную версию QwenWork в формате публичной беты. Это рабочая платформа с ИИ-агентом: пользователь описывает задачу обычным...

Alibaba выложила Qwen-Image-2.1 – картинки с прозрачным фоном из коробки

Команда Qwen выложила в открытый доступ Qwen-Image-2.1 - модель, которая рисует изображения сразу с прозрачным фоном и правит...

История Starbucks: кто основал компанию, как появился логотип и кому принадлежит бренд

Сегодня Starbucks — одна из самых узнаваемых кофейных сетей мира: зелёную сирену знают даже те, кто ни разу...

Яндекс сводит аналитику данных в одну платформу

Yandex B2B Tech анонсировала DataLens Platform, платформу для работы с корпоративными данными от загрузки и хранения до отчётов...

OpenAI выпустила ChatGPT Images 2.5 — генерация стала быстрее, а изображения можно точечно доработать

OpenAI выпустила ChatGPT Images 2.5 — обновлённую модель для генерации и редактирования изображений в ChatGPT. Компания заявляет, что...

Вышла Kling Video 3.0 — ИИ-модель для генерации видео из нескольких сцен

Kuaishou выпустила Kling Video 3.0 — новую версию своей модели для генерации видео. Ключевое изменение — теперь ролик...

DeepSeek представила V4-Pro и V4-Flash — новые ИИ-модели для сложных и быстрых задач

DeepSeek представила предварительную версию линейки DeepSeek-V4. В неё вошли две MoE-модели: V4-Pro с 1,6 трлн параметров и V4-Flash...