• Виктор
  • Блог
  • 2 мин. чтения

Gemini 3.8 Live получила видеоаватар для бизнеса


Google выпустила Gemini 3.8 Live with Live Avatar, режим с почти синхронным видеоаватаром для разговорных моделей. Функция доступна в Gemini Enterprise с 24 сентября.

Gemini 3.8 Live получила видеоаватар для бизнеса

Google добавила к своим разговорным моделям визуальное присутствие. Режим Live Avatar соединяет живой диалог с потоковым видео низкой задержки, поэтому собеседник на экране слушает, смотрит и отвечает голосом с синхронной мимикой. Анонс вышел через неделю после запуска Gemini 3.8 Live, и это логичное продолжение той же линейки.

Аватар слушает, смотрит и отвечает

Live Avatar обрабатывает видео и звук одновременно. Модель синхронизирует губы, подстраивает выражения лица и держит естественную смену реплик. Google показывает это на примере стойки регистрации в отеле, где аватар общается с гостем и попутно выполняет служебные действия.

За визуальной частью стоит рассуждающая модель Gemini. Асинхронный вызов инструментов позволяет аватару запускать фоновые запросы и забирать данные, не прерывая разговор. Для сценариев вроде оформления брони или проверки статуса заказа это важнее, чем сама картинка.

97 языков без визуальных сбоев

Перевод речи в речь работает нативно. Аватар меняет язык прямо по ходу беседы, подстраивая артикуляцию и мимику, и Google заявляет переходы между 97 языками без потери качества видео и без визуального дрейфа. Обещание сильное, но проверяется оно только на живых диалогах с реальными акцентами, а не на демонстрационных роликах.

Свой аватар только по списку

Помимо библиотеки готовых персонажей с разной внешностью и голосом, организациям дают собрать собственный аватар. Из качественного референсного изображения разработчик получает анимированного персонажа с сохранением внешности, фирменного стиля или образа героя. Создание своих аватаров пока доступно только через корпоративный список допуска, то есть открытым для всех этот сценарий не стал.

SynthID во всех аудио и видео

Весь контент, который генерируют продукты Google, помечается водяным знаком SynthID. Метка встраивается прямо в аудио и видео и остаётся незаметной для глаза и слуха, но распознаётся инструментами проверки. Для компаний, которые поставят аватара на клиентскую линию, это снимает часть вопросов о подмене личности и происхождении записи.

Что это даёт владельцам сервисов

Живой аватар меняет планку для онлайн-поддержки. Если раньше визуальный помощник на сайте был статичной картинкой с текстовым полем, теперь конкурировать придётся с собеседником, который смотрит в камеру и отвечает голосом. Стоит заранее решить, где такой формат уместен. Для записи на услугу или разбора заявки он экономит время, а для быстрой справки на две строки остаётся избыточным.

Enterprise как единственная дверь

Режим доступен в Gemini Enterprise, документация по API открыта для разработчиков. Отдельной потребительской версии в анонсе нет, и это расставляет приоритеты. Google продаёт аватара компаниям, а не подписчикам чат-бота, поэтому массовый пользователь увидит его разве что на стороне чужого сервиса.

Главный вопрос к Live Avatar не в качестве картинки, а в задержке на реальных каналах связи и в цене за минуту такого диалога. Ни того, ни другого Google в анонсе не называет.

Источник:
blog.google



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Suno Studio 2.0 приближается к полноценной DAW благодаря поддержке MIDI и чат-боту с ИИ

Suno представила Studio 2.0 со значительными обновлениями, которые приближают ее к полноценной цифровой звуковой рабочей станции (DAW), а не к...

Нейросеть Sora 2: как пользоваться, где взять инвайт, возможности, как скачать

OpenAI представила Sora 2 — новую версию своей видеомодели, которая автоматически генерирует короткие ролики со звуком и синхронной...

DeepSeek API: как получить ключ, как пользоваться бесплатно, как оплатить из России

DeepSeek API – это облачный сервис, который позволяет подключать ИИ-модели к внешним проектам. С его помощью можно интегрировать...

Kling добавила нативную генерацию в 4K в версии Video 3.0

Kling запустила режим 4K Mode в линейке Video 3.0. Теперь видео можно генерировать сразу в 4K — без...

Килиан Мбаппе ушёл от Nike и стал амбассадором бренда On

Швейцарский производитель спортивной одежды и обуви On заключил контракт с нападающим «Реала» и сборной Франции Килианом Мбаппе. Футболист...

ElevenLabs представила Composer — редактор песен по секциям

ElevenLabs добавила Composer в сервис Eleven Music. Редактор позволяет начать песню с чистого листа, текстового запроса, собственных слов...

OpenAI сняла лимиты на текстовые чаты в ChatGPT для всех пользователей

OpenAI объявила об отмене лимитов на текстовые чаты для всех пользователей ChatGPT. Сервис, по данным компании, недавно преодолел...

OpenAI выпустила приложение Sora на Android — пока только в 7 странах

OpenAI представила Android-версию приложения Sora — инструмента для генерации коротких видео с помощью искусственного интеллекта. Скачать ИИ-генератор видео...

GLM 5.3: мощнее в коде и кибербезопасности

14 августа 2026 года уже упоминавшаяся нами в предыдущих обзорах компания Zhipu AI представила следующую версию своей флагманской...

DeepSeek выпустила Harness v0.2 — приложение для macOS и Windows

У ИИ-агента DeepSeek Harness появилась настольная версия. Теперь его можно установить как обычную программу и поручать ему работу...

Вышла Kling Video 3.0 — ИИ-модель для генерации видео из нескольких сцен

Kuaishou выпустила Kling Video 3.0 — новую версию своей модели для генерации видео. Ключевое изменение — теперь ролик...

Вышла нейросеть Suno 5.5 — ИИ генерирует треки с вашим голосом

Suno AI выпустила модель v5.5 и вместе с ней набор функций, которые меняют логику сервиса. Теперь это не...

Яндекс сводит аналитику данных в одну платформу

Yandex B2B Tech анонсировала DataLens Platform, платформу для работы с корпоративными данными от загрузки и хранения до отчётов...

Как пользоваться QwenWork: регистрация, возможности, бесплатные кредиты и тарифы

QwenWork — это новый ИИ-агент от Alibaba, который доступен на сайте и через отдельное приложение. По принципу работы...

Поздравление с ИИ: что бесплатно, а что платно в 2026

Каждый раз, когда у кого-то из близких день рождения, встаёт один и тот же вопрос: написать обычное «с...

«Ёбидоёби» запустила коллаборацию с Atomic Heart

Служба доставки «Ёбидоёби» запустила коллаборацию с Atomic Heart. В меню появился одноимённый набор из 40 роллов в лимитированной...

Krea AI представила Krea 2 – собственную модель для генерации изображений

Krea AI 12 мая 2026 года анонсировала Krea 2 — новую модель для генерации изображений. В ветке компания...

Kling 4.0 выйдет в октябре, а Flash уже доступна подписчикам Ultra

Kling AI анонсировала видеомодель Kling 4.0 с выходом в октябре, а облегчённая Kling 4.0 Flash уже работает у...

Sakana Fugu: ИИ, который учится управлять другими ИИ

22 июня 2026 года японская лаборатория Sakana AI (Токио) представила свой новый коммерческий продукт под названием Sakana Fugu....

Grok научился расшифровывать речь вдвое точнее и за те же деньги

SpaceXAI выпустила Grok Voice Transcribe 2.0, модель для перевода речи в текст. По внутренним тестам компании она вдвое...