• Виктор
  • Блог
  • 2 мин. чтения

Gemini 3.8 Live получила видеоаватар для бизнеса


Google выпустила Gemini 3.8 Live with Live Avatar, режим с почти синхронным видеоаватаром для разговорных моделей. Функция доступна в Gemini Enterprise с 24 сентября.

Gemini 3.8 Live получила видеоаватар для бизнеса

Google добавила к своим разговорным моделям визуальное присутствие. Режим Live Avatar соединяет живой диалог с потоковым видео низкой задержки, поэтому собеседник на экране слушает, смотрит и отвечает голосом с синхронной мимикой. Анонс вышел через неделю после запуска Gemini 3.8 Live, и это логичное продолжение той же линейки.

Аватар слушает, смотрит и отвечает

Live Avatar обрабатывает видео и звук одновременно. Модель синхронизирует губы, подстраивает выражения лица и держит естественную смену реплик. Google показывает это на примере стойки регистрации в отеле, где аватар общается с гостем и попутно выполняет служебные действия.

За визуальной частью стоит рассуждающая модель Gemini. Асинхронный вызов инструментов позволяет аватару запускать фоновые запросы и забирать данные, не прерывая разговор. Для сценариев вроде оформления брони или проверки статуса заказа это важнее, чем сама картинка.

97 языков без визуальных сбоев

Перевод речи в речь работает нативно. Аватар меняет язык прямо по ходу беседы, подстраивая артикуляцию и мимику, и Google заявляет переходы между 97 языками без потери качества видео и без визуального дрейфа. Обещание сильное, но проверяется оно только на живых диалогах с реальными акцентами, а не на демонстрационных роликах.

Свой аватар только по списку

Помимо библиотеки готовых персонажей с разной внешностью и голосом, организациям дают собрать собственный аватар. Из качественного референсного изображения разработчик получает анимированного персонажа с сохранением внешности, фирменного стиля или образа героя. Создание своих аватаров пока доступно только через корпоративный список допуска, то есть открытым для всех этот сценарий не стал.

SynthID во всех аудио и видео

Весь контент, который генерируют продукты Google, помечается водяным знаком SynthID. Метка встраивается прямо в аудио и видео и остаётся незаметной для глаза и слуха, но распознаётся инструментами проверки. Для компаний, которые поставят аватара на клиентскую линию, это снимает часть вопросов о подмене личности и происхождении записи.

Что это даёт владельцам сервисов

Живой аватар меняет планку для онлайн-поддержки. Если раньше визуальный помощник на сайте был статичной картинкой с текстовым полем, теперь конкурировать придётся с собеседником, который смотрит в камеру и отвечает голосом. Стоит заранее решить, где такой формат уместен. Для записи на услугу или разбора заявки он экономит время, а для быстрой справки на две строки остаётся избыточным.

Enterprise как единственная дверь

Режим доступен в Gemini Enterprise, документация по API открыта для разработчиков. Отдельной потребительской версии в анонсе нет, и это расставляет приоритеты. Google продаёт аватара компаниям, а не подписчикам чат-бота, поэтому массовый пользователь увидит его разве что на стороне чужого сервиса.

Главный вопрос к Live Avatar не в качестве картинки, а в задержке на реальных каналах связи и в цене за минуту такого диалога. Ни того, ни другого Google в анонсе не называет.

Источник:
blog.google



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Alibaba выпустила Qwen-Image-3.0 без весов и бенчмарков, но с промптами на 4500 токенов

Alibaba выпустила Qwen-Image-3.0 - третье поколение генератора изображений с прицелом на практическую пользу: длинные детальные подписи, читаемый мелкий...

Ideogram выпустила Ideogram 4.0 с открытыми весами и управлением макетом через JSON

Ideogram представила версию 4.0 - новую text-to-image модель с открытыми весами для генерации изображений, дизайна и типографики. Компания...

Поздравление с ИИ: что бесплатно, а что платно в 2026

Каждый раз, когда у кого-то из близких день рождения, встаёт один и тот же вопрос: написать обычное «с...

Промты для фото и открыток ко Дню России, +нейросети для генерации

Ищете промты для открыток ко Дню России? Нейросети могут сделать семейное поздравление по фото, портрет в праздничном образе,...

Synthesia встроила агента в редактор и обновила модель аватаров

Synthesia запустила Assistant - чат-агента, который собирает ролик из промпта, документа или ссылки прямо в редакторе и правит...

«Ёбидоёби» запустила коллаборацию с Atomic Heart

Служба доставки «Ёбидоёби» запустила коллаборацию с Atomic Heart. В меню появился одноимённый набор из 40 роллов в лимитированной...

ElevenLabs представила Studio 4.0 с генерацией видео, изображений и звука

ElevenLabs выпустила Studio 4.0 — обновлённый редактор, а также Studio Agent. В одном проекте теперь можно генерировать видео,...

adidas и Arte Antwerp выпустят две новые версии F50 Motion

adidas и бельгийский бренд Arte Antwerp представили две новые версии кроссовок F50 Motion — лакированную чёрную и серебристую....

OpenAI снова столкнулась с неконтролируемым поведением ИИ-агентов

OpenAI оказалась в центре ещё одного инцидента с роем ИИ-агентов. По словам исследователей, внутренние агенты компании в мае...

NotebookLM научился делать минутные вертикальные видео из документов

Google добавила в NotebookLM новый формат - Short Video Overviews. Сервис автоматически собирает из загруженных документов короткое вертикальное...

Kimi управляет сайтами из боковой панели Chrome и запоминает действия

Kimi теперь открывает сайты, нажимает кнопки и заполняет формы по просьбе, написанной в чате. Moonshot AI переименовала своё...

Как пользоваться QwenWork: регистрация, возможности, бесплатные кредиты и тарифы

QwenWork — это новый ИИ-агент от Alibaba, который доступен на сайте и через отдельное приложение. По принципу работы...

ElevenLabs представила Composer — редактор песен по секциям

ElevenLabs добавила Composer в сервис Eleven Music. Редактор позволяет начать песню с чистого листа, текстового запроса, собственных слов...

Midjourney запустила V8 Alpha с ускоренной генерацией и улучшенным пониманием запросов

Midjourney открыла доступ к альфа-версии V8 - новой модели генерации изображений, которая работает в несколько раз быстрее и...

Нейросеть для сложных расчётов: чек-лист для новичка

Недавно нейросеть Claude посчитала физическую задачу, с которой годами возились специалисты — расчёт на девять петель в квантовой...

OpenAI выпустила GPT Image 2 и ChatGPT Images 2.0

OpenAI представила GPT Image 2 для API и одновременно обновила генерацию изображений в ChatGPT до версии Images 2.0....

Comfy MCP: ComfyUI подключает ИИ-агентов к своим пайплайнам генерации

Команда ComfyUI открыла публичную бету Comfy MCP - коннектор, через который ИИ-агенты вроде Claude, Codex, Cursor и Hermes...

История Starbucks: кто основал компанию, как появился логотип и кому принадлежит бренд

Сегодня Starbucks — одна из самых узнаваемых кофейных сетей мира: зелёную сирену знают даже те, кто ни разу...

OpenAI стандартизировала отчёты об отклонениях и скрытом поведении ИИ-моделей

OpenAI представила фреймворк для отчётов о рассогласовании моделей (Model Misalignment Reporting Framework). Компания стандартизировала сбор данных об опасных...

ByteDance выпустила Seedream 5.0 Pro для инфографики и точного редактирования изображений

ByteDance Seed 8 июля 2026 года представила Seedream 5.0 Pro - мультимодальную модель для генерации и редактирования изображений....