• Виктор
  • Блог
  • 2 мин. чтения

Grok Imagine получил референсы персонажей и голоса: xAI добавила генерацию видео в 1080p


xAI добавила в Grok Imagine референсы: до семи опорных изображений на генерацию закрепляют лицо персонажа, товар или локацию, а голосовой референс переносит в новую сцену ещё и тембр героя. Заодно появились генерация видео из текстового описания и нативное разрешение 1080p.

Grok Imagine получил референсы персонажей и голоса: xAI добавила генерацию видео в 1080p

Grok Imagine – генератор изображений и видео от xAI, встроенный в Grok (Грок) и вынесенный отдельным разделом на grok.com. Обновление 31 июля компания подаёт как переход от разовых красивых роликов к съёмке сериями, где персонаж и обстановка не меняются от кадра к кадру. Функции включаются постепенно, и часть из них пока заперта на верхних подписках.

Семь референсов на одну генерацию

Каждое изображение-референс в Grok Imagine закрепляет один элемент сцены – лицо, товар или локацию. Остальное меняется по промпту. Можно оставить героя и переставить его в другой интерьер, оставить интерьер и поменять героя, либо зафиксировать оба слоя и менять только действие. Предел – семь референсов на одну генерацию.

Ролик теперь собирается из повторяющихся элементов. Раньше похожего результата добивались десятком попыток с одним и тем же промптом, и совпадение получалось случайным.

Голос держится вместе с лицом

Вторая новинка релиза – голосовой референс. В Grok Imagine загружаются два файла, фотография персонажа и образец его голоса, после чего в новых сценах сохраняются и внешность, и звучание. Повторяемость голоса оставалась слабым местом генеративного видео дольше, чем повторяемость картинки: лицо ещё как-то удавалось удержать, а тембр героя плавал от ролика к ролику.

Видео из текста и 1080p

Grok Imagine научился делать видео из одного текстового описания, стартовое изображение больше не нужно. Технически xAI связала собственную генерацию картинок с режимом image-to-video: модель сначала рисует кадр, потом его оживляет.

Второе изменение – нативные 1080p для обоих режимов, и текстового, и картиночного. Текст-в-видео и высокое разрешение уже открыты всем на grok.com/imagine, в приложениях для iOS и Android.

Пока США и старшие подписки

Референсы изображений и голоса стартовали 31 июля только в США и только для SuperGrok Heavy и SuperGrok Plus, двух верхних тарифов. xAI обещает раскатить их на остальные уровни в течение нескольких дней. Разработчикам изображения-референсы, генерация из текста и 1080p доступны в API под моделью grok-imagine-video-1.5; голосовой референс там выдают по отдельному запросу через отдел продаж.

Последняя деталь говорит сама за себя. Перенос голоса xAI пока не готова отдавать в самообслуживание.

Реклама, ведущие, товарные ролики

Набор референсов переводит Grok Imagine в разряд рабочих инструментов для задач, где картинка обязана повторяться. Первыми открываются несколько сценариев:

  • рекламная серия, где товар выглядит одинаково во всех кадрах;
  • виртуальный ведущий с закреплённым лицом и голосом;
  • короткие скетчи и сериалы с постоянными персонажами;
  • демонстрация одного продукта в разных обстановках и ракурсах.

Veo и Runway пришли раньше

Сама идея опорных изображений на рынке не первый год. У Google в Veo работает режим Ingredients to Video, Runway с четвёртого поколения строит консистентность персонажей на референсах, Kling держит лицо через отдельную модель головы. Аргумент Grok Imagine – объём: семь опорных изображений против трёх у Veo, плюс голос, которого в связке «лицо и сцена» у конкурентов нет. Насколько уверенно это держится на длинных сценах, покажут ролики пользователей, а не демо на сайте xAI.

Лицо и голос без согласия

Связка «портрет плюс образец голоса» – ровно та функциональность, из которой делают дипфейки, и у Grok Imagine уже есть репутационный шлейф после историй с генерацией изображений реальных людей. Придержать голосовые референсы за формой обращения к продажам выглядит осознанной страховкой. Публичная часть продукта при этом принимает загруженные фотографии без такой оговорки. Проверочная точка близко: когда референсы раскатят на все тарифы и за пределы США, станет видно, справляются ли фильтры xAI с потоком портретов живых людей.

Источник:
xAI, официальный блог



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Kling представила Avatar 2.0 — длина видео до 5 минут, «чистый» липсинк и «живая» мимика 

Разработчики Kling AI (Kuaishou) выпустили модель Avatar 2.0 — обновление инструмента для создания говорящих цифровых аватаров. Релиз состоялся...

Runway представила Multi-Shot App: от одного промпта к полноценной многосценной истории с диалогами, звуком и монтажом

Runway представила новый инструмент, который заметно упрощает создание видеоконтента с помощью нейросетей. Multi-Shot App превращает один текстовый запрос...

Perplexity Computer научилась создавать видео для кампаний и соцсетей

Perplexity добавила генерацию видео в ИИ-агента Computer. Сервис использует модели MiniMax H3 и ByteDance Seedance 2.5 и может...

Claude Fable 5. Модель ИИ, которой можно сказать «разберись» и уйти пить кофе

Есть такой тип людей, которым нельзя давать простые задачи. Они все равно решат их как-то по-своему, с избыточным...

Промты для коллажей — как сделать коллаж по фото с помощью ИИ

Хотите красивые фоточки для соцсетей, но без одинаковых селфи? Держите 5 промтов для трендовых коллажей: неон ночью, дождь...

Глава Microsoft AI назвал новые отчёты OpenAI серьёзной ситуацией

Мустафа Сулейман, глава Microsoft AI, назвал в эфире CNBC 18 сентября раскрытые OpenAI случаи странного поведения моделей «довольно...

Anthropic объединила чат с Cowork и встроила редакторы документов и слайдов прямо в Claude

Anthropic объединила стандартный диалоговый чат и рабочий режим Cowork в единый интерфейс Claude. Модель теперь сама определяет характер...

MiniMax Hub добавил аудиомодели и готовые процессы для производства видео

MiniMax обновила творческую платформу MiniMax Hub. В ней появились аудиомодели ElevenLabs Music v2 и Seed Audio 1.0, готовые...

DeepSeek выпустила Harness v0.2 — приложение для macOS и Windows

У ИИ-агента DeepSeek Harness появилась настольная версия. Теперь его можно установить как обычную программу и поручать ему работу...

Вышел Kling O1 — рассуждающая нейросеть для генерации и редактирования видео

Kling AI выпустила новую ИИ-модель Kling O1 (Omni One). Это рассуждающая нейросеть, которая генерирует видео по тексту и...

Как пользоваться QwenWork: регистрация, возможности, бесплатные кредиты и тарифы

QwenWork — это новый ИИ-агент от Alibaba, который доступен на сайте и через отдельное приложение. По принципу работы...

Claude Code будет работать в автоматическом режиме по умолчанию

Программирование с Claude Code вскоре будет требовать еще меньше контроля человеком: Anthropic заявила, что начиная с 14 августа сделает...

GLM 5.2. Мощная модель в открытом доступе

Китайская компания Zhipu AI, которая на международном рынке работает под именем Z.ai, этим летом выпустила новую большую языковую...

Miu Miu и New Balance выпустили балетную версию кроссовок 530 SL

Miu Miu и New Balance выпустили балетки на основе 530 SL. От кроссовок модели достались шнуровка, резиновая подошва...

Что изменилось в новой флагманской модели Anthropic Claude Opus 4.8

В мае 2026 года компания Anthropic обновила флагманскую модель Opus до версии 4.8. И на первый взгляд, этот...

GLM 5.3: мощнее в коде и кибербезопасности

14 августа 2026 года уже упоминавшаяся нами в предыдущих обзорах компания Zhipu AI представила следующую версию своей флагманской...

Grok Imagine научился править картинку по кускам: xAI открыла Image 2.0 всем пользователям

xAI открыла общий доступ к Imagine Image 2.0 - новому режиму Quality в Grok Imagine на сайте и...

YouTube позволит генерировать Shorts с помощью Veo 3

На мероприятии «Made on YouTube» 16 сентября компания представила большое обновление для Shorts и YouTube Studio. В сервис...

Приложения для создания и обработки фото с помощью ИИ: топ-11 на Android/iPhone

Нужно создать аватар, улучшить старое фото или оживить снимок для соцсетей? Под каждую задачу есть свое приложение, где...

Nvidia «достигла AGI», но никто не знает, что это значит

В среду на отчётной конференции Nvidia Дженсен Хуанг заявил, что компания «достигла AGI» — искусственного общего интеллекта, одной...