• Виктор
  • Блог
  • 2 мин. чтения

Grok Imagine получил референсы персонажей и голоса: xAI добавила генерацию видео в 1080p


xAI добавила в Grok Imagine референсы: до семи опорных изображений на генерацию закрепляют лицо персонажа, товар или локацию, а голосовой референс переносит в новую сцену ещё и тембр героя. Заодно появились генерация видео из текстового описания и нативное разрешение 1080p.

Grok Imagine получил референсы персонажей и голоса: xAI добавила генерацию видео в 1080p

Grok Imagine – генератор изображений и видео от xAI, встроенный в Grok (Грок) и вынесенный отдельным разделом на grok.com. Обновление 31 июля компания подаёт как переход от разовых красивых роликов к съёмке сериями, где персонаж и обстановка не меняются от кадра к кадру. Функции включаются постепенно, и часть из них пока заперта на верхних подписках.

Семь референсов на одну генерацию

Каждое изображение-референс в Grok Imagine закрепляет один элемент сцены – лицо, товар или локацию. Остальное меняется по промпту. Можно оставить героя и переставить его в другой интерьер, оставить интерьер и поменять героя, либо зафиксировать оба слоя и менять только действие. Предел – семь референсов на одну генерацию.

Ролик теперь собирается из повторяющихся элементов. Раньше похожего результата добивались десятком попыток с одним и тем же промптом, и совпадение получалось случайным.

Голос держится вместе с лицом

Вторая новинка релиза – голосовой референс. В Grok Imagine загружаются два файла, фотография персонажа и образец его голоса, после чего в новых сценах сохраняются и внешность, и звучание. Повторяемость голоса оставалась слабым местом генеративного видео дольше, чем повторяемость картинки: лицо ещё как-то удавалось удержать, а тембр героя плавал от ролика к ролику.

Видео из текста и 1080p

Grok Imagine научился делать видео из одного текстового описания, стартовое изображение больше не нужно. Технически xAI связала собственную генерацию картинок с режимом image-to-video: модель сначала рисует кадр, потом его оживляет.

Второе изменение – нативные 1080p для обоих режимов, и текстового, и картиночного. Текст-в-видео и высокое разрешение уже открыты всем на grok.com/imagine, в приложениях для iOS и Android.

Пока США и старшие подписки

Референсы изображений и голоса стартовали 31 июля только в США и только для SuperGrok Heavy и SuperGrok Plus, двух верхних тарифов. xAI обещает раскатить их на остальные уровни в течение нескольких дней. Разработчикам изображения-референсы, генерация из текста и 1080p доступны в API под моделью grok-imagine-video-1.5; голосовой референс там выдают по отдельному запросу через отдел продаж.

Последняя деталь говорит сама за себя. Перенос голоса xAI пока не готова отдавать в самообслуживание.

Реклама, ведущие, товарные ролики

Набор референсов переводит Grok Imagine в разряд рабочих инструментов для задач, где картинка обязана повторяться. Первыми открываются несколько сценариев:

  • рекламная серия, где товар выглядит одинаково во всех кадрах;
  • виртуальный ведущий с закреплённым лицом и голосом;
  • короткие скетчи и сериалы с постоянными персонажами;
  • демонстрация одного продукта в разных обстановках и ракурсах.

Veo и Runway пришли раньше

Сама идея опорных изображений на рынке не первый год. У Google в Veo работает режим Ingredients to Video, Runway с четвёртого поколения строит консистентность персонажей на референсах, Kling держит лицо через отдельную модель головы. Аргумент Grok Imagine – объём: семь опорных изображений против трёх у Veo, плюс голос, которого в связке «лицо и сцена» у конкурентов нет. Насколько уверенно это держится на длинных сценах, покажут ролики пользователей, а не демо на сайте xAI.

Лицо и голос без согласия

Связка «портрет плюс образец голоса» – ровно та функциональность, из которой делают дипфейки, и у Grok Imagine уже есть репутационный шлейф после историй с генерацией изображений реальных людей. Придержать голосовые референсы за формой обращения к продажам выглядит осознанной страховкой. Публичная часть продукта при этом принимает загруженные фотографии без такой оговорки. Проверочная точка близко: когда референсы раскатят на все тарифы и за пределы США, станет видно, справляются ли фильтры xAI с потоком портретов живых людей.

Источник:
xAI, официальный блог



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Яндекс сводит аналитику данных в одну платформу

Yandex B2B Tech анонсировала DataLens Platform, платформу для работы с корпоративными данными от загрузки и хранения до отчётов...

OpenAI выпустила GPT Image 2 и ChatGPT Images 2.0

OpenAI представила GPT Image 2 для API и одновременно обновила генерацию изображений в ChatGPT до версии Images 2.0....

Google запустила Pics — ИИ-редактор изображений на базе Nano Banana

Google начала постепенно открывать доступ к Google Pics — новому ИИ-редактору изображений для Google Workspace на базе модели...

OpenAI интегрировала ChatGPT в Microsoft Word через общую офисную надстройку

OpenAI выпустила интеграцию ChatGPT для текстового редактора Microsoft Word. Инструмент встраивается в боковую панель программы и доступен на...

Midjourney V8.1 ускорилась и вернула стиль

Midjourney выпустила альфа-версию V8.1, в которой разработчики сделали ставку на баланс: вернули фирменный визуальный стиль, ускорили генерацию и...

ByteDance открыла публичный API Seedance 2.5

7 августа Volcano Engine открыла публичный API Seedance 2.5 - видеомодели ByteDance, которая одним проходом собирает 30-секундный ролик...

Krea открыла API для Krea 2 с переносом стиля и мудбордами

Krea открыла API для Krea 2 - своей первой базовой модели генерации изображений, обученной с нуля. Анонс опубликован...

NotebookLM научился делать минутные вертикальные видео из документов

Google добавила в NotebookLM новый формат - Short Video Overviews. Сервис автоматически собирает из загруженных документов короткое вертикальное...

Anthropic выпустила Claude Opus 5.5 – уровень Fable за меньшие деньги

Anthropic выпустила Claude Opus 5.5, первую модель нового поколения Claude 5.5. По заявлению компании, на большинстве задач она...

Конспект видео нейросетью: чек-лист для новичка

Часовая запись вебинара, лекция на полтора часа, интервью на YouTube, которое нужно пересказать коллеге за пять минут —...

Perplexity Computer научилась создавать видео для кампаний и соцсетей

Perplexity добавила генерацию видео в ИИ-агента Computer. Сервис использует модели MiniMax H3 и ByteDance Seedance 2.5 и может...

ByteDance выпустила Seedream 4.0 — ИИ модель для генерации изображений, обгоняющую Nano Banana

ByteDance представила Seedream 4.0 — новую модель генерации и редактирования изображений, которая работает быстрее и стабильнее конкурентов. По...

Вышла Kling Video 3.0 — ИИ-модель для генерации видео из нескольких сцен

Kuaishou выпустила Kling Video 3.0 — новую версию своей модели для генерации видео. Ключевое изменение — теперь ролик...

PixVerse обновила партнёрскую программу для авторов AI-видео

PixVerse представила Global Creative Partner Program 2.0 - обновлённую партнёрскую программу для авторов AI-видео. Участникам обещают кредиты, денежные...

Anthropic объединила чат с Cowork и встроила редакторы документов и слайдов прямо в Claude

Anthropic объединила стандартный диалоговый чат и рабочий режим Cowork в единый интерфейс Claude. Модель теперь сама определяет характер...

OpenAI выпустила GPT-6 Sol и GPT-6 Luna — новые модели уже доступны в ChatGPT и Codex

OpenAI начала развёртывание GPT-6 Sol и GPT-6 Luna. Новые модели уже появляются в ChatGPT Work и Codex, а...

Pika превратила генератор видео в платформу с набором приложений и мультимодельным стеком

Компания Pika запустила обновленную креативную платформу на pika.art. Сервис перестроили вокруг специализированных мини-приложений для видеомонтажа, ретуши и работы...

DeepSeek тестирует режим «Распознавание» изображений

В интерфейсе чат-бота DeepSeek появился новый режим «Распознавание» — рядом с режимами «Быстрый» и «Эксперт». В этом режиме...

Что изменилось в новой флагманской модели Anthropic Claude Opus 4.8

В мае 2026 года компания Anthropic обновила флагманскую модель Opus до версии 4.8. И на первый взгляд, этот...

Лимиты использования в ChatGPT/Codex: где посмотреть и как сбросить

Даже на платных тарифах ChatGPT действуют лимиты на использование. Если они заканчиваются, сервис может прямо во время работы...