• Виктор
  • Блог
  • 3 мин. чтения

Google довела ролики Gemini Omni до сорока секунд и сделала черновики втрое дешевле


Gemini Omni 1.1 Flash научилась достраивать снятую сцену продолжениями и доводить ролик до сорока секунд, а перед чистовой генерацией показывать дешёвый черновик. 27 августа Google перевела модель в производственный статус и открыла её в Gemini API, Google AI Studio и Flow.

Google довела ролики Gemini Omni до сорока секунд и сделала черновики втрое дешевле

Gemini Omni 1.1 Flash — видеомодель Google для разработчиков, которую компания предлагает встраивать в редакторы и генераторы роликов. Обновление подаётся не как скачок в качестве картинки, а как набор рычагов управления: чем снимает виртуальная камера, что происходит между двумя кадрами, сколько длится сцена. Модель вышла из тестового статуса и работает в производственном режиме.

Сорок секунд из четырёх кусков

За одну генерацию Gemini Omni 1.1 Flash по-прежнему выдаёт десять секунд. Новое — возможность продолжить готовый фрагмент ещё одним десятисекундным куском, и так до сорока секунд общей длительности.

Опробовать её вместе с GPT, Claude и Gemini можно там же, где собраны нейросети на русском за рубли.

Работает это заметно аккуратнее прежнего. Раньше модель при продолжении смотрела только на последнюю секунду ролика, теперь берёт в расчёт до десяти секунд предыдущего материала. Именно на стыках генеративное видео обычно и рассыпается — герой меняет куртку, свет прыгает, интерьер перестраивается.

Ключевые кадры вместо длинных описаний

Второй рычаг — генерация по двум опорным кадрам. Разработчик задаёт первый и последний кадр, а Google достраивает то, что между ними: наезд, облёт объекта, разворот камеры, бесшовную петлю для фона. Сложные операторские движения вроде резкой панорамы или наезда с одновременным отъездом объектива модель отрабатывает по описанию.

К этому добавили визуальные референсы. На вход принимается до трёх видеофрагментов длиной до трёх секунд каждый — по ним модель удерживает внешность персонажа, стиль и вид товара. Раскадровка перестаёт быть текстовым упражнением, где нужную картинку выпрашивают формулировками.

Цена спустилась до уровня Alibaba

Для перебора вариантов появился режим 360p. Google обещает генерацию до 60% быстрее стандартного 720p и примерно треть его цены. Секунда 720p обходится около $0,10, считается она по токенам — 5792 токена на секунду ролика.

Про цену 1080p и 4K в анонсе не сказано ничего. Оба разрешения получаются апскейлом, тарифицируются те же токены, но во сколько раз дороже выйдет чистовик в 4K, компания отдельной строкой не показала. Для продукта, который продают студиям и редакторам, это неудобный пробел.

Цены

Google Veo 3.1 просит около $0,40 за секунду. Gemini Omni 1.1 Flash в стандартном качестве стоит вчетверо меньше и ровно столько же, сколько Alibaba берёт за 720p у Wan3.0, — ценовой паритет с китайским конкурентом Google держит впервые за год.

По длине ролика расклад другой. Wan3.0 выдаёт 30 секунд за одну генерацию без склейки, ByteDance в Seedance 2.5 — те же 30 секунд сразу в 4K. Сорок секунд Gemini Omni собираются из четырёх кусков, и это компромисс, а не рекорд. Зато поле Google освобождают сами конкуренты. Sora у OpenAI доживает последние недели, приложение закрыли ещё весной, API отключают в сентябре.

Лица и надписи всё ещё плывут

Слабые места Google не прячет. Согласованность персонажа при последовательных правках и текст в кадре остаются нерешёнными задачами — те же грабли, на которые публично наступила Alibaba с Wan3.0. Работа со звуком и речью придержана. Доступ к редактированию аудио Google открывает осторожно, пока обкатывает правила ответственного выпуска.

Потолок в сорок секунд тоже стоит держать в голове. Это четыре последовательных обращения к API, четыре точки, где сцена может уехать, и оплата каждой генерации отдельно.

Где включили и кто уже встроил

Разработчикам модель доступна в Google AI Studio и через Gemini API, корпоративным клиентам — через API платформы Gemini Enterprise. В Flow, видеоредакторе Google, она открыта подписчикам планов AI Plus, Pro и Ultra. Продолжение сцен добавили и в обычное приложение Gemini, там рычагов меньше, но попробовать механику можно без кода.

Из внешних продуктов модель уже подключили Adobe в Firefly, Figma в редакторе Weave и Runway , плюс несколько облачных провайдеров. Набор подобран под одну ставку. Google продаёт Gemini Omni тем, кто делает инструменты для монтажёров, а не конечному зрителю.

Черновики в 360p, чистовик в 1080p

Тем, кто делает ролики для сайтов и соцсетей, Gemini Omni 1.1 Flash меняет порядок работы. Идеи перебираются в 360p, пока не сойдётся композиция и движение камеры, и только потом оплачивается чистовая генерация. Черновой режим стоит треть обычного, поэтому десяток проб выходит дешевле одного неудачного финала.

Вторая привычка — короткие фоновые петли через первый и последний кадр. Одинаковые опорные кадры дают зацикленный ролик без видимого стыка, и такой фон в шапку страницы генерируется за секунды.

Гонка ушла из качества в управляемость

Заявку Gemini Omni 1.1 Flash стоит проверять на длинных сценах. Если четыре сшитых куска действительно держат лицо героя и свет, у рекламных студий пропадает главный довод против генеративного видео. Если на третьем стыке картинка поедет, сорок секунд останутся цифрой из пресс-релиза, а рабочим форматом — те же десять.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

DeepSeek представила V4-Pro и V4-Flash — новые ИИ-модели для сложных и быстрых задач

DeepSeek представила предварительную версию линейки DeepSeek-V4. В неё вошли две MoE-модели: V4-Pro с 1,6 трлн параметров и V4-Flash...

Проверка текста нейросетью: частые ошибки новичков

Люди приходят к нейросети с текстом так же, как раньше несли его редактору: «вот, посмотри, всё ли нормально»....

Kling представил VIDEO 2.6 — ИИ-модель, которая генерирует видео и звук за один прогон

Kling запустил модель VIDEO 2.6 — свой первый генератор, который создаёт картинку и звук одновременно. Один запрос превращается...

OpenAI покажет человекоподобного робота в 2027 году

OpenAI планирует создать собственного человекоподобного робота. Об этом глава компании Сэм Альтман рассказал в начале сентября. Ранее Альтман...

«Ёбидоёби» запустила коллаборацию с Atomic Heart

Служба доставки «Ёбидоёби» запустила коллаборацию с Atomic Heart. В меню появился одноимённый набор из 40 роллов в лимитированной...

Kling добавила нативную генерацию в 4K в версии Video 3.0

Kling запустила режим 4K Mode в линейке Video 3.0. Теперь видео можно генерировать сразу в 4K — без...

Comfy MCP: ComfyUI подключает ИИ-агентов к своим пайплайнам генерации

Команда ComfyUI открыла публичную бету Comfy MCP - коннектор, через который ИИ-агенты вроде Claude, Codex, Cursor и Hermes...

Выход CapCut Video Studio и интеграция Dreamina Seedance 2.0 в CapCut

CapCut представила Video Studio - новый ИИ-режим создания роликов внутри веб-версии сервиса. Продукт важен не только как очередная...

Промты для создания стикеров по фото в ChatGPT, +лучшие ИИ для стикеров

С помощью ИИ теперь можно за несколько минут сделать собственный набор стикеров для Telegram, Discord или соцсетей —...

Гайд по размерам для YouTube: шапка канала, обложка видео, Shorts, аватар, лого

Если вы загружаете ролики на YouTube и оформляете канал, размеры лучше определить заранее. Иначе шапка обрежется на смартфоне,...

Вышла Kling Video 3.0 — ИИ-модель для генерации видео из нескольких сцен

Kuaishou выпустила Kling Video 3.0 — новую версию своей модели для генерации видео. Ключевое изменение — теперь ролик...

Veo 3.1 уже доступна на WaveSpeedAI — создаёт видео из текста и картинок

Платформа WaveSpeedAI представила интеграцию с новой моделью Google Veo 3.1 — одной из самых продвинутых ИИ-моделей для генерации...

Яндекс сводит аналитику данных в одну платформу

Yandex B2B Tech анонсировала DataLens Platform, платформу для работы с корпоративными данными от загрузки и хранения до отчётов...

Krea AI представила Krea 2 – собственную модель для генерации изображений

Krea AI 12 мая 2026 года анонсировала Krea 2 — новую модель для генерации изображений. В ветке компания...

Новое поколение DLSS 5 от NVIDIA: революционный ИИ-рендеринг выйдет 3 сентября

Компания NVIDIA официально анонсировала технологию DLSS 5, запуск которой запланирован на 3 сентября 2026 года. Первой игрой с...

OpenAI выпустила GPT-6 Sol и Luna и вдвое снизила цены

OpenAI выпустила GPT-6 Sol и GPT-6 Luna, среднюю и младшую модели поколения GPT-6. Они построены на наработках флагманской...

Стал известен размер экрана iPhone 20 Pro и Pro Max

В сети появились первые подробности об экранах iPhone 20 Pro и iPhone 20 Pro Max. По данным инсайдера...

Будущий дата-центр Amazon в Техасе может стать главным источником углеродных выбросов в США

В рамках проекта дата-центра в округе Пекос, штат Техас, Amazon инвестирует в расположенную на площадке электростанцию, которая может...

OpenAI представила GPT 5.6. Три модели, новые агенты и снижение цен

Летом 2026 года компания OpenAI представила свое новое семейство моделей под общим названием GPT 5.6. Релиз получился довольно...

Alibaba выложила Qwen-Image-2.1 – картинки с прозрачным фоном из коробки

Команда Qwen выложила в открытый доступ Qwen-Image-2.1 - модель, которая рисует изображения сразу с прозрачным фоном и правит...