• Виктор
  • Блог
  • 2 мин. чтения

Runway показала GWM Worlds 2 – интерактивный мир вместо видеоролика


Runway 3 сентября показала GWM Worlds 2 – мировую модель, которая выдаёт живое интерактивное пространство вместо готового ролика. Картинка идёт непрерывным потоком в 720p при 24 кадрах в секунду, звук генерируется вместе с ней, а происходящим управляют текстом и движением камеры прямо во время генерации.

Runway показала GWM Worlds 2 - интерактивный мир вместо видеоролика

Мировые модели — отдельная ветка генеративного видео. Вместо готового клипа они держат сцену, по которой можно перемещаться, и достраивают её под действия зрителя. Runway описывает свой релиз как переход от генерации видео к симуляции и называет четыре области применения: интерактивные развлечения, виртуальные персонажи, робототехника с симуляцией агентов и генеративный дизайн. Пока это research preview, исследовательская демонстрация без публичного доступа.

Джетпак, зонт и затопленная комната

У сессии в GWM Worlds 2 нет заранее заданной длины. Модель не проигрывает заготовленный клип и не следует сценарию — каждый новый ввод продолжает мир с того состояния, в котором он находится. Пользователь задаёт окружение, действующих персонажей, визуальный стиль, физические правила и атмосферу, а дальше управляет происходящим командами и непрерывным движением камеры.

Заявленный набор действий заметно шире перемещения по локации:

  • навигация от первого и от третьего лица — ходьба, бег, полёт, езда, осмотр по сторонам, причём камера и персонаж управляются независимо;
  • произвольные действия субъектов, от лазания и рывка на джетпаке до выстрела из лазерного пистолета, включения лампы и раскрытия зонта;
  • события всей сцены целиком, например затопление комнаты или смена погоды;
  • диалоги персонажей с контролем голоса, интонации и языка речи, причём артикуляция генерируется синхронно с озвучкой.

WorldPrompt делит мир на два слоя

Для описания мира Runway предложила собственный формат ввода — WorldPrompt. Он разделяет состояние сцены на то, что сохраняется постоянно, и то, что меняется во времени.

Постоянный слой включает genesis prompt, описание сцены с её геометрией, материалами, освещением и фоновым звуком. Туда же идут список субъектов с их свойствами и «законы» мира — гравитация, столкновения, способности персонажей, ракурс камеры. Дополнительно задаётся первый кадр, который визуально заземляет генерацию.

Второй слой — поток событий с временными метками. Каждое действие представляет собой свободный текст с началом и концом, адресованный конкретному субъекту или сцене целиком. Действия могут накладываться друг на друга, а отдельным потоком идёт покадровое положение и поворот камеры.

От киносценария до реального времени

Runway описывает три режима работы с моделью:

  • заранее — весь поток событий пишется до старта, при желании с помощью языковой модели, после чего система генерирует итоговое видео со звуком целиком; это ближе к режиссуре;
  • пошагово — генерация останавливается в точках выбора, подходит для визуальных новелл;
  • в реальном времени — действия влияют на поток немедленно, и именно этот режим нужен играм и интерактивным проектам.

Здесь же обозначено главное техническое ограничение подхода. Набирать текст на ходу слишком медленно, а внешние мультимодальные модели не успевают реагировать за десятки миллисекунд. В демонстрации проблему обходят привязкой готовых промптов к клавишам и мыши: клавиша движения вперёд соответствует фразе «персонаж идёт вперёд», клик — броску мяча. Разработчики признают, что качество в таком режиме ниже, чем при заранее написанном сценарии, потому что развёрнутый текст успевает описать гораздо больше деталей сцены. Свободный текст как интерфейс управления пока остаётся на бумаге — в живом демо это обычная игровая раскладка.

Мультиплеер и мир одной фразой

Поскольку GWM Worlds 2 оперирует понятием субъекта, разные пользователи могут управлять разными персонажами одновременно. В демоверсии это сделано через роли — «игрок 1», «игрок 2», «режиссёр», — у каждой свой набор доступных действий. Трансляция видео и звука всем участникам организована на базе LiveKit, а клиент выбирает роль при подключении.

Отдельно показан сценарий авторинга. Вместо ручного написания genesis prompt и списка действий пользователь вводит короткую фразу вроде «кроссовый мотоцикл от третьего лица в заснеженном ландшафте», а языковая модель сама собирает первый кадр, описание мира и раскладку действий по клавишам. Всё это можно отредактировать до запуска, и путь от идеи до готового мира занимает секунды.

Почему картинку уводит при быстрых движениях

GWM Worlds 2 устроена как авторегрессионная диффузионная модель, генерирующая видео и аудио разом. На каждом шаге она опирается на три типа контекста — глобальный (genesis prompt и первый кадр), текущий кадр (положение камеры и активные текстовые действия) и уже сгенерированные кадры, которые хранятся в скользящем окне кэша. Старые кадры из этого окна вытесняются, декодеры видео и звука работают с кэшем ради скорости.

Отсюда и слабые места, которые Runway перечисляет открыто. Генерация в реальном времени меняет качество на скорость, и при быстрых движениях камеры детали, текстуры и геометрия начинают плыть. Долговременная согласованность мира несовершенна, а референсные изображения, кроме первого кадра, не поддерживаются. Полноценное управление свободным текстом требует внешней обвязки, которая отслеживала бы состояние мира и генерировала действия на лету, например реплики неигровых персонажей.

Компания сравнивает нынешний этап с ранней историей офлайновой генерации видео. Та прошла путь от коротких грубых клипов до материала продакшен-качества. В реальном времени, по мнению разработчиков, повторится та же кривая, а GWM Worlds 2 они называют очень ранней точкой на ней.

Google и World Labs идут иначе

GWM Worlds 2 продолжает линейку GWM-1, представленную в декабре 2025 года вместе с вариантами для миров, роботов и аватаров. С тех пор Runway закрыла раунд Series E на 315 млн долларов при оценке в 5,3 млрд, пообещав направить деньги на предобучение следующего поколения мировых моделей.

Конкуренция в сегменте плотная. Google раздаёт доступ к экспериментальному Project Genie на базе Genie 3 подписчикам старших тарифов, World Labs вывела на рынок Marble для генерации трёхмерных пространств, а профильные стартапы за 2026 год привлекли сотни миллионов долларов каждый. Ставка Runway на этом фоне выглядит специфично. Компания строит непрерывный аудиовизуальный поток, которым управляют текстом, без трёхмерной сцены и игрового движка под ним, с расчётом на то, что тот же интерфейс пригодится и для развлечений, и для обучения роботов.

Граница между роликом, игрой и агентом

Публичного доступа, ценника или листа ожидания Runway пока не объявляла, анонс ограничен исследовательской страницей и демонстрационным роликом. Судить об успехе можно будет по первому показу вне демо — когда мир придётся держать дольше пары минут и на чужом сценарии.

Практический смысл релиза для отрасли скорее концептуальный. Если управление симуляцией сводится к тексту с временными метками, граница между «снять видео», «сделать игру» и «обучить агента» становится куда менее чёткой, чем сейчас.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

ElevenLabs добавила генерацию речи, музыки, изображений и видео в MCP

ElevenLabs расширила свой MCP-сервер. Теперь подключённый ИИ-ассистент может создавать речь, музыку, звуковые эффекты, изображения и видео, а также...

15 главных сериалов октября 2026 года, которые нельзя пропустить

Октябрь — самое время доставать плед, заваривать что-нибудь горячее и устраивать длинные вечера за просмотром сериалов. Тем более...

ByteDance выпустила Seedream 5.0 Pro для инфографики и точного редактирования изображений

ByteDance Seed 8 июля 2026 года представила Seedream 5.0 Pro - мультимодальную модель для генерации и редактирования изображений....

Промты для коллажей — как сделать коллаж по фото с помощью ИИ

Хотите красивые фоточки для соцсетей, но без одинаковых селфи? Держите 5 промтов для трендовых коллажей: неон ночью, дождь...

Grok 4.7 обогнал более дорогих конкурентов в юридических задачах

SpaceXAI выпустила Grok 4.7 - флагманскую модель для программирования и долгой рабочей рутины. Она заметно прибавила против Grok...

Krea AI представила Krea 2 – собственную модель для генерации изображений

Krea AI 12 мая 2026 года анонсировала Krea 2 — новую модель для генерации изображений. В ветке компания...

⚔️ Тестиум: ChatGPT или DeepSeek — кто лучше пишет тексты?

Привет! Меня зовут Анатолий Чупин. Я редактор сайта Postium, исследователь ИИ и автор Telegram-канала «Промты — и точка»....

Perplexity открыла исходный код Lily — движка для локальной работы ИИ на Mac

Perplexity открыла исходный код Lily — лёгкого движка инференса для локальной работы с моделями в Perplexity Computer. Он...

Как повторить тренд из «Форсажа» с помощью ИИ — гайд

В соцсетях завирусился ИИ-тренд по мотивам «Форсажа»: пользователи пересобирают культовые сцены из Tokyo Drift, подставляя в кадр собственные...

Pika Labs запустила Pika Agents

Pika Labs вывела Pika Agents в открытый доступ и предложила другой способ работы с генеративным ИИ. Вместо привычного...

Вышла Kling Video 3.0 — ИИ-модель для генерации видео из нескольких сцен

Kuaishou выпустила Kling Video 3.0 — новую версию своей модели для генерации видео. Ключевое изменение — теперь ролик...

OpenAI выпустила ChatGPT Images 2.5 — генерация стала быстрее, а изображения можно точечно доработать

OpenAI выпустила ChatGPT Images 2.5 — обновлённую модель для генерации и редактирования изображений в ChatGPT. Компания заявляет, что...

ElevenLabs запустила Flows Agent в ElevenCreative — агент строит workflow по текстовому запросу

ElevenLabs представила Flows Agent в ElevenCreative. Пользователь описывает, что хочет создать, а ИИ-агент подбирает модели, добавляет узлы на...

Midjourney V8.1 ускорилась и вернула стиль

Midjourney выпустила альфа-версию V8.1, в которой разработчики сделали ставку на баланс: вернули фирменный визуальный стиль, ускорили генерацию и...

DeepSeek представила DeepSeek-OCR — новую модель для сжатия визуального контекста в LLM

Компания DeepSeek показала DeepSeek-OCR — OCR-модель, созданную специально для больших языковых моделей. Вместо обычного распознавания текста она сжимает...

Alibaba представила Qwen 3.8‑Max на 2,4 трлн параметров — открытые веса выйдут на следующей неделе

Alibaba представила Qwen3.8‑Max — новую флагманскую ИИ-модель с 2,4 трлн параметров. Сейчас она доступна в Qwen Studio и...

Проверка текста нейросетью: частые ошибки новичков

Люди приходят к нейросети с текстом так же, как раньше несли его редактору: «вот, посмотри, всё ли нормально»....

YouTube позволит генерировать Shorts с помощью Veo 3

На мероприятии «Made on YouTube» 16 сентября компания представила большое обновление для Shorts и YouTube Studio. В сервис...

Kling 4.0 выйдет в октябре, а Flash уже доступна подписчикам Ultra

Kling AI анонсировала видеомодель Kling 4.0 с выходом в октябре, а облегчённая Kling 4.0 Flash уже работает у...

ByteDance открыла публичный API Seedance 2.5

7 августа Volcano Engine открыла публичный API Seedance 2.5 - видеомодели ByteDance, которая одним проходом собирает 30-секундный ролик...