• Виктор
  • Блог
  • 2 мин. чтения

Runway показала GWM Worlds 2 – интерактивный мир вместо видеоролика


Runway 3 сентября показала GWM Worlds 2 – мировую модель, которая выдаёт живое интерактивное пространство вместо готового ролика. Картинка идёт непрерывным потоком в 720p при 24 кадрах в секунду, звук генерируется вместе с ней, а происходящим управляют текстом и движением камеры прямо во время генерации.

Runway показала GWM Worlds 2 - интерактивный мир вместо видеоролика

Мировые модели — отдельная ветка генеративного видео. Вместо готового клипа они держат сцену, по которой можно перемещаться, и достраивают её под действия зрителя. Runway описывает свой релиз как переход от генерации видео к симуляции и называет четыре области применения: интерактивные развлечения, виртуальные персонажи, робототехника с симуляцией агентов и генеративный дизайн. Пока это research preview, исследовательская демонстрация без публичного доступа.

Джетпак, зонт и затопленная комната

У сессии в GWM Worlds 2 нет заранее заданной длины. Модель не проигрывает заготовленный клип и не следует сценарию — каждый новый ввод продолжает мир с того состояния, в котором он находится. Пользователь задаёт окружение, действующих персонажей, визуальный стиль, физические правила и атмосферу, а дальше управляет происходящим командами и непрерывным движением камеры.

Заявленный набор действий заметно шире перемещения по локации:

  • навигация от первого и от третьего лица — ходьба, бег, полёт, езда, осмотр по сторонам, причём камера и персонаж управляются независимо;
  • произвольные действия субъектов, от лазания и рывка на джетпаке до выстрела из лазерного пистолета, включения лампы и раскрытия зонта;
  • события всей сцены целиком, например затопление комнаты или смена погоды;
  • диалоги персонажей с контролем голоса, интонации и языка речи, причём артикуляция генерируется синхронно с озвучкой.

WorldPrompt делит мир на два слоя

Для описания мира Runway предложила собственный формат ввода — WorldPrompt. Он разделяет состояние сцены на то, что сохраняется постоянно, и то, что меняется во времени.

Постоянный слой включает genesis prompt, описание сцены с её геометрией, материалами, освещением и фоновым звуком. Туда же идут список субъектов с их свойствами и «законы» мира — гравитация, столкновения, способности персонажей, ракурс камеры. Дополнительно задаётся первый кадр, который визуально заземляет генерацию.

Второй слой — поток событий с временными метками. Каждое действие представляет собой свободный текст с началом и концом, адресованный конкретному субъекту или сцене целиком. Действия могут накладываться друг на друга, а отдельным потоком идёт покадровое положение и поворот камеры.

От киносценария до реального времени

Runway описывает три режима работы с моделью:

  • заранее — весь поток событий пишется до старта, при желании с помощью языковой модели, после чего система генерирует итоговое видео со звуком целиком; это ближе к режиссуре;
  • пошагово — генерация останавливается в точках выбора, подходит для визуальных новелл;
  • в реальном времени — действия влияют на поток немедленно, и именно этот режим нужен играм и интерактивным проектам.

Здесь же обозначено главное техническое ограничение подхода. Набирать текст на ходу слишком медленно, а внешние мультимодальные модели не успевают реагировать за десятки миллисекунд. В демонстрации проблему обходят привязкой готовых промптов к клавишам и мыши: клавиша движения вперёд соответствует фразе «персонаж идёт вперёд», клик — броску мяча. Разработчики признают, что качество в таком режиме ниже, чем при заранее написанном сценарии, потому что развёрнутый текст успевает описать гораздо больше деталей сцены. Свободный текст как интерфейс управления пока остаётся на бумаге — в живом демо это обычная игровая раскладка.

Мультиплеер и мир одной фразой

Поскольку GWM Worlds 2 оперирует понятием субъекта, разные пользователи могут управлять разными персонажами одновременно. В демоверсии это сделано через роли — «игрок 1», «игрок 2», «режиссёр», — у каждой свой набор доступных действий. Трансляция видео и звука всем участникам организована на базе LiveKit, а клиент выбирает роль при подключении.

Отдельно показан сценарий авторинга. Вместо ручного написания genesis prompt и списка действий пользователь вводит короткую фразу вроде «кроссовый мотоцикл от третьего лица в заснеженном ландшафте», а языковая модель сама собирает первый кадр, описание мира и раскладку действий по клавишам. Всё это можно отредактировать до запуска, и путь от идеи до готового мира занимает секунды.

Почему картинку уводит при быстрых движениях

GWM Worlds 2 устроена как авторегрессионная диффузионная модель, генерирующая видео и аудио разом. На каждом шаге она опирается на три типа контекста — глобальный (genesis prompt и первый кадр), текущий кадр (положение камеры и активные текстовые действия) и уже сгенерированные кадры, которые хранятся в скользящем окне кэша. Старые кадры из этого окна вытесняются, декодеры видео и звука работают с кэшем ради скорости.

Отсюда и слабые места, которые Runway перечисляет открыто. Генерация в реальном времени меняет качество на скорость, и при быстрых движениях камеры детали, текстуры и геометрия начинают плыть. Долговременная согласованность мира несовершенна, а референсные изображения, кроме первого кадра, не поддерживаются. Полноценное управление свободным текстом требует внешней обвязки, которая отслеживала бы состояние мира и генерировала действия на лету, например реплики неигровых персонажей.

Компания сравнивает нынешний этап с ранней историей офлайновой генерации видео. Та прошла путь от коротких грубых клипов до материала продакшен-качества. В реальном времени, по мнению разработчиков, повторится та же кривая, а GWM Worlds 2 они называют очень ранней точкой на ней.

Google и World Labs идут иначе

GWM Worlds 2 продолжает линейку GWM-1, представленную в декабре 2025 года вместе с вариантами для миров, роботов и аватаров. С тех пор Runway закрыла раунд Series E на 315 млн долларов при оценке в 5,3 млрд, пообещав направить деньги на предобучение следующего поколения мировых моделей.

Конкуренция в сегменте плотная. Google раздаёт доступ к экспериментальному Project Genie на базе Genie 3 подписчикам старших тарифов, World Labs вывела на рынок Marble для генерации трёхмерных пространств, а профильные стартапы за 2026 год привлекли сотни миллионов долларов каждый. Ставка Runway на этом фоне выглядит специфично. Компания строит непрерывный аудиовизуальный поток, которым управляют текстом, без трёхмерной сцены и игрового движка под ним, с расчётом на то, что тот же интерфейс пригодится и для развлечений, и для обучения роботов.

Граница между роликом, игрой и агентом

Публичного доступа, ценника или листа ожидания Runway пока не объявляла, анонс ограничен исследовательской страницей и демонстрационным роликом. Судить об успехе можно будет по первому показу вне демо — когда мир придётся держать дольше пары минут и на чужом сценарии.

Практический смысл релиза для отрасли скорее концептуальный. Если управление симуляцией сводится к тексту с временными метками, граница между «снять видео», «сделать игру» и «обучить агента» становится куда менее чёткой, чем сейчас.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

OpenAI выпустила ChatGPT Images 2.5 — генерация стала быстрее, а изображения можно точечно доработать

OpenAI выпустила ChatGPT Images 2.5 — обновлённую модель для генерации и редактирования изображений в ChatGPT. Компания заявляет, что...

ElevenLabs выпустила Music v2.5 с улучшенным звуком и точным следованием запросу

ElevenLabs представила Music v2.5 — новую версию модели для генерации музыки. Она создаёт более многослойные композиции, точнее следует...

Маркетолог PRO от MTC ADS: отзывы и возможности сервиса для запуска бизнес-рекламы в Telegram

Результативность рекламной кампании зависит от десятков, даже сотен факторов. Один из основных критериев — определение целевой аудитории и...

Suno выпустила бесплатную модель «v4.5-all» — нейросеть создаёт топовую музыку и вокал

Нейросеть Suno AI официально заменила старую модель «v3.5» на более новую «v4.5-all» в бесплатной версии сервиса. Теперь пользователи...

Нейросеть DeepSeek: регистрация, вход в личный кабинет и как пользоваться на русском бесплатно

DeepSeek – это одна из самых мощных нейросетей, доступная в России бесплатно и без VPN. Поддерживает русский язык...

Anthropic объединила чат с Cowork и встроила редакторы документов и слайдов прямо в Claude

Anthropic объединила стандартный диалоговый чат и рабочий режим Cowork в единый интерфейс Claude. Модель теперь сама определяет характер...

Новое поколение DLSS 5 от NVIDIA: революционный ИИ-рендеринг выйдет 3 сентября

Компания NVIDIA официально анонсировала технологию DLSS 5, запуск которой запланирован на 3 сентября 2026 года. Первой игрой с...

Килиан Мбаппе ушёл от Nike и стал амбассадором бренда On

Швейцарский производитель спортивной одежды и обуви On заключил контракт с нападающим «Реала» и сборной Франции Килианом Мбаппе. Футболист...

Вышел Kling O1 — рассуждающая нейросеть для генерации и редактирования видео

Kling AI выпустила новую ИИ-модель Kling O1 (Omni One). Это рассуждающая нейросеть, которая генерирует видео по тексту и...

OpenAI интегрировала ChatGPT в Microsoft Word через общую офисную надстройку

OpenAI выпустила интеграцию ChatGPT для текстового редактора Microsoft Word. Инструмент встраивается в боковую панель программы и доступен на...

Промты для создания стикеров по фото в ChatGPT, +лучшие ИИ для стикеров

С помощью ИИ теперь можно за несколько минут сделать собственный набор стикеров для Telegram, Discord или соцсетей —...

Tencent выпустила Hy Image 3.5 Preview для генерации и редактирования изображений

Tencent открыла доступ к Hy Image 3.5 Preview — модели, которая создаёт изображения по тексту и референсам, а...

ImagineArt показала модель 2.0

ImagineArt представила модель ImagineArt 2.0 и делает ставку на то, что в генерации изображений пользователям важен уже не...

Google запустила Pics — ИИ-редактор изображений на базе Nano Banana

Google начала постепенно открывать доступ к Google Pics — новому ИИ-редактору изображений для Google Workspace на базе модели...

Anthropic выпустила Claude Opus 5.5 – уровень Fable за меньшие деньги

Anthropic выпустила Claude Opus 5.5, первую модель нового поколения Claude 5.5. По заявлению компании, на большинстве задач она...

Pika превратила генератор видео в платформу с набором приложений и мультимодельным стеком

Компания Pika запустила обновленную креативную платформу на pika.art. Сервис перестроили вокруг специализированных мини-приложений для видеомонтажа, ретуши и работы...

Новые фишки и функции iOS 27 для iPhone — 13 главных обновлений

Недавно Apple выпустила iOS 27 — обновление доступно для iPhone 11 и более новых моделей, а также iPhone...

MiniMax выпустила видеомодель H3 – ролики в 2K со звуком

MiniMax 31 июля представила H3 - мультимодальную видеомодель, которая принимает текст, изображения, видео и звук и выдаёт ролики...

Нейросеть Sora 2: как пользоваться, где взять инвайт, возможности, как скачать

OpenAI представила Sora 2 — новую версию своей видеомодели, которая автоматически генерирует короткие ролики со звуком и синхронной...

Alibaba выпустила Qwen-Image-3.0 без весов и бенчмарков, но с промптами на 4500 токенов

Alibaba выпустила Qwen-Image-3.0 - третье поколение генератора изображений с прицелом на практическую пользу: длинные детальные подписи, читаемый мелкий...