• Виктор
  • Блог
  • 2 мин. чтения

Luma Labs представила модель Uni-1 которая думает и рисует одновременно


Luma Labs представила Uni-1 – первую генеративную модель, которая объединяет мышление и создание изображений в одном процессе. Система не просто выполняет команды, а анализирует намерение пользователя и формирует визуальный результат «на лету». Разработка уже доступна для тестирования и может изменить подход к генерации контента.

Luma Labs представила модель Uni-1 которая думает и рисует одновременно

23 марта компания Luma Labs AI объявила о запуске новой генеративной модели Uni-1 . Это первая система, в которой понимание запроса и создание изображения происходят одновременно, без разделения на отдельные этапы. Разработчики уже открыли доступ к тестированию на собственной платформе.

Главное отличие Uni-1 – архитектура Unified Intelligence . Она позволяет модели не просто реагировать на текстовые команды, а разбираться в намерениях пользователя и корректировать результат прямо в процессе генерации. По сути, система «размышляет» вместе с человеком, что заметно влияет на итоговое качество изображений.

Как устроена новая архитектура

В основе Uni-1 лежит автогенеративный трансформер decoder-only – тот же принцип, что используется в больших языковых моделях. Однако здесь текст и визуальные данные объединены в единую последовательность токенов. Это означает, что модель не делит процесс на «понимание» и «рисование», а всё происходит в одном вычислительном проходе.

В отличие от диффузионных моделей, которые начинают с шума и постепенно его очищают, Uni-1 предсказывает результат шаг за шагом. Она генерирует как слова, так и элементы изображения последовательно, одновременно проверяя логичность сцены, освещение и физику объектов.

По сути, модель работает как художник, который не просто рисует, а постоянно задаёт себе вопросы: «А правильно ли падает тень?», «Соответствует ли перспектива?» и сразу вносит правки.

Пространственное мышление и логика

Одной из ключевых особенностей Uni-1 стало развитое пространственное мышление. Модель умеет достраивать сцены, учитывать взаимное расположение объектов и сохранять физическую правдоподобность.

Например, при редактировании изображения она корректно пересчитывает освещение, перспективу и взаимодействие элементов. Это особенно важно для сложных композиций, где традиционные модели часто допускают ошибки.

По данным внутренних тестов, Uni-1 показывает высокие результаты в задачах, требующих логики и последовательного анализа. В частности, она лидирует в бенчмарке RISEBench, ориентированном на визуальное редактирование с учётом рассуждений.

Работа с референсами

Модель получила продвинутые инструменты управления через эталонные изображения. Пользователь может загрузить фотографию, эскиз или любой визуальный пример, а Uni-1 сохранит стиль, композицию и ключевые детали при генерации нового контента.

Это открывает возможности для создания серий изображений в едином стиле, редактирования существующих работ и точного контроля результата без длинных текстовых описаний.

Культурная адаптация

Разработчики отдельно подчёркивают способность модели учитывать культурный контекст. Uni-1 понимает стили – от интернет-мемов и манги до классических художественных направлений и адаптирует визуальный язык под задачу. В базе системы более 70 художественных стилей, и при этом она сохраняет смысл изображения, а не просто копирует визуальные элементы.

Интеграция с документами

Uni-1 используется внутри платформы Luma Agents , которая поддерживает работу с текстовыми материалами. Пользователи могут загружать PDF-файлы, сценарии, презентации и другие документы.

поддерживает работу с текстовыми материалами

Система способна анализировать содержимое, выделять ключевые идеи, создавать краткие пересказы и превращать текст в визуальные или креативные результаты. Это делает модель инструментом не только для дизайнеров, но и для продюсеров, маркетологов и сценаристов.

текст в визуальные или

Результаты и стоимость

По внутренним оценкам Luma Labs, Uni-1 заняла первое место в рейтинге пользовательских предпочтений (Elo) по качеству изображений, стилю и редактированию, а также по работе с референсами. В категории text-to-image модель уступила только одной системе.

рейтинг пользовательских предпочтений Elo

Стоимость генерации составляет около 0,09 доллара за изображение в разрешении 2K (примерно 8–9 рублей), что делает её более доступной по сравнению с рядом конкурентов.

Пользователи, уже протестировавшие модель, отмечают важное изменение: теперь не нужно подробно прописывать длинные промпты. Достаточно описать идею, а остальное система достраивает самостоятельно.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

adidas и Arte Antwerp выпустят две новые версии F50 Motion

adidas и бельгийский бренд Arte Antwerp представили две новые версии кроссовок F50 Motion — лакированную чёрную и серебристую....

Suno вводит лимиты на скачивание — до 7 треков бесплатно

Suno объявила, что с 3 сентября введёт лимиты на скачивание созданной музыки. На бесплатном тарифе пользователи, зарегистрировавшиеся до...

PixVerse обновила партнёрскую программу для авторов AI-видео

PixVerse представила Global Creative Partner Program 2.0 - обновлённую партнёрскую программу для авторов AI-видео. Участникам обещают кредиты, денежные...

Лучшие агрегаторы нейросетей в России — 11 сервисов для генерации изображений, видео, текста

Агрегаторы ИИ в России позволяют получить доступ к ChatGPT, Claude, Gemini, Grok, Midjourney, Seedance, Kling и другим зарубежным...

Alibaba открыла QwenWork по всему миру — ИИ-агент работает в браузере и на компьютере

Alibaba открыла международную версию QwenWork в формате публичной беты. Это рабочая платформа с ИИ-агентом: пользователь описывает задачу обычным...

Лимиты использования в ChatGPT/Codex: где посмотреть и как сбросить

Даже на платных тарифах ChatGPT действуют лимиты на использование. Если они заканчиваются, сервис может прямо во время работы...

Google выпустила Nano Banana 2 Lite — быструю модель для генерации изображений через Gemini API

Google выпустила Nano Banana 2 Lite (gemini-3.1-flash-lite-image) — новую модель для генерации и редактирования изображений. Это самая быстрая...

Что изменилось в новой флагманской модели Anthropic Claude Opus 4.8

В мае 2026 года компания Anthropic обновила флагманскую модель Opus до версии 4.8. И на первый взгляд, этот...

OpenAI выпустила приложение Sora на Android — пока только в 7 странах

OpenAI представила Android-версию приложения Sora — инструмента для генерации коротких видео с помощью искусственного интеллекта. Скачать ИИ-генератор видео...

15+ способов продвижения сообщества ВКонтакте в 2026 году

ВКонтакте постоянно меняется: обновляются алгоритмы рекомендаций, появляются новые форматы контента и способы взаимодействия с аудиторией. Поэтому схема «создать...

OpenAI сняла лимиты на текстовые чаты в ChatGPT для всех пользователей

OpenAI объявила об отмене лимитов на текстовые чаты для всех пользователей ChatGPT. Сервис, по данным компании, недавно преодолел...

OpenAI бьёт по Apple в суде: «Вы сами не защитили свои секреты»

Ходатайство OpenAI об отклонении иска Apple о коммерческой тайне — вместе с новыми судебными материалами — показывает, какую...

Скоро выйдет Veo 3.1? Обещают стабильных персонажей и киношные пресеты

На платформе WaveSpeedAI появился тизер будущего релиза Google Veo 3.1. Судя по описанию, новое поколение видеомодели решит главную...

ByteDance открыла публичный API Seedance 2.5

7 августа Volcano Engine открыла публичный API Seedance 2.5 - видеомодели ByteDance, которая одним проходом собирает 30-секундный ролик...

Обзор платформы lava.top

lava.top — это международная платформа для продажи контента, позволяющая создавать и продавать цифровые продукты без подключения дополнительных платежных...

Synthesia встроила агента в редактор и обновила модель аватаров

Synthesia запустила Assistant - чат-агента, который собирает ролик из промпта, документа или ссылки прямо в редакторе и правит...

OpenAI представила GPT 5.6. Три модели, новые агенты и снижение цен

Летом 2026 года компания OpenAI представила свое новое семейство моделей под общим названием GPT 5.6. Релиз получился довольно...

ComfyUI заморозила новые бесплатные аккаунты в Comfy Cloud из-за злоупотреблений видеомоделями

ComfyUI временно остановила создание новых бесплатных аккаунтов в Comfy Cloud. Причина - инцидент со злоупотреблениями, в котором атаковали...

Google выпустила Nano Banana 2 Lite и Gemini Omni Flash

30 июня Google открыла доступ к двум новым моделям генеративной графики и видео - Nano Banana 2 Lite...

ElevenLabs выпустили Eleven v4 и v4 Turbo — ИИ для озвучки с управлением эмоциями и манерой речи

ElevenLabs представила новые модели синтеза речи Eleven v4 и Eleven v4 Turbo. Они построены на новой архитектуре и...