• Виктор
  • Блог
  • 2 мин. чтения

Luma Labs представила модель Uni-1 которая думает и рисует одновременно


Luma Labs представила Uni-1 – первую генеративную модель, которая объединяет мышление и создание изображений в одном процессе. Система не просто выполняет команды, а анализирует намерение пользователя и формирует визуальный результат «на лету». Разработка уже доступна для тестирования и может изменить подход к генерации контента.

Luma Labs представила модель Uni-1 которая думает и рисует одновременно

23 марта компания Luma Labs AI объявила о запуске новой генеративной модели Uni-1 . Это первая система, в которой понимание запроса и создание изображения происходят одновременно, без разделения на отдельные этапы. Разработчики уже открыли доступ к тестированию на собственной платформе.

Главное отличие Uni-1 – архитектура Unified Intelligence . Она позволяет модели не просто реагировать на текстовые команды, а разбираться в намерениях пользователя и корректировать результат прямо в процессе генерации. По сути, система «размышляет» вместе с человеком, что заметно влияет на итоговое качество изображений.

Как устроена новая архитектура

В основе Uni-1 лежит автогенеративный трансформер decoder-only – тот же принцип, что используется в больших языковых моделях. Однако здесь текст и визуальные данные объединены в единую последовательность токенов. Это означает, что модель не делит процесс на «понимание» и «рисование», а всё происходит в одном вычислительном проходе.

В отличие от диффузионных моделей, которые начинают с шума и постепенно его очищают, Uni-1 предсказывает результат шаг за шагом. Она генерирует как слова, так и элементы изображения последовательно, одновременно проверяя логичность сцены, освещение и физику объектов.

По сути, модель работает как художник, который не просто рисует, а постоянно задаёт себе вопросы: «А правильно ли падает тень?», «Соответствует ли перспектива?» и сразу вносит правки.

Пространственное мышление и логика

Одной из ключевых особенностей Uni-1 стало развитое пространственное мышление. Модель умеет достраивать сцены, учитывать взаимное расположение объектов и сохранять физическую правдоподобность.

Например, при редактировании изображения она корректно пересчитывает освещение, перспективу и взаимодействие элементов. Это особенно важно для сложных композиций, где традиционные модели часто допускают ошибки.

По данным внутренних тестов, Uni-1 показывает высокие результаты в задачах, требующих логики и последовательного анализа. В частности, она лидирует в бенчмарке RISEBench, ориентированном на визуальное редактирование с учётом рассуждений.

Работа с референсами

Модель получила продвинутые инструменты управления через эталонные изображения. Пользователь может загрузить фотографию, эскиз или любой визуальный пример, а Uni-1 сохранит стиль, композицию и ключевые детали при генерации нового контента.

Это открывает возможности для создания серий изображений в едином стиле, редактирования существующих работ и точного контроля результата без длинных текстовых описаний.

Культурная адаптация

Разработчики отдельно подчёркивают способность модели учитывать культурный контекст. Uni-1 понимает стили – от интернет-мемов и манги до классических художественных направлений и адаптирует визуальный язык под задачу. В базе системы более 70 художественных стилей, и при этом она сохраняет смысл изображения, а не просто копирует визуальные элементы.

Интеграция с документами

Uni-1 используется внутри платформы Luma Agents , которая поддерживает работу с текстовыми материалами. Пользователи могут загружать PDF-файлы, сценарии, презентации и другие документы.

поддерживает работу с текстовыми материалами

Система способна анализировать содержимое, выделять ключевые идеи, создавать краткие пересказы и превращать текст в визуальные или креативные результаты. Это делает модель инструментом не только для дизайнеров, но и для продюсеров, маркетологов и сценаристов.

текст в визуальные или

Результаты и стоимость

По внутренним оценкам Luma Labs, Uni-1 заняла первое место в рейтинге пользовательских предпочтений (Elo) по качеству изображений, стилю и редактированию, а также по работе с референсами. В категории text-to-image модель уступила только одной системе.

рейтинг пользовательских предпочтений Elo

Стоимость генерации составляет около 0,09 доллара за изображение в разрешении 2K (примерно 8–9 рублей), что делает её более доступной по сравнению с рядом конкурентов.

Пользователи, уже протестировавшие модель, отмечают важное изменение: теперь не нужно подробно прописывать длинные промпты. Достаточно описать идею, а остальное система достраивает самостоятельно.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

15+ способов продвижения сообщества ВКонтакте в 2026 году

ВКонтакте постоянно меняется: обновляются алгоритмы рекомендаций, появляются новые форматы контента и способы взаимодействия с аудиторией. Поэтому схема «создать...

Будущий дата-центр Amazon в Техасе может стать главным источником углеродных выбросов в США

В рамках проекта дата-центра в округе Пекос, штат Техас, Amazon инвестирует в расположенную на площадке электростанцию, которая может...

OpenAI представила обновлённый ChatGPT Images: до 4× быстрее и с новым творческим пространством

OpenAI выпустила обновлённую функцию ChatGPT Images - новый встроенный генератор изображений, который стал быстрее, точнее и удобнее для...

DeepSeek представила DeepSeek-OCR — новую модель для сжатия визуального контекста в LLM

Компания DeepSeek показала DeepSeek-OCR — OCR-модель, созданную специально для больших языковых моделей. Вместо обычного распознавания текста она сжимает...

Alibaba представила Qwen 3.8‑Max на 2,4 трлн параметров — открытые веса выйдут на следующей неделе

Alibaba представила Qwen3.8‑Max — новую флагманскую ИИ-модель с 2,4 трлн параметров. Сейчас она доступна в Qwen Studio и...

Google выпустила Nano Banana 2 Lite — быструю модель для генерации изображений через Gemini API

Google выпустила Nano Banana 2 Lite (gemini-3.1-flash-lite-image) — новую модель для генерации и редактирования изображений. Это самая быстрая...

Вышел Kling O1 — рассуждающая нейросеть для генерации и редактирования видео

Kling AI выпустила новую ИИ-модель Kling O1 (Omni One). Это рассуждающая нейросеть, которая генерирует видео по тексту и...

Обзор платформы lava.top

lava.top — это международная платформа для продажи контента, позволяющая создавать и продавать цифровые продукты без подключения дополнительных платежных...

OpenAI выпустила GPT Image 2 и ChatGPT Images 2.0

OpenAI представила GPT Image 2 для API и одновременно обновила генерацию изображений в ChatGPT до версии Images 2.0....

Sakana Fugu: ИИ, который учится управлять другими ИИ

22 июня 2026 года японская лаборатория Sakana AI (Токио) представила свой новый коммерческий продукт под названием Sakana Fugu....

MiniMax Hub добавил аудиомодели и готовые процессы для производства видео

MiniMax обновила творческую платформу MiniMax Hub. В ней появились аудиомодели ElevenLabs Music v2 и Seed Audio 1.0, готовые...

Kling представила Avatar 2.0 — длина видео до 5 минут, «чистый» липсинк и «живая» мимика 

Разработчики Kling AI (Kuaishou) выпустили модель Avatar 2.0 — обновление инструмента для создания говорящих цифровых аватаров. Релиз состоялся...

YouTube запустил генерацию видео с помощью Veo 2 для Shorts

YouTube представил новую функцию для генерации коротких роликов в Shorts, интегрировав ИИ-модель Veo 2 от Google в инструмент...

Нейросеть Sora 2: как пользоваться, где взять инвайт, возможности, как скачать

OpenAI представила Sora 2 — новую версию своей видеомодели, которая автоматически генерирует короткие ролики со звуком и синхронной...

GLM 5.3: мощнее в коде и кибербезопасности

14 августа 2026 года уже упоминавшаяся нами в предыдущих обзорах компания Zhipu AI представила следующую версию своей флагманской...

Google выпустила Nano Banana 2 Lite и Gemini Omni Flash

30 июня Google открыла доступ к двум новым моделям генеративной графики и видео - Nano Banana 2 Lite...

ElevenLabs теперь можно подключить к Claude через MCP

ElevenLabs представила MCP-сервер для Claude. Он позволяет управлять агентами ElevenLabs из чата в Claude. Коннектор уже появился в...

Gemini взломала три компании на испытаниях и остановилась сама

Gemini во время майских кибериспытаний вошла в системы трёх реальных компаний. В одном случае модель подобрала пароль, в...

YouTube позволит генерировать Shorts с помощью Veo 3

На мероприятии «Made on YouTube» 16 сентября компания представила большое обновление для Shorts и YouTube Studio. В сервис...

Grok 4.7 обогнал более дорогих конкурентов в юридических задачах

SpaceXAI выпустила Grok 4.7 - флагманскую модель для программирования и долгой рабочей рутины. Она заметно прибавила против Grok...