• Виктор
  • Блог
  • 2 мин. чтения

Alibaba выложила Qwen-Image-2.1 – картинки с прозрачным фоном из коробки


Команда Qwen выложила в открытый доступ Qwen-Image-2.1 – модель, которая рисует изображения сразу с прозрачным фоном и правит готовые картинки по обведённым кружком участкам. Веса появились на Hugging Face и ModelScope 20 сентября, но лицензия разрешает только исследования.

Alibaba выложила Qwen-Image-2.1 - картинки с прозрачным фоном из коробки

Qwen -Image-2.1 — новая открытая модель Alibaba , которая в одном пайплайне генерирует изображения по описанию и правит готовые. Команда Qwen подаёт релиз как самый компактный и экономичный в семействе. Веса выложены публично, демо работает бесплатно, а вот с лицензией придётся разбираться отдельно.

Прозрачный фон получается сразу, без вырезания

Главное, что отличает Qwen-Image-2.1 от предыдущих открытых генераторов, — нативная работа с альфа-каналом. Модель рисует объект на прозрачном фоне прямо по текстовому описанию, редактирует уже готовый прозрачный слой и вытаскивает предмет с обычной фотографии, сохраняя прозрачность вокруг него.

Для стикеров, иконок, логотипов и карточек товара это снимает целый шаг. Обычно картинку сначала генерируют, а фон убирают отдельным инструментом. Здесь прозрачность встроена в сам автокодировщик — 64-канальный RGBA с 16-кратным сжатием, поэтому альфа-канал не дорисовывается постобработкой.

Чтобы это включилось, модели нужно прямо сказать, что изображение прозрачное. Qwen рекомендует такую рамку запроса:

This is an RGBA image with transparency. Далее описание сцены. The image has alpha channel and the background is transparent.

Без этой формулировки модель отдаёт обычный кадр с фоном.

Десять референсов и правки кружком

Qwen-Image-2.1 принимает до десяти референсных изображений за один запрос. На показанных примерах из шести отдельных портретов собирается одна групповая фотография, а из пяти снимков — образ целиком: модель, одежда, обувь, сумка, шляпа. Тот же механизм закрывает виртуальную примерку и расстановку мебели в комнате.

Локальные правки задаются тремя способами:

  • обвести нужный участок кружком прямо на изображении;
  • закрасить его от руки;
  • подать отдельную маску.

Правки можно ставить в нескольких местах одновременно — убрать часы, перекрасить волосы и заменить одежду за один прогон. Лица и товары при этом обещают сохранять узнаваемость, а из более редких сценариев заявлены панорама, собранная из селфи, и раскадровка персонажа по трём его видам.

Семь миллиардов параметров вместо двадцати

Визуальная часть Qwen-Image-2.1 — 32 слоя Single-Stream DiT и около семи миллиардов параметров. Первое поколение Qwen-Image было примерно втрое крупнее, и уменьшение размера остаётся главным техническим аргументом релиза. Текст и входные картинки обрабатывает языковая модель Qwen3-VL 8B.

Скорость команда добирает за счёт повторного использования KV-кеша. Служебное представление текста и референсов считается один раз, на первом шаге, и дальше переиспользуется вместо полного пересчёта. Заметнее всего это на редактировании с несколькими входными изображениями, где раньше каждый шаг начинал работу заново.

По умолчанию модель рисует 2048×2048 за 40 шагов и поддерживает ходовые пропорции, включая 16:9 в разрешении 2752×1536.

Цифр по качеству Alibaba не показала

Qwen утверждает, что на собственном внутреннем бенчмарке модель обходит большинство закрытых решений. Ни названия этого бенчмарка, ни таблицы со счётом, ни имён конкурентов в релизе нет — ни на странице модели, ни в репозитории. Независимые замеры к моменту выхода тоже не появились.

Здесь нужно оговориться. Заявка «обходит закрытые модели» без единой цифры — обычная практика при открытых релизах, и проверяет её сообщество в первые же недели. Требований к видеопамяти Alibaba тоже не публикует, единственная подсказка в документации — выгрузка части модели в оперативную память для карт, которым не хватает своей.

Лицензия закрывает коммерческое применение

Веса Qwen-Image-2.1 распространяются под Qwen Research License. Она даёт бесплатное право использовать модель только для исследований и оценки, а для продукта, на котором зарабатывают, нужен отдельный договор с Hangzhou Tongyi Laboratory — заявку принимают по почте.

Отдельно лицензия требует указывать «Built with Qwen» в документации, если на модели что-то дообучали, и запрещает делать слово Qwen основным названием производного продукта. Для сравнения, DeepSeek в сентябре открыла V4.1 Flash под MIT, где коммерческое использование разрешено сразу. Открытые веса и открытая лицензия — разные вещи, и Qwen-Image-2.1 как раз тот случай.

Где взять веса и на чём запускать

Веса Qwen-Image-2.1 лежат на Hugging Face и ModelScope, там же работает демо-пространство, где модель можно попробовать без установки. Для локального запуска поддержка появилась день в день. Единый класс QwenImage21Pipeline в Diffusers покрывает и генерацию, и редактирование, для ComfyUI выложены готовые шаблоны рабочих процессов, серверные варианты собраны на vLLM и SGLang.

Официальные веса идут в BF16, для vLLM доступна экономная по памяти FP8-версия. Из железа помимо NVIDIA заявлены карты AMD через ROCm.

Прозрачный PNG без подписки, но и без права продавать

Для вебмастера и автора контента вся ценность Qwen-Image-2.1 сходится в одну вещь. Прозрачные PNG для иконок, карточек товара и обложек делаются одним запросом, без ручного вырезания фона и без подписки на сторонний сервис. Пока лицензия остаётся исследовательской, пользоваться этим можно для тестов и личных задач, а под коммерческий поток придётся либо договариваться с Alibaba, либо ждать следующей версии.

Судить о релизе по-настоящему получится в октябре, когда сообщество прогонит модель через открытые тесты и сравнит её с закрытыми генераторами. До этого сильная сторона у Qwen-Image-2.1 одна, зато проверяемая — прозрачность, которая работает без постобработки.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Проверка текста нейросетью: частые ошибки новичков

Люди приходят к нейросети с текстом так же, как раньше несли его редактору: «вот, посмотри, всё ли нормально»....

Perplexity Computer научилась создавать видео для кампаний и соцсетей

Perplexity добавила генерацию видео в ИИ-агента Computer. Сервис использует модели MiniMax H3 и ByteDance Seedance 2.5 и может...

ElevenLabs выпустили Eleven v4 и v4 Turbo — ИИ для озвучки с управлением эмоциями и манерой речи

ElevenLabs представила новые модели синтеза речи Eleven v4 и Eleven v4 Turbo. Они построены на новой архитектуре и...

Midjourney запустила V8 Alpha с ускоренной генерацией и улучшенным пониманием запросов

Midjourney открыла доступ к альфа-версии V8 - новой модели генерации изображений, которая работает в несколько раз быстрее и...

Runway представила Multi-Shot App: от одного промпта к полноценной многосценной истории с диалогами, звуком и монтажом

Runway представила новый инструмент, который заметно упрощает создание видеоконтента с помощью нейросетей. Multi-Shot App превращает один текстовый запрос...

ByteDance открыла публичный API Seedance 2.5

7 августа Volcano Engine открыла публичный API Seedance 2.5 - видеомодели ByteDance, которая одним проходом собирает 30-секундный ролик...

Нейросеть для сложных расчётов: чек-лист для новичка

Недавно нейросеть Claude посчитала физическую задачу, с которой годами возились специалисты — расчёт на девять петель в квантовой...

ComfyUI заморозила новые бесплатные аккаунты в Comfy Cloud из-за злоупотреблений видеомоделями

ComfyUI временно остановила создание новых бесплатных аккаунтов в Comfy Cloud. Причина - инцидент со злоупотреблениями, в котором атаковали...

Grok Imagine научился править картинку по кускам: xAI открыла Image 2.0 всем пользователям

xAI открыла общий доступ к Imagine Image 2.0 - новому режиму Quality в Grok Imagine на сайте и...

15+ способов продвижения сообщества ВКонтакте в 2026 году

ВКонтакте постоянно меняется: обновляются алгоритмы рекомендаций, появляются новые форматы контента и способы взаимодействия с аудиторией. Поэтому схема «создать...

Конспект видео нейросетью: чек-лист для новичка

Часовая запись вебинара, лекция на полтора часа, интервью на YouTube, которое нужно пересказать коллеге за пять минут —...

Qwen выпустила Qwen-Image-3.0 — модель генерирует сложные макеты и текст от 10 пикселей

Qwen представила Qwen-Image-3.0 — третье поколение модели для генерации и редактирования изображений. Она принимает инструкции объёмом до 4,5...

ImagineArt запустила Ads Studio для генерации UGC-рекламы из ссылки на продукт

ImagineArt запустила Ads Studio - инструмент для генерации рекламных роликов из ссылки на товар. Сервис собирает UGC-видео, ролики...

ElevenLabs добавила генерацию речи, музыки, изображений и видео в MCP

ElevenLabs расширила свой MCP-сервер. Теперь подключённый ИИ-ассистент может создавать речь, музыку, звуковые эффекты, изображения и видео, а также...

В Gemini появились цифровые аватары для Nano Banana

Google добавила в Gemini персональные аватары. Теперь можно один раз записать лицо и голос, после чего создавать изображения...

ElevenLabs теперь можно подключить к Claude через MCP

ElevenLabs представила MCP-сервер для Claude. Он позволяет управлять агентами ElevenLabs из чата в Claude. Коннектор уже появился в...

Gemini 3.8 Live получила видеоаватар для бизнеса

Google выпустила Gemini 3.8 Live with Live Avatar, режим с почти синхронным видеоаватаром для разговорных моделей. Функция доступна...

Будущий дата-центр Amazon в Техасе может стать главным источником углеродных выбросов в США

В рамках проекта дата-центра в округе Пекос, штат Техас, Amazon инвестирует в расположенную на площадке электростанцию, которая может...

Alibaba выпустила Qwen-Image-3.0 без весов и бенчмарков, но с промптами на 4500 токенов

Alibaba выпустила Qwen-Image-3.0 - третье поколение генератора изображений с прицелом на практическую пользу: длинные детальные подписи, читаемый мелкий...

Яндекс Люмен: что за подписка, сколько стоит, как подключить/отключить

«Яндекс Люмен» появился летом 2026 года. Сначала его запустили в Яндекс Музыке, затем добавили функции в Яндекс Книги....