• Виктор
  • Блог
  • 2 мин. чтения

Alibaba выложила Qwen-Image-2.1 – картинки с прозрачным фоном из коробки


Команда Qwen выложила в открытый доступ Qwen-Image-2.1 – модель, которая рисует изображения сразу с прозрачным фоном и правит готовые картинки по обведённым кружком участкам. Веса появились на Hugging Face и ModelScope 20 сентября, но лицензия разрешает только исследования.

Alibaba выложила Qwen-Image-2.1 - картинки с прозрачным фоном из коробки

Qwen -Image-2.1 — новая открытая модель Alibaba , которая в одном пайплайне генерирует изображения по описанию и правит готовые. Команда Qwen подаёт релиз как самый компактный и экономичный в семействе. Веса выложены публично, демо работает бесплатно, а вот с лицензией придётся разбираться отдельно.

Прозрачный фон получается сразу, без вырезания

Главное, что отличает Qwen-Image-2.1 от предыдущих открытых генераторов, — нативная работа с альфа-каналом. Модель рисует объект на прозрачном фоне прямо по текстовому описанию, редактирует уже готовый прозрачный слой и вытаскивает предмет с обычной фотографии, сохраняя прозрачность вокруг него.

Для стикеров, иконок, логотипов и карточек товара это снимает целый шаг. Обычно картинку сначала генерируют, а фон убирают отдельным инструментом. Здесь прозрачность встроена в сам автокодировщик — 64-канальный RGBA с 16-кратным сжатием, поэтому альфа-канал не дорисовывается постобработкой.

Чтобы это включилось, модели нужно прямо сказать, что изображение прозрачное. Qwen рекомендует такую рамку запроса:

This is an RGBA image with transparency. Далее описание сцены. The image has alpha channel and the background is transparent.

Без этой формулировки модель отдаёт обычный кадр с фоном.

Десять референсов и правки кружком

Qwen-Image-2.1 принимает до десяти референсных изображений за один запрос. На показанных примерах из шести отдельных портретов собирается одна групповая фотография, а из пяти снимков — образ целиком: модель, одежда, обувь, сумка, шляпа. Тот же механизм закрывает виртуальную примерку и расстановку мебели в комнате.

Локальные правки задаются тремя способами:

  • обвести нужный участок кружком прямо на изображении;
  • закрасить его от руки;
  • подать отдельную маску.

Правки можно ставить в нескольких местах одновременно — убрать часы, перекрасить волосы и заменить одежду за один прогон. Лица и товары при этом обещают сохранять узнаваемость, а из более редких сценариев заявлены панорама, собранная из селфи, и раскадровка персонажа по трём его видам.

Семь миллиардов параметров вместо двадцати

Визуальная часть Qwen-Image-2.1 — 32 слоя Single-Stream DiT и около семи миллиардов параметров. Первое поколение Qwen-Image было примерно втрое крупнее, и уменьшение размера остаётся главным техническим аргументом релиза. Текст и входные картинки обрабатывает языковая модель Qwen3-VL 8B.

Скорость команда добирает за счёт повторного использования KV-кеша. Служебное представление текста и референсов считается один раз, на первом шаге, и дальше переиспользуется вместо полного пересчёта. Заметнее всего это на редактировании с несколькими входными изображениями, где раньше каждый шаг начинал работу заново.

По умолчанию модель рисует 2048×2048 за 40 шагов и поддерживает ходовые пропорции, включая 16:9 в разрешении 2752×1536.

Цифр по качеству Alibaba не показала

Qwen утверждает, что на собственном внутреннем бенчмарке модель обходит большинство закрытых решений. Ни названия этого бенчмарка, ни таблицы со счётом, ни имён конкурентов в релизе нет — ни на странице модели, ни в репозитории. Независимые замеры к моменту выхода тоже не появились.

Здесь нужно оговориться. Заявка «обходит закрытые модели» без единой цифры — обычная практика при открытых релизах, и проверяет её сообщество в первые же недели. Требований к видеопамяти Alibaba тоже не публикует, единственная подсказка в документации — выгрузка части модели в оперативную память для карт, которым не хватает своей.

Лицензия закрывает коммерческое применение

Веса Qwen-Image-2.1 распространяются под Qwen Research License. Она даёт бесплатное право использовать модель только для исследований и оценки, а для продукта, на котором зарабатывают, нужен отдельный договор с Hangzhou Tongyi Laboratory — заявку принимают по почте.

Отдельно лицензия требует указывать «Built with Qwen» в документации, если на модели что-то дообучали, и запрещает делать слово Qwen основным названием производного продукта. Для сравнения, DeepSeek в сентябре открыла V4.1 Flash под MIT, где коммерческое использование разрешено сразу. Открытые веса и открытая лицензия — разные вещи, и Qwen-Image-2.1 как раз тот случай.

Где взять веса и на чём запускать

Веса Qwen-Image-2.1 лежат на Hugging Face и ModelScope, там же работает демо-пространство, где модель можно попробовать без установки. Для локального запуска поддержка появилась день в день. Единый класс QwenImage21Pipeline в Diffusers покрывает и генерацию, и редактирование, для ComfyUI выложены готовые шаблоны рабочих процессов, серверные варианты собраны на vLLM и SGLang.

Официальные веса идут в BF16, для vLLM доступна экономная по памяти FP8-версия. Из железа помимо NVIDIA заявлены карты AMD через ROCm.

Прозрачный PNG без подписки, но и без права продавать

Для вебмастера и автора контента вся ценность Qwen-Image-2.1 сходится в одну вещь. Прозрачные PNG для иконок, карточек товара и обложек делаются одним запросом, без ручного вырезания фона и без подписки на сторонний сервис. Пока лицензия остаётся исследовательской, пользоваться этим можно для тестов и личных задач, а под коммерческий поток придётся либо договариваться с Alibaba, либо ждать следующей версии.

Судить о релизе по-настоящему получится в октябре, когда сообщество прогонит модель через открытые тесты и сравнит её с закрытыми генераторами. До этого сильная сторона у Qwen-Image-2.1 одна, зато проверяемая — прозрачность, которая работает без постобработки.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Google выпустила Nano Banana 2 Lite и Gemini Omni Flash

30 июня Google открыла доступ к двум новым моделям генеративной графики и видео - Nano Banana 2 Lite...

Маркетолог PRO от MTC ADS: отзывы и возможности сервиса для запуска бизнес-рекламы в Telegram

Результативность рекламной кампании зависит от десятков, даже сотен факторов. Один из основных критериев — определение целевой аудитории и...

OpenAI сняла лимиты на текстовые чаты в ChatGPT для всех пользователей

OpenAI объявила об отмене лимитов на текстовые чаты для всех пользователей ChatGPT. Сервис, по данным компании, недавно преодолел...

15+ способов продвижения сообщества ВКонтакте в 2026 году

ВКонтакте постоянно меняется: обновляются алгоритмы рекомендаций, появляются новые форматы контента и способы взаимодействия с аудиторией. Поэтому схема «создать...

NotebookLM научился делать минутные вертикальные видео из документов

Google добавила в NotebookLM новый формат - Short Video Overviews. Сервис автоматически собирает из загруженных документов короткое вертикальное...

Qwen выпустила плагины Qwen-MM для мультимодальных ИИ-агентов

Команда Qwen опубликовала Qwen-MM-Plugins — набор открытых плагинов для работы ИИ-агентов с изображениями, видео и документами. Репозиторий поддерживает...

Grok 4.7 обогнал более дорогих конкурентов в юридических задачах

SpaceXAI выпустила Grok 4.7 - флагманскую модель для программирования и долгой рабочей рутины. Она заметно прибавила против Grok...

Ideogram выпустила Ideogram 4.0 с открытыми весами и управлением макетом через JSON

Ideogram представила версию 4.0 - новую text-to-image модель с открытыми весами для генерации изображений, дизайна и типографики. Компания...

Яндекс сводит аналитику данных в одну платформу

Yandex B2B Tech анонсировала DataLens Platform, платформу для работы с корпоративными данными от загрузки и хранения до отчётов...

Приложения для создания и обработки фото с помощью ИИ: топ-11 на Android/iPhone

Нужно создать аватар, улучшить старое фото или оживить снимок для соцсетей? Под каждую задачу есть свое приложение, где...

Промты для создания стикеров по фото в ChatGPT, +лучшие ИИ для стикеров

С помощью ИИ теперь можно за несколько минут сделать собственный набор стикеров для Telegram, Discord или соцсетей —...

От Google Translate к Gemini. Новая модель приближает синхронный перевод к живому диалогу

Двадцать лет назад Google Translate был всего лишь одним из первых машинных экспериментов с языком. Сначала он переводил...

OpenAI бьёт по Apple в суде: «Вы сами не защитили свои секреты»

Ходатайство OpenAI об отклонении иска Apple о коммерческой тайне — вместе с новыми судебными материалами — показывает, какую...

Perplexity Computer научилась создавать видео для кампаний и соцсетей

Perplexity добавила генерацию видео в ИИ-агента Computer. Сервис использует модели MiniMax H3 и ByteDance Seedance 2.5 и может...

Будущий дата-центр Amazon в Техасе может стать главным источником углеродных выбросов в США

В рамках проекта дата-центра в округе Пекос, штат Техас, Amazon инвестирует в расположенную на площадке электростанцию, которая может...

Новое поколение DLSS 5 от NVIDIA: революционный ИИ-рендеринг выйдет 3 сентября

Компания NVIDIA официально анонсировала технологию DLSS 5, запуск которой запланирован на 3 сентября 2026 года. Первой игрой с...

Suno вводит лимиты на скачивание — до 7 треков бесплатно

Suno объявила, что с 3 сентября введёт лимиты на скачивание созданной музыки. На бесплатном тарифе пользователи, зарегистрировавшиеся до...

YouTube позволит генерировать Shorts с помощью Veo 3

На мероприятии «Made on YouTube» 16 сентября компания представила большое обновление для Shorts и YouTube Studio. В сервис...

Nvidia «достигла AGI», но никто не знает, что это значит

В среду на отчётной конференции Nvidia Дженсен Хуанг заявил, что компания «достигла AGI» — искусственного общего интеллекта, одной...

Alibaba выпустила Qwen-Image-3.0 без весов и бенчмарков, но с промптами на 4500 токенов

Alibaba выпустила Qwen-Image-3.0 - третье поколение генератора изображений с прицелом на практическую пользу: длинные детальные подписи, читаемый мелкий...