• Виктор
  • Блог
  • 3 мин. чтения

Alibaba выпустила Qwen-Image 2.1 с генерацией прозрачных изображений


Команда Qwen выпустила Qwen-Image 2.1 — модель для генерации и редактирования изображений. Веса опубликованы 20 сентября 2026 года на Hugging Face и ModelScope.

Визуальная часть модели насчитывает 7 млрд параметров. Qwen-Image 2.1 создаёт обычные и прозрачные изображения, принимает до десяти референсов и поддерживает точечное редактирование отдельных областей.

Что умеет Qwen-Image 2.1

Одна модель работает и с текстовыми запросами, и с готовыми изображениями. Пользователь может изменить фон, заменить или удалить предмет, собрать композицию по нескольким референсам и сохранить внешность человека или вид товара.

Для точечных правок нужную область можно отметить кругом, закрасить или передать отдельную маску. Модель поддерживает панорамы, а также генерирует изображения в разрешении 2K с несколькими соотношениями сторон, включая 1:1, 16:9 и 9:16.

Как устроена работа с прозрачным фоном

Qwen-Image 2.1 создаёт изображения с альфа-каналом в формате RGBA. Это позволяет сразу получить объект без фона, изменить отдельный прозрачный слой или вырезать человека либо товар из фотографии.

Прозрачность встроена в модель и не требует отдельного инструмента для удаления фона. В самой модели можно редактировать уже готовые прозрачные изображения.

Где скачать и запустить модель

Веса и код опубликованы на Hugging Face, ModelScope и GitHub. В день релиза модель также получила поддержку Diffusers, ComfyUI, vLLM-Omni, SGLang и LightX2V.

Qwen-Image 2.1 распространяется по Qwen Research License. Она разрешает исследовательское и оценочное использование, а для коммерческих проектов требуется отдельная лицензия Alibaba.

Что изменилось по сравнению с предыдущей версией

Команда Qwen улучшила отрисовку текста, освещение портретов и проработку мелких деталей. Архитектура использует 32 слоя DiT. Для ускорения генерации текстовые инструкции и изображения-контексты вычисляются на первом шаге и затем кэшируются для последующих шагов.

Ранее Alibaba открыла QwenWork по всему миру — ИИ-агент работает в браузере и на компьютере.

Изображения: qwen.ai/blog?id=qwen-image-2.1



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

ByteDance открыла публичный API Seedance 2.5

7 августа Volcano Engine открыла публичный API Seedance 2.5 - видеомодели ByteDance, которая одним проходом собирает 30-секундный ролик...

15 главных сериалов октября 2026 года, которые нельзя пропустить

Октябрь — самое время доставать плед, заваривать что-нибудь горячее и устраивать длинные вечера за просмотром сериалов. Тем более...

От Google Translate к Gemini. Новая модель приближает синхронный перевод к живому диалогу

Двадцать лет назад Google Translate был всего лишь одним из первых машинных экспериментов с языком. Сначала он переводил...

Alibaba выпустила Qwen-Image 2.1 с генерацией прозрачных изображений

Команда Qwen выпустила Qwen-Image 2.1 — модель для генерации и редактирования изображений. Веса опубликованы 20 сентября 2026 года...

Midjourney запустила V8 Alpha с ускоренной генерацией и улучшенным пониманием запросов

Midjourney открыла доступ к альфа-версии V8 - новой модели генерации изображений, которая работает в несколько раз быстрее и...

ElevenLabs открыла общий доступ к Eleven v3 Conversational

ElevenLabs открыла общий доступ к Eleven v3 Conversational — модели синтеза речи для диалогов в реальном времени. Она...

MiniMax выпустила видеомодель H3 – ролики в 2K со звуком

MiniMax 31 июля представила H3 - мультимодальную видеомодель, которая принимает текст, изображения, видео и звук и выдаёт ролики...

Как повторить тренд из «Форсажа» с помощью ИИ — гайд

В соцсетях завирусился ИИ-тренд по мотивам «Форсажа»: пользователи пересобирают культовые сцены из Tokyo Drift, подставляя в кадр собственные...

Google выпустила Nano Banana 2 Lite — быструю модель для генерации изображений через Gemini API

Google выпустила Nano Banana 2 Lite (gemini-3.1-flash-lite-image) — новую модель для генерации и редактирования изображений. Это самая быстрая...

Midjourney V8.1 ускорилась и вернула стиль

Midjourney выпустила альфа-версию V8.1, в которой разработчики сделали ставку на баланс: вернули фирменный визуальный стиль, ускорили генерацию и...

ComfyUI заморозила новые бесплатные аккаунты в Comfy Cloud из-за злоупотреблений видеомоделями

ComfyUI временно остановила создание новых бесплатных аккаунтов в Comfy Cloud. Причина - инцидент со злоупотреблениями, в котором атаковали...

ElevenLabs выпустили Eleven v4 и v4 Turbo — ИИ для озвучки с управлением эмоциями и манерой речи

ElevenLabs представила новые модели синтеза речи Eleven v4 и Eleven v4 Turbo. Они построены на новой архитектуре и...

Kimi управляет сайтами из боковой панели Chrome и запоминает действия

Kimi теперь открывает сайты, нажимает кнопки и заполняет формы по просьбе, написанной в чате. Moonshot AI переименовала своё...

OpenAI выпустила GPT-6 Sol и GPT-6 Luna — новые модели уже доступны в ChatGPT и Codex

OpenAI начала развёртывание GPT-6 Sol и GPT-6 Luna. Новые модели уже появляются в ChatGPT Work и Codex, а...

Portable Computer от Perplexity доехал до AMD

Perplexity открыла Portable Computer на Windows-компьютерах с процессорами AMD Ryzen AI Max. Подписчики сервиса запускают локальные ИИ-задачи и...

ElevenLabs выпустила Music v2.5 с улучшенным звуком и точным следованием запросу

ElevenLabs представила Music v2.5 — новую версию модели для генерации музыки. Она создаёт более многослойные композиции, точнее следует...

Новые фишки и функции iOS 27 для iPhone — 13 главных обновлений

Недавно Apple выпустила iOS 27 — обновление доступно для iPhone 11 и более новых моделей, а также iPhone...

Проверка текста нейросетью: частые ошибки новичков

Люди приходят к нейросети с текстом так же, как раньше несли его редактору: «вот, посмотри, всё ли нормально»....

Вышла Kling Video 3.0 — ИИ-модель для генерации видео из нескольких сцен

Kuaishou выпустила Kling Video 3.0 — новую версию своей модели для генерации видео. Ключевое изменение — теперь ролик...

Обновлённый Reve: свобода творчества без технических барьеров

Reve представила обновлённую платформу для генерации и редактирования изображений, стремясь сделать визуальное творчество доступным без технических барьеров. Новый...