• Виктор
  • Блог
  • 2 мин. чтения

Alibaba выпустила Qwen-Image-3.0 без весов и бенчмарков, но с промптами на 4500 токенов


Alibaba выпустила Qwen-Image-3.0 – третье поколение генератора изображений с прицелом на практическую пользу: длинные детальные подписи, читаемый мелкий текст, сборка сложных инфографик за один проход. Бенчмарков, весов и технического отчёта компания не раскрыла.

Alibaba выпустила Qwen-Image-3.0 без весов и бенчмарков, но с промптами на 4500 токенов

Промпт на 4500 токенов вместо тысячи

Прежняя версия, Qwen -Image 2.0 , принимала подписи максимум на тысячу токенов. Qwen-Image-3.0 увеличила лимит в 4,5 раза, и это не просто техническая деталь. С длинным промптом модель собирает композиции, которые раньше требовали склейки нескольких картинок. Витринный пример команды Qwen – сетка три на три с девятью разными иллюстрациями (диаграмма по физике, доказательство из теории групп, разбор по биологии и ещё шесть), собранная из одной инструкции на 3700 токенов. Второй пример – вложенные интерфейсы: редактор кода, внутри которого открыто окно чата, а внутри чата – мессенджер.

Текст размером в десять пикселей

Вторая заявленная сильная сторона – мелкая деталь. Alibaba утверждает, что модель читаемо рендерит текст высотой всего десять пикселей и воспроизводит фактуру кожи, волос и бумаги почти на уровне фотографии. В галерее релиза – разворот академической статьи с многострочными формулами, макет газетной полосы, добавление рукописных пометок на готовое изображение и реставрация повреждённой картины в традиционной технике.

Модель, которая подглядывает в прогноз погоды

Третий блок команда называет «мировыми знаниями»: нативный рендеринг на 12 языках и больше чем 20 шрифтов, воспроизведение интерфейсов вроде веб-страниц и трансляций, и способность подтягивать актуальные данные из сети прямо в изображение. Пример из презентации – график прогноза погоды для конкретного города на конкретную дату. Для генератора картинок это необычная претензия: модель здесь работает не только с формой, но и с содержанием, которое само по себе должно быть верным.

Газетные полосы, сторибоарды, карточки товаров

Alibaba целится в контент-продакшен: вёрстку новостных полос, сторибоарды для короткометражных драм, макеты интерфейсов, карточки для маркетплейсов. Ровно тот сегмент, где вопрос о раскрытии участия ИИ в производстве материала уже не абстрактный, а рабочий – редакции и агентства такие изображения публикуют массово. Обе стороны примеров команда выбирала сама, и удобство для конкретной задачи ещё предстоит проверить на чужих промптах, а не на витринных.

Ни весов, ни отчёта, ни лицензии

Пост о релизе не содержит таблицы с бенчмарками, числа параметров, лицензии и технического отчёта о том, как модель обучали и тестировали. Попробовать её можно только через Qwen Chat. Это разворот на 180 градусов относительно того, как серия выходила раньше. Qwen-Image 1.0 в августе 2025 года вышла сразу с открытыми весами под лицензией Apache 2.0 и техническим отчётом день в день. У Qwen-Image 2.0 был собственный технический отчёт, и там же фигурировал прежний лимит в тысячу токенов – единственная цифра из старого релиза, с которой теперь можно сравнить новую. Для генератора изображений закрытость обиднее, чем для текстовой модели: качество тут субъективно, а рендеринг текста – как раз то направление, где демо на подобранных примерах обычно выглядит сильнее, чем модель под системным тестированием.

Пятое место как точка отсчёта

У Alibaba есть собственный ориентир, откуда считать прогресс. В бенчмарке Qwen-Image-Bench, который команда Qwen опубликовала сама, предыдущий флагман Qwen Image 2.0 Pro занял пятое место. Первую строчку держит GPT Image 2 от OpenAI , следом идут модели Nano Banana от Google и GPT Image 1.5. Оценка построена на модели-судье, которая, по словам авторов бенчмарка, хорошо совпадает с оценками живых людей, но тест всё равно собственный, а мерили им прошлое поколение, а не 3.0.

Пятое место – не худший старт, но и не тот, с которого закрытые бенчмарки выглядят убедительно. Заявка на скачок есть, а способа её проверить со стороны – нет.

Tencent и Thinking Machines показывают, что закрытость – выбор

Конкуренты в те же недели поступили иначе. Tencent выпустила HunyuanImage 3.0 с открытыми весами, а Thinking Machines Lab свою первую мультимодальную модель Inkling тоже отдала с весами в комплекте. На этом фоне решение Qwen читается не как техническое ограничение, а как коммерческий расчёт: пока конкуренты делятся моделями, Alibaba бережёт свежий релиз для собственного чат-продукта. Судить, оправдан ли скачок с тысячи до 4500 токенов и заявленная читаемость десятипиксельного текста, можно будет только по одному признаку – появятся ли веса, карточка модели и независимые тесты. До этого момента у разработчиков есть только подборка картинок, которую выбрала сама компания.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Pika превратила генератор видео в платформу с набором приложений и мультимодельным стеком

Компания Pika запустила обновленную креативную платформу на pika.art. Сервис перестроили вокруг специализированных мини-приложений для видеомонтажа, ретуши и работы...

Google теперь позволит пользователям удалять видимый водяной знак со своих ИИ-генераций

В пятницу Google объявила, что теперь позволит пользователям удалять видимый водяной знак со своих материалов, созданных ИИ, включая...

Обновлённый Reve: свобода творчества без технических барьеров

Reve представила обновлённую платформу для генерации и редактирования изображений, стремясь сделать визуальное творчество доступным без технических барьеров. Новый...

Проверка текста нейросетью: частые ошибки новичков

Люди приходят к нейросети с текстом так же, как раньше несли его редактору: «вот, посмотри, всё ли нормально»....

Miu Miu и New Balance выпустили балетную версию кроссовок 530 SL

Miu Miu и New Balance выпустили балетки на основе 530 SL. От кроссовок модели достались шнуровка, резиновая подошва...

Grok научился расшифровывать речь вдвое точнее и за те же деньги

SpaceXAI выпустила Grok Voice Transcribe 2.0, модель для перевода речи в текст. По внутренним тестам компании она вдвое...

Kling представил VIDEO 2.6 — ИИ-модель, которая генерирует видео и звук за один прогон

Kling запустил модель VIDEO 2.6 — свой первый генератор, который создаёт картинку и звук одновременно. Один запрос превращается...

OpenAI сняла лимиты на текстовые чаты в ChatGPT для всех пользователей

OpenAI объявила об отмене лимитов на текстовые чаты для всех пользователей ChatGPT. Сервис, по данным компании, недавно преодолел...

Вышла нейросеть Suno 5.5 — ИИ генерирует треки с вашим голосом

Suno AI выпустила модель v5.5 и вместе с ней набор функций, которые меняют логику сервиса. Теперь это не...

Portable Computer от Perplexity доехал до AMD

Perplexity открыла Portable Computer на Windows-компьютерах с процессорами AMD Ryzen AI Max. Подписчики сервиса запускают локальные ИИ-задачи и...

DeepSeek API: как получить ключ, как пользоваться бесплатно, как оплатить из России

DeepSeek API – это облачный сервис, который позволяет подключать ИИ-модели к внешним проектам. С его помощью можно интегрировать...

Промты для фото и открыток ко Дню России, +нейросети для генерации

Ищете промты для открыток ко Дню России? Нейросети могут сделать семейное поздравление по фото, портрет в праздничном образе,...

YouTube позволит генерировать Shorts с помощью Veo 3

На мероприятии «Made on YouTube» 16 сентября компания представила большое обновление для Shorts и YouTube Studio. В сервис...

Google выпустила Nano Banana 2 Lite — быструю модель для генерации изображений через Gemini API

Google выпустила Nano Banana 2 Lite (gemini-3.1-flash-lite-image) — новую модель для генерации и редактирования изображений. Это самая быстрая...

Google запускает Nano Banana – новая эра редактирования изображений

Google представила модель искусственного интеллекта Nano Banana - предварительную версию Gemini 2.5 Flash Image, которая уже доступна пользователям...

Видео-мем «Возьми телефон, детка» (Toxi$): что это за тренд и как повторить его с помощью ИИ

Да-да, вы наверняка уже всё сами видели. Лысый парень в очках встаёт с дивана, машет руками под строчку...

OpenAI представила обновлённый ChatGPT Images: до 4× быстрее и с новым творческим пространством

OpenAI выпустила обновлённую функцию ChatGPT Images - новый встроенный генератор изображений, который стал быстрее, точнее и удобнее для...

Kling добавила нативную генерацию в 4K в версии Video 3.0

Kling запустила режим 4K Mode в линейке Video 3.0. Теперь видео можно генерировать сразу в 4K — без...

Лимиты использования в ChatGPT/Codex: где посмотреть и как сбросить

Даже на платных тарифах ChatGPT действуют лимиты на использование. Если они заканчиваются, сервис может прямо во время работы...

Qwen выпустила плагины Qwen-MM для мультимодальных ИИ-агентов

Команда Qwen опубликовала Qwen-MM-Plugins — набор открытых плагинов для работы ИИ-агентов с изображениями, видео и документами. Репозиторий поддерживает...