• Виктор
  • Блог
  • 3 мин. чтения

Ideogram выпустила Ideogram 4.0 с открытыми весами и управлением макетом через JSON


Ideogram представила версию 4.0 – новую text-to-image модель с открытыми весами для генерации изображений, дизайна и типографики. Компания называет её своим первым open-source релизом, но на Hugging Face модель опубликована под некоммерческой лицензией Ideogram 4 Non-Commercial.

Ideogram выпустила Ideogram 4.0 с открытыми весами и управлением макетом через JSON

Открытые веса вместо закрытого генератора картинок

Ideogram представила Ideogram 4.0 – text-to-image модель на 9,3 млрд параметров, ориентированную на дизайн, читаемый текст внутри изображений и точный контроль композиции. Весы и код для инференса опубликованы, модель можно запускать локально, а попробовать её проще всего через сайт Ideogram.

Компания называет релиз своим первым open-source text-to-image model . Здесь нужна оговорка: на странице  Hugging Face указана лицензия ideogram-4-non-commercial, а для доступа к файлам нужно принять условия и поделиться контактной информацией. Поэтому нужно понимать об открытых весах с некоммерческим режимом использования, а не о полностью свободной open-source модели.

Раньше сервис воспринимался прежде всего как веб-инструмент для генерации постеров, логотипов, рекламных макетов и картинок с текстом. Теперь компания выходит в поле локальных моделей, где её будут сравнивать не только с закрытыми генераторами, но и с FLUX, Qwen -Image, HunyuanImage и другими open-weight решениями.

Две версии модели: fp8 и nf4

Ideogram 4.0 вышла в двух вариантах: fp8 и nf4. Обе версии имеют 9,3 млрд параметров, но отличаются квантизацией и сценариями запуска. В таблице модели на Hugging Face указано, что nf4 поддерживает CUDA и Diffusers, а fp8 рассчитана на более широкий набор оборудования, но без поддержки Diffusers на момент публикации.

Отдельный плюс для локального сообщества – поддержка в ComfyUI . Команда ComfyUI сообщила, что Ideogram 4.0 уже нативно поддерживается в интерфейсе, который используют для сборки визуальных рабочих процессов на узлах. Это снижает порог входа: пользователю не обязательно писать код, чтобы проверить модель в своих цепочках генерации.

Открытый запуск не делает модель мгновенно массовой. Локальная генерация по-прежнему требует подходящей видеокарты, установки зависимостей и понимания настроек. Но для дизайнеров, исследователей и энтузиастов важен сам факт: сильная типографическая модель больше не ограничена только веб-интерфейсом и API.

JSON-промпты для точного макета

Главная техническая ставка Ideogram 4.0 – структурированные JSON-промпты. Модель обучали на JSON-описаниях, поэтому она лучше работает, когда пользователь задаёт сцену не одной свободной фразой, а структурой: объекты, стиль, освещение, палитра, текстовые элементы и расположение в кадре.

Это особенно важно для дизайна. В обычном генераторе изображений пользователь часто просит «сделай постер с заголовком сверху и объектом справа», а потом несколько раз перегенерирует результат. В Ideogram 4.0 можно указывать координаты элементов через bounding boxes, задавать цветовую палитру hex-кодами и описывать текстовые блоки как отдельные части композиции.

Такой подход ближе к макетированию, чем к привычному «напиши промпт и надейся». Слабое место тоже понятно: JSON-управление добавляет точность, но усложняет работу для обычного пользователя. Ideogram закрывает это через Magic Prompt: обычный текстовый запрос может разворачиваться в структурированное описание перед генерацией.

Типографика остаётся главным преимуществом

Ideogram 4.0 делает упор на текст внутри изображений: вывески, логотипы, подписи, водяные знаки, многострочные надписи и рекламные макеты. На странице модели компания пишет, что релиз показывает лучший для open-weight моделей результат по генерации текста на изображениях среди протестированных решений.

По собственному описанию Ideogram, модель обучена с нуля, а не дообучена поверх существующего чекпойнта. Архитектура построена на single-stream DiT: текстовые и визуальные токены обрабатываются в единой последовательности. В качестве текстового энкодера используется Qwen3-VL-8B-Instruct, а модель забирает скрытые состояния из 13 промежуточных слоёв.

Это звучит технически, но практический смысл простой: модель должна лучше связывать текст запроса, расположение объектов и итоговую картинку. Для постеров, упаковки, обложек, карточек товаров и рекламных баннеров такая связка важнее, чем абстрактная «красивость» изображения.

Бенчмарки выглядят сильными, но …

Ideogram заявляет, что Ideogram 4.0 лидирует среди open-weight моделей в дизайн-ориентированных оценках. На Hugging Face компания ссылается на Design Arena, ContraLabs, LMArena, внутренний human-preference benchmark и открытые тесты для макета, пространственного понимания, соответствия промпту и OCR-точности.

В оценке ContraLabs, по данным Ideogram, десять профессиональных дизайнеров выбирали лучший результат в слепом типографическом тесте. Ideogram 4.0 получила первое место в 47,9% случаев, обойдя Gemini 3.1 Flash Image Preview, FLUX.2 [max] и Grok Imagine 1.0. Там же дизайнеров спрашивали, использовали бы они результат в реальной клиентской работе; Ideogram 4.0 получила самый высокий балл – 3,55 из 5.

Такие цифры полезны как ориентир, но не заменяют практическую проверку. Дизайн-задачи слишком разные: одно дело – постер с коротким слоганом, другое – каталог, упаковка с юридическим текстом или сложный многоязычный макет. Для профессиональной работы модель всё равно придётся проверять на повторяемость, правки, лицензии и интеграцию в существующий процесс.

Лицензия может стать главным спорным местом

Самая чувствительная часть релиза – не качество генерации, а слово «open». Ideogram в анонсе говорит о «best open image model», а на странице Hugging Face – о первом open-source text-to-image model. Но рядом стоит лицензия Ideogram 4 Non-Commercial, то есть коммерческое использование не заявлено как свободное.

Для исследователей и локальных энтузиастов это всё равно сильный релиз: можно изучать архитектуру, запускать модель, сравнивать её с другими генераторами и проверять новые подходы к промптам. Для студий, агентств и продуктовых команд вопрос сложнее. Если модель нужна для клиентских работ, рекламных материалов или встроенного коммерческого продукта, сначала придётся читать лицензию, а не только смотреть демо.

Именно здесь маркетинговая формулировка расходится с ожиданиями open-source сообщества. Открытые веса дают контроль и возможность локального запуска. Некоммерческая лицензия оставляет границу, за которую бизнес не может спокойно зайти без отдельного разрешения.

Источник:
ideogram.ai



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

OpenAI интегрировала ChatGPT в Microsoft Word через общую офисную надстройку

OpenAI выпустила интеграцию ChatGPT для текстового редактора Microsoft Word. Инструмент встраивается в боковую панель программы и доступен на...

Pika превратила генератор видео в платформу с набором приложений и мультимодельным стеком

Компания Pika запустила обновленную креативную платформу на pika.art. Сервис перестроили вокруг специализированных мини-приложений для видеомонтажа, ретуши и работы...

Kling добавила нативную генерацию в 4K в версии Video 3.0

Kling запустила режим 4K Mode в линейке Video 3.0. Теперь видео можно генерировать сразу в 4K — без...

ByteDance выпустила Seedream 4.0 — ИИ модель для генерации изображений, обгоняющую Nano Banana

ByteDance представила Seedream 4.0 — новую модель генерации и редактирования изображений, которая работает быстрее и стабильнее конкурентов. По...

Вышла нейросеть Suno 5.5 — ИИ генерирует треки с вашим голосом

Suno AI выпустила модель v5.5 и вместе с ней набор функций, которые меняют логику сервиса. Теперь это не...

Synthesia встроила агента в редактор и обновила модель аватаров

Synthesia запустила Assistant - чат-агента, который собирает ролик из промпта, документа или ссылки прямо в редакторе и правит...

ElevenLabs выпустили Eleven v4 и v4 Turbo — ИИ для озвучки с управлением эмоциями и манерой речи

ElevenLabs представила новые модели синтеза речи Eleven v4 и Eleven v4 Turbo. Они построены на новой архитектуре и...

Comfy MCP: ComfyUI подключает ИИ-агентов к своим пайплайнам генерации

Команда ComfyUI открыла публичную бету Comfy MCP - коннектор, через который ИИ-агенты вроде Claude, Codex, Cursor и Hermes...

Apple ведёт переговоры с издателями о выплатах за актуальные новости для Siri

Согласно информации The Wall Street Journal, Apple ведёт переговоры о выплатах издателям за использование их контента для работы будущего...

Kimi управляет сайтами из боковой панели Chrome и запоминает действия

Kimi теперь открывает сайты, нажимает кнопки и заполняет формы по просьбе, написанной в чате. Moonshot AI переименовала своё...

Razer выпустила одноручный кейпад Tartarus V2 Pro

Razer начала продажи Tartarus V2 Pro — одноручного игрового кейпада с 31 программируемым элементом управления. Устройство рассчитано на...

Pika запустила Relight Media для изменения света в фото и видео

Pika открыла Relight Media — приложение, которое меняет освещение в готовом фото или видеоролике. Пользователь загружает файл, выбирает...

Гайд по размерам для YouTube: шапка канала, обложка видео, Shorts, аватар, лого

Если вы загружаете ролики на YouTube и оформляете канал, размеры лучше определить заранее. Иначе шапка обрежется на смартфоне,...

От Google Translate к Gemini. Новая модель приближает синхронный перевод к живому диалогу

Двадцать лет назад Google Translate был всего лишь одним из первых машинных экспериментов с языком. Сначала он переводил...

ImagineArt показала модель 2.0

ImagineArt представила модель ImagineArt 2.0 и делает ставку на то, что в генерации изображений пользователям важен уже не...

Конспект видео нейросетью: чек-лист для новичка

Часовая запись вебинара, лекция на полтора часа, интервью на YouTube, которое нужно пересказать коллеге за пять минут —...

Anthropic выпустила Claude Opus 5.5 – уровень Fable за меньшие деньги

Anthropic выпустила Claude Opus 5.5, первую модель нового поколения Claude 5.5. По заявлению компании, на большинстве задач она...

Kling запустила IMAGE O1 — новую ИИ-модель для генерации и редактирования изображений

Kling представила «IMAGE O1» — это обновлённая модель для генерации и редактирования изображений. Она работает и с текстом,...

20 промтов для осенней ИИ-фотосессии в нейросетях

Осенняя фотосессия не обязательно требует поездки в парк, холодной погоды и пары часов на съёмку. Если у вас...

Как повторить тренд из «Форсажа» с помощью ИИ — гайд

В соцсетях завирусился ИИ-тренд по мотивам «Форсажа»: пользователи пересобирают культовые сцены из Tokyo Drift, подставляя в кадр собственные...