• Виктор
  • Блог
  • 2 мин. чтения

MiniMax выпустила видеомодель H3 – ролики в 2K со звуком


MiniMax 31 июля представила H3 – мультимодальную видеомодель, которая принимает текст, изображения, видео и звук и выдаёт ролики до 15 секунд в 2K с нативным стереозвуком. Модель уже работает через API, а веса компания обещает открыть в ближайшие дни.

MiniMax выпустила видеомодель H3 - ролики в 2K со звуком

MiniMax – китайская компания, известная по линейке видеомоделей Hailuo (Хайлуо) и текстовым моделям серии M. H3 продолжает эту линию: в документации API модель проходит под рабочим именем Hailuo-03, но в публичном анонсе название сменили. Компания подаёт релиз как попытку убрать границы между отдельными режимами генерации и заодно вернуть видеомодели в открытый доступ.

Один запрос вместо четырёх режимов

До сих пор видеогенерация была разбита на отдельные задачи: текст в видео, картинка в видео, первый и последний кадр, перенос движения, референс по персонажу, редактирование. Под каждую обычно шла своя модель или свой режим. H3 принимает всё это в одном запросе – текст, изображения, ролики и аудио складываются в общий контекст, а связь между ними описывается обычными словами.

Пример из анонса MiniMax выглядит так: «Возьми движение камеры из видео 1, пусть персонаж с изображения 2 поёт, а голос совпадает с аудио 3». Модель сама разбирается, что здесь референс движения, что источник внешности, а что образец голоса. Отдельных переключателей режима нет.

2K по умолчанию, от 4 до 15 секунд

В API H3 доступна асинхронно: запрос возвращает идентификатор задачи, готовый ролик забирается отдельным вызовом. Разрешение сейчас одно – 2K. Длительность задаётся целым числом секунд в диапазоне от 4 до 15. Пропорции кадра выбираются из набора 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 либо подбираются автоматически под входной материал.

Ограничения на вход у MiniMax довольно щедрые:

  • до 9 референсных изображений, до 3 референсных видео и до 3 аудиодорожек в одном запросе;
  • каждый референсный клип от 2 до 15 секунд, суммарно не больше 15;
  • изображение до 30 МБ, видео до 50 МБ, аудио до 15 МБ, всё тело запроса до 64 МБ.

Текстовый промпт обязателен всегда, даже когда основную работу делают референсы. Аудио отдельно, без картинки или видео, модель не примет.

Цена как главный аргумент MiniMax

Экономику MiniMax описывает в относительных величинах: секунда в 2K обходится меньше трети от цены основных конкурентов, а в 768p – меньше половины от их же 720p. Абсолютных цифр в анонсе нет, конкретные модели для сравнения не названы.

Здесь нужно оговориться. Режим 768p упомянут в тексте про цены, но в самой документации API разрешение пока предлагается только одно, 2K. Либо более дешёвый режим появится позже, либо сравнение приведено для внутренних расчётов. Проверить утверждение о цене на своей задаче получится не раньше, чем откроется второй режим или появится публичный прайс-лист.

H3-VAE и регенерация вместо апскейла

Техническая часть у MiniMax держится на нескольких решениях. Новый токенизатор H3-VAE даёт четырёхкратный выигрыш по эффективной длине последовательности, и именно он позволяет считать 2K нативно, а не догонять разрешение постобработкой. Архитектура H3-Omni Transformer разводит вычисления на понимание и на генерацию по разным контурам, что подняло пропускную способность обучения почти на 30%.

Самое любопытное решение – отказ от отдельного модуля апскейла. Вместо него H3 заново генерирует собственный черновик низкого разрешения, снова опираясь на исходный контекст. По замыслу MiniMax это возвращает мелкие детали и текст на вывесках, которые обычный увеличитель разрешения способен только додумать. Полный технический отчёт компания обещает опубликовать позже.

Открытые веса обещаны «в ближайшие дни»

Видеогенерация до сих пор остаётся вотчиной закрытых моделей – открытых релизов сопоставимого уровня почти нет, и экосистема вокруг них развивается медленнее, чем вокруг языковых моделей. MiniMax собирается выложить веса H3 «в ближайшие дни, с учётом применимого законодательства». Формулировка осторожная, срок мягкий, но совместимость с разным железом компания закладывала в архитектуру с самого начала.

Если обещание выполнят, H3 станет одной из первых крупных открытых моделей для мультимодальной генерации видео. Развернуть её у себя и дообучить под конкретную нишу – сценарий, которого рынку сейчас не хватает больше, чем очередного роста качества.

Реклама, товарные карточки и заставки

Целевые сценарии MiniMax называет прямо: реклама, брендинг, электронная коммерция, промышленный дизайн, интерфейсы, игры. В демонстрациях – киношные титры, промо-ролик для сайта продукта, оживший постер и рекламные вставки для магазина. Отдельно компания подчёркивает аккуратную отрисовку текста и логотипов, что для товарной съёмки важнее эффектных планов.

Подбор примеров говорит о приоритетах. H3 продают не как инструмент для авторского кино, а как рабочую лошадь для контента, который производят пачками и по техзаданию.

Всё упирается в дату публикации весов

Заявленные MiniMax цифры пока опираются только на собственные тесты компании: независимых замеров качества и сравнений с конкурентами нет, абсолютных цен тоже. Ближайшая проверочная точка – выкладка весов. Появятся они в течение недели-двух, и у сообщества будет чем мерить; затянется срок или изменится формулировка про «применимое законодательство» – и H3 останется ещё одним API среди прочих, с хорошим прайсом и обычной для отрасли закрытостью.

Источник:
MiniMax



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Как пользоваться QwenWork: регистрация, возможности, бесплатные кредиты и тарифы

QwenWork — это новый ИИ-агент от Alibaba, который доступен на сайте и через отдельное приложение. По принципу работы...

История Starbucks: кто основал компанию, как появился логотип и кому принадлежит бренд

Сегодня Starbucks — одна из самых узнаваемых кофейных сетей мира: зелёную сирену знают даже те, кто ни разу...

⚔️ Тестиум: ChatGPT или DeepSeek — кто лучше пишет тексты?

Привет! Меня зовут Анатолий Чупин. Я редактор сайта Postium, исследователь ИИ и автор Telegram-канала «Промты — и точка»....

Подписка на Suno AI: тарифы, как купить из России и сколько стоит трек

Если вы открыли эту статью, то, скорее всего, уже знакомы с Suno AI: знаете, как работает нейросеть, и...

Pika Labs запустила Pika Agents

Pika Labs вывела Pika Agents в открытый доступ и предложила другой способ работы с генеративным ИИ. Вместо привычного...

Alibaba открыла QwenWork по всему миру — ИИ-агент работает в браузере и на компьютере

Alibaba открыла международную версию QwenWork в формате публичной беты. Это рабочая платформа с ИИ-агентом: пользователь описывает задачу обычным...

ElevenLabs теперь можно подключить к Claude через MCP

ElevenLabs представила MCP-сервер для Claude. Он позволяет управлять агентами ElevenLabs из чата в Claude. Коннектор уже появился в...

ByteDance выпустила Seedream 5.0 Pro для инфографики и точного редактирования изображений

ByteDance Seed 8 июля 2026 года представила Seedream 5.0 Pro - мультимодальную модель для генерации и редактирования изображений....

Лимиты использования в ChatGPT/Codex: где посмотреть и как сбросить

Даже на платных тарифах ChatGPT действуют лимиты на использование. Если они заканчиваются, сервис может прямо во время работы...

«Ёбидоёби» запустила коллаборацию с Atomic Heart

Служба доставки «Ёбидоёби» запустила коллаборацию с Atomic Heart. В меню появился одноимённый набор из 40 роллов в лимитированной...

Лучшие агрегаторы нейросетей в России — 11 сервисов для генерации изображений, видео, текста

Агрегаторы ИИ в России позволяют получить доступ к ChatGPT, Claude, Gemini, Grok, Midjourney, Seedance, Kling и другим зарубежным...

Gemini 3.8 Live получила видеоаватар для бизнеса

Google выпустила Gemini 3.8 Live with Live Avatar, режим с почти синхронным видеоаватаром для разговорных моделей. Функция доступна...

ElevenLabs представила Studio 4.0 с генерацией видео, изображений и звука

ElevenLabs выпустила Studio 4.0 — обновлённый редактор, а также Studio Agent. В одном проекте теперь можно генерировать видео,...

MiniMax выпустила видеомодель H3 – ролики в 2K со звуком

MiniMax 31 июля представила H3 - мультимодальную видеомодель, которая принимает текст, изображения, видео и звук и выдаёт ролики...

Приложения для создания и обработки фото с помощью ИИ: топ-11 на Android/iPhone

Нужно создать аватар, улучшить старое фото или оживить снимок для соцсетей? Под каждую задачу есть свое приложение, где...

ByteDance открыла публичный API Seedance 2.5

7 августа Volcano Engine открыла публичный API Seedance 2.5 - видеомодели ByteDance, которая одним проходом собирает 30-секундный ролик...

Alibaba выпустила Qwen-Image 2.1 с генерацией прозрачных изображений

Команда Qwen выпустила Qwen-Image 2.1 — модель для генерации и редактирования изображений. Веса опубликованы 20 сентября 2026 года...

15 главных сериалов октября 2026 года, которые нельзя пропустить

Октябрь — самое время доставать плед, заваривать что-нибудь горячее и устраивать длинные вечера за просмотром сериалов. Тем более...

Новые фишки и функции iOS 27 для iPhone — 13 главных обновлений

Недавно Apple выпустила iOS 27 — обновление доступно для iPhone 11 и более новых моделей, а также iPhone...

Будущий дата-центр Amazon в Техасе может стать главным источником углеродных выбросов в США

В рамках проекта дата-центра в округе Пекос, штат Техас, Amazon инвестирует в расположенную на площадке электростанцию, которая может...