• Виктор
  • Блог
  • 2 мин. чтения

MiniMax выпустила видеомодель H3 – ролики в 2K со звуком


MiniMax 31 июля представила H3 – мультимодальную видеомодель, которая принимает текст, изображения, видео и звук и выдаёт ролики до 15 секунд в 2K с нативным стереозвуком. Модель уже работает через API, а веса компания обещает открыть в ближайшие дни.

MiniMax выпустила видеомодель H3 - ролики в 2K со звуком

MiniMax – китайская компания, известная по линейке видеомоделей Hailuo (Хайлуо) и текстовым моделям серии M. H3 продолжает эту линию: в документации API модель проходит под рабочим именем Hailuo-03, но в публичном анонсе название сменили. Компания подаёт релиз как попытку убрать границы между отдельными режимами генерации и заодно вернуть видеомодели в открытый доступ.

Один запрос вместо четырёх режимов

До сих пор видеогенерация была разбита на отдельные задачи: текст в видео, картинка в видео, первый и последний кадр, перенос движения, референс по персонажу, редактирование. Под каждую обычно шла своя модель или свой режим. H3 принимает всё это в одном запросе – текст, изображения, ролики и аудио складываются в общий контекст, а связь между ними описывается обычными словами.

Пример из анонса MiniMax выглядит так: «Возьми движение камеры из видео 1, пусть персонаж с изображения 2 поёт, а голос совпадает с аудио 3». Модель сама разбирается, что здесь референс движения, что источник внешности, а что образец голоса. Отдельных переключателей режима нет.

2K по умолчанию, от 4 до 15 секунд

В API H3 доступна асинхронно: запрос возвращает идентификатор задачи, готовый ролик забирается отдельным вызовом. Разрешение сейчас одно – 2K. Длительность задаётся целым числом секунд в диапазоне от 4 до 15. Пропорции кадра выбираются из набора 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 либо подбираются автоматически под входной материал.

Ограничения на вход у MiniMax довольно щедрые:

  • до 9 референсных изображений, до 3 референсных видео и до 3 аудиодорожек в одном запросе;
  • каждый референсный клип от 2 до 15 секунд, суммарно не больше 15;
  • изображение до 30 МБ, видео до 50 МБ, аудио до 15 МБ, всё тело запроса до 64 МБ.

Текстовый промпт обязателен всегда, даже когда основную работу делают референсы. Аудио отдельно, без картинки или видео, модель не примет.

Цена как главный аргумент MiniMax

Экономику MiniMax описывает в относительных величинах: секунда в 2K обходится меньше трети от цены основных конкурентов, а в 768p – меньше половины от их же 720p. Абсолютных цифр в анонсе нет, конкретные модели для сравнения не названы.

Здесь нужно оговориться. Режим 768p упомянут в тексте про цены, но в самой документации API разрешение пока предлагается только одно, 2K. Либо более дешёвый режим появится позже, либо сравнение приведено для внутренних расчётов. Проверить утверждение о цене на своей задаче получится не раньше, чем откроется второй режим или появится публичный прайс-лист.

H3-VAE и регенерация вместо апскейла

Техническая часть у MiniMax держится на нескольких решениях. Новый токенизатор H3-VAE даёт четырёхкратный выигрыш по эффективной длине последовательности, и именно он позволяет считать 2K нативно, а не догонять разрешение постобработкой. Архитектура H3-Omni Transformer разводит вычисления на понимание и на генерацию по разным контурам, что подняло пропускную способность обучения почти на 30%.

Самое любопытное решение – отказ от отдельного модуля апскейла. Вместо него H3 заново генерирует собственный черновик низкого разрешения, снова опираясь на исходный контекст. По замыслу MiniMax это возвращает мелкие детали и текст на вывесках, которые обычный увеличитель разрешения способен только додумать. Полный технический отчёт компания обещает опубликовать позже.

Открытые веса обещаны «в ближайшие дни»

Видеогенерация до сих пор остаётся вотчиной закрытых моделей – открытых релизов сопоставимого уровня почти нет, и экосистема вокруг них развивается медленнее, чем вокруг языковых моделей. MiniMax собирается выложить веса H3 «в ближайшие дни, с учётом применимого законодательства». Формулировка осторожная, срок мягкий, но совместимость с разным железом компания закладывала в архитектуру с самого начала.

Если обещание выполнят, H3 станет одной из первых крупных открытых моделей для мультимодальной генерации видео. Развернуть её у себя и дообучить под конкретную нишу – сценарий, которого рынку сейчас не хватает больше, чем очередного роста качества.

Реклама, товарные карточки и заставки

Целевые сценарии MiniMax называет прямо: реклама, брендинг, электронная коммерция, промышленный дизайн, интерфейсы, игры. В демонстрациях – киношные титры, промо-ролик для сайта продукта, оживший постер и рекламные вставки для магазина. Отдельно компания подчёркивает аккуратную отрисовку текста и логотипов, что для товарной съёмки важнее эффектных планов.

Подбор примеров говорит о приоритетах. H3 продают не как инструмент для авторского кино, а как рабочую лошадь для контента, который производят пачками и по техзаданию.

Всё упирается в дату публикации весов

Заявленные MiniMax цифры пока опираются только на собственные тесты компании: независимых замеров качества и сравнений с конкурентами нет, абсолютных цен тоже. Ближайшая проверочная точка – выкладка весов. Появятся они в течение недели-двух, и у сообщества будет чем мерить; затянется срок или изменится формулировка про «применимое законодательство» – и H3 останется ещё одним API среди прочих, с хорошим прайсом и обычной для отрасли закрытостью.

Источник:
MiniMax



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Krea AI представила Krea 2 – собственную модель для генерации изображений

Krea AI 12 мая 2026 года анонсировала Krea 2 — новую модель для генерации изображений. В ветке компания...

OpenAI выпустила ChatGPT Images 2.5 — генерация стала быстрее, а изображения можно точечно доработать

OpenAI выпустила ChatGPT Images 2.5 — обновлённую модель для генерации и редактирования изображений в ChatGPT. Компания заявляет, что...

Suno выпустила бесплатную модель «v4.5-all» — нейросеть создаёт топовую музыку и вокал

Нейросеть Suno AI официально заменила старую модель «v3.5» на более новую «v4.5-all» в бесплатной версии сервиса. Теперь пользователи...

Wan3.0 от Alibaba превращает презентации и отчёты в 30-секундные ролики

Alibaba официально запустила Wan3.0 - видеомодель, которая делает ролик длиной до 30 секунд из текста, картинок, аудио и...

ComfyUI заморозила новые бесплатные аккаунты в Comfy Cloud из-за злоупотреблений видеомоделями

ComfyUI временно остановила создание новых бесплатных аккаунтов в Comfy Cloud. Причина - инцидент со злоупотреблениями, в котором атаковали...

Suno выпустила v6 — три модели и редактирование песен запросами

Suno представила новое поколение моделей v6 для генерации музыки. Компания выпустила сразу три версии: основную v6, экспериментальную v6-wild...

Perplexity встроила слайдер вычислительных усилий в агентный сервис Computer

Perplexity добавила слайдер управления вычислительными усилиями в агентный сервис Computer. Пользователи веб-версии платформы могут выбирать глубину рассуждений и...

Anthropic выпустила Claude Opus 5.5 — модель стала быстрее и дешевле 

Anthropic выпустила Claude Opus 5.5 для Claude, Claude Code и Claude Platform. Новая модель генерирует ответы более чем...

В Gemini появились цифровые аватары для Nano Banana

Google добавила в Gemini персональные аватары. Теперь можно один раз записать лицо и голос, после чего создавать изображения...

Alibaba сообщила о падении прибыли на 75% из-за крупных инвестиций в ИИ-инфраструктуру

Китайский технологический гигант Alibaba в четверг сообщил о падении прибыли за последний квартал на 75% на фоне крупных...

DeepSeek представила DeepSeek-OCR — новую модель для сжатия визуального контекста в LLM

Компания DeepSeek показала DeepSeek-OCR — OCR-модель, созданную специально для больших языковых моделей. Вместо обычного распознавания текста она сжимает...

OpenAI выпустила GPT-6 Sol и Luna и вдвое снизила цены

OpenAI выпустила GPT-6 Sol и GPT-6 Luna, среднюю и младшую модели поколения GPT-6. Они построены на наработках флагманской...

OpenAI бьёт по Apple в суде: «Вы сами не защитили свои секреты»

Ходатайство OpenAI об отклонении иска Apple о коммерческой тайне — вместе с новыми судебными материалами — показывает, какую...

MiniMax выпустила видеомодель H3 – ролики в 2K со звуком

MiniMax 31 июля представила H3 - мультимодальную видеомодель, которая принимает текст, изображения, видео и звук и выдаёт ролики...

Midjourney V8.1 ускорилась и вернула стиль

Midjourney выпустила альфа-версию V8.1, в которой разработчики сделали ставку на баланс: вернули фирменный визуальный стиль, ускорили генерацию и...

Alibaba выпустила Qwen-Image 2.1 с генерацией прозрачных изображений

Команда Qwen выпустила Qwen-Image 2.1 — модель для генерации и редактирования изображений. Веса опубликованы 20 сентября 2026 года...

Claude Mythos 5. ИИ, который обычным пользователям не продадут

Существует целый класс программ, которые не рекламируют широко. Не потому, что они плохи, а ровно наоборот. Claude Mythos...

Runway показала GWM Worlds 2 – интерактивный мир вместо видеоролика

Runway 3 сентября показала GWM Worlds 2 - мировую модель, которая выдаёт живое интерактивное пространство вместо готового ролика....

Как пользоваться Nano Banana 2 Lite бесплатно — гайд

Недавно Google выпустил нейросеть Nano Banana 2 Lite — облегчённую версию генератора изображений на базе Gemini. ИИ-модель быстро...

История Starbucks: кто основал компанию, как появился логотип и кому принадлежит бренд

Сегодня Starbucks — одна из самых узнаваемых кофейных сетей мира: зелёную сирену знают даже те, кто ни разу...