Обзор MiniMax H3: настройка, гибкий воркфлоу и сравнение с LTX

출처
ru-origru
Aug 4, 2026 Aug 4, 2026
Video preview
공유:

Видео посвящено вышедшей модели видеогенерации MiniMax H3 с опубликованными весами. Автор рассказывает о первом опыте использования, настройке в ComfyUI, возможностях гибкого воркфлоу и сравнении с моделью LTX.

История выхода модели и первые реакции сообщества ⏱ 0:00

Буквально вчера вышла новая модель видеогенерации Mini Max H3, ранее доступная только по API. Веса модели были опубликованы, и теперь её можно скачать и использовать локально. Это довольно близко к Sora 2.0, и возможность запускать подобное локально — это, конечно же, круто. Автор рассказывает предысторию: на сайте modelop появился таймер обратного отсчёта до публикации весов. Все ждали, но когда до конца таймера оставалось 20 минут, релиз перенесли ещё на 6 часов. Релиз был запланирован на третье число ночью по московскому времени. В час ночи таймер закончился, но веса не опубликовались. В сообществе началась паника: люди пошли в Twitter, на Reddit, начали собирать посты, что это всё обман и скам. В чате с ребятами строили конспирологические теории, почему веса не опубликовали. Автор просидел до 3 часов, потом пошёл спать, а веса опубликовали только в 5–6 утра по Москве.

Обзор модели и технические характеристики ⏱ 2:03

Официальный репозиторий находится на Hugging Face, где модель выложена бесплатно, хотя скачивать прямо оттуда не обязательно. Модель действительно очень крутая. Она может генерировать видео длительностью от 4 до 15 секунд — это не технические ограничения, а ограничения по качеству: при большей длине ломается связанность и композиция. Например, тот же CoffeeAnans хвастался, что сгенерировал видео порядка 20–30 секунд. Поддерживаются разнообразные соотношения сторон и разрешения, жёстко фиксированных значений нет. FPS фиксированный — 24, менять его нельзя. Аудио выводится с частотой 32 кГц, стерео, качество звука намного лучше, чем на LTX. Поддерживается множество языков, включая русский. Есть две версии модели: одна заточена преимущественно под first frame и last frame (анимация изображений с текстом), вторая — омни-модель, поддерживающая референсы: изображения, аудио, видео, которые органично переплетаются и генерируются в результирующее видео. Обе имеют одинаковую базу. Лицензия модели разрешает коммерческое использование во всём мире, за исключением стран Европейского Союза, Великобритании, США и Кореи — там коммерческое использование запрещено из-за законодательных особенностей. Ограничение действует для бизнеса с совокупным годовым доходом от использования моделей менее 20 млн долларов в год; при превышении нужно отдельно согласовывать лицензию. Модель частично умеет генерировать NSFW-контент (обнажёнку), что было проверено на женских фигурах и работает неплохо.

Настройка ComfyUI и работа с воркфлоу ⏱ 6:39

Для запуска модели используется ComfyUI, который необходимо обновить до последней стабильной версии. В папке с ComfyUI есть папка Update с батником Update ComfyUI, его запуск выполняет обновление. Автор демонстрирует кастомную сборку ComfyUI, доступную на Boosty, где уже предустановлены все его воркфлоу, кроме нового. После запуска в разделе Templates при сортировке по новым появляются свежие воркфлоу: image to video, reference to video, text to video. В воркфлоу слева расположены ссылки для скачивания моделей, разрешение устанавливается в мегапикселях. Для генерации image to video можно загрузить первый и последний кадр; если байпассировать ноду с изображением или отключить линк, воркфлоу работает в режиме text to video на той же модели. Внутри воркфлоу: ноды загрузки моделей (диффузионная модель, клип, VAE видео, VAE аудио), расчёт длительности в кадрах, сэмплер. Декодирование видео и аудио происходит параллельно с одного пина. Здесь нет CFG и негативных подсказок, используется basic guider. Клип должен быть выбран Minimal, а нода работает только при обновлённом ком会和. При тестовой генерации 4 секунды в портретной ориентации с разрешением 4 мегапикселя скорость составила 10 секунд на итерацию. Модель использует видеокарту 470 Ti Super на 16 ГБ полностью, потребляя всю доступную память. На 32 ГБ оперативной и 12 ГБ VRAM (например, RTX 3060) также можно запускать, но с ограничениями по разрешению и длительности (например, секунд 8). На RTX 5090 генерация Full HD длительностью 15 секунд занимает порядка часа. Full HD видео получается качественным, намного лучше, чем на LTX, но 2K на данный момент недоступно для локального запуска. NVIDIA недавно показала результаты ускорения в два раза на LTX и других моделях, возможно, подобные оптимизации появятся и для этой модели, также ожидаются облегчённые версии, позволяющие генерировать не в 20 шагов, а в 16, 12 или даже 8. В тестовой генерации разрешение составило 544 на 800, что довольно мало; при масштабировании до 100% детали плывут, но на крупных планах вид приемлемый, а дальние планы не превращаются в кашу.

Для воркфлоу с референсами используется аналогичная база, но распакованная. Ключевое отличие — нода кондиционирования позволяет подавать референсы адаптивно. Можно загрузить до 9 изображений, 3 видеореференса cо звуком и 3 отдельных аудио. Референсы можно загружать одновременно, создавая сложные композиции. В отличие от LTX, где звук подаётся как подложка (заменяя сгенерированный на таймлайне), здесь звук подаётся именно как референс, что влияет на составление промтов. Промтинг для модели очень важен: модель чувствительна к тексту, и просто «накидав пару фраз» нельзя получить хороший результат.

Особенности контроля и промптинга в MiniMax H3 ⏱ 20:00

Модель MiniMax H3 отличается высоким уровнем контроля и низкой степенью случайности по сравнению с такими моделями, как LTX или Yuan. Это делает её похожей на Ideogram, поскольку она способна точно воспроизводить задуманное пользователем. Однако ключевым фактором успеха является качество составления промпта: при небрежном промпте результат будет соответствующим. Для достижения повторяемых результатов необходимо тщательно мониторить и корректировать промпт, а также изучать руководства по промптингу, включая советы по использованию референсов. Ссылки на эти руководства, доступные на сайте и в репозитории Hugging Face, будут оставлены в описании. Промптинг критически важен, и автор настоятельно рекомендует с ними ознакомиться.

Настройка референсов и разрешения ⏱ 21:01

В рабочем процессе предусмотрена гибкая настройка референсов и их размера. Параметр ref image size имеет режимы match и max: в режиме match изображение подгоняется под разрешение видео для более быстрой генерации, но с возможной потерей деталей; режим max изменяет размер референса по минимальной стороне до разрешения 2048 пикселей, что замедляет генерацию, но улучшает детализацию. По умолчанию установлен режим match, при котором референс внедряется быстрее, хотя детали могут пострадать.

Структура и возможности собственного гибкого рабочего процесса (workflow) ⏱ 22:02

Автор представил собственный гибкий workflow, адаптированный под различные задачи. В левой части расположены два загрузчика моделей: для стандартной диффузионной модели и для GGUF-моделей с возможностью переключения между ними. Под загрузчиками находятся ссылки на базовый репозиторий и конкретные модели. Для стандартного загрузчика используются диффузионные модели и текстовый энкодер, а для GGUF — соответствующие квантованные модели. Особое внимание уделено моделям для промпт-энхансера, состоящим из двух файлов: один отвечает за генерацию текста, второй — за распознавание изображений. Оба файла обязательны для скачивания, так как распознавание необходимо для обработки стартовых кадров и референсов. Здесь же приведена информация о потреблении ресурсов во время генерации. В workflow также интегрирована нода LLM text processor и инструкции по её установке, а также правила вызова референсов в промпте: они прописываются как "picture" в угловых скобках, а не как "image". Слева размещена памятка по разрешениям с указанием соответствия мегапикселям.

Переключение режимов и настройка промпта ⏱ 24:35

Ключевой переключатель ref to video mode определяет, как используются загруженные изображения. В активном режиме все изображения трактуются как референсы. Если режим отключён, то только первые два изображения могут использоваться как первый и последний кадр, остальные игнорируются. Блок промпта поддерживает два режима: без промпт-энхансера, когда промпт отправляется в модель в исходном виде, и с энхансером, который обрабатывает текст через LLM, и финальный результат отображается для проверки. Далее настраиваются разрешение, количество шагов (20 для модели PRUNT и 25 для стандартной BEPRUINT), длительность в секундах с шагом в полсекунды, сиды для генерации промпта и видео. Предусмотрен загрузчик для будущих LORA.

Загрузка и настройка референсов изображений, видео и аудио ⏱ 26:09

Загрузка референсов ограничена четырьмя изображениями из-за сложности контроля при большем количестве (хотя модель поддерживает до девяти). Для видео-референсов доступно два блока, в которые можно загрузить видео и произвольно его кадрировать. Разрешение кастомного кропа настраивается; при нулевых значениях используется исходное разрешение. Каждый видео-референс имеет отдельные переключатели для активации и мутирования звука: при включенном муте видео передаётся модели только как визуальный ряд. Аудио-референсы представлены двумя загрузчиками с аналогичными переключателями. Первый аудио-загрузчик имеет дополнительный переключатель для липсинка, который при активации подменяет звуковую дорожку финального видео загруженным аудио. Однако этот метод не всегда точен, так как модель может смещать тайминги на полсекунды. При использовании длинного аудио для генерации короткого видео (например, 30-секундное аудио и 10-секундное видео) необходимо указывать длительность в параметре duration, равную времени генерации, и обрезать аудио через параметры начала и конца. Автоматическая обрезка не предусмотрена, так как в некоторых случаях (референс шума или дождя) это нецелесообразно. При выключенном ref mode референсами считаются только первые два изображения; при включенном — все четыре.

Генерация с референсами: практический пример и нюансы промпт-энхансера ⏱ 31:18

Для демонстрации автор выбирает режим референсов, загружая изображение девушки, сгенерированной в Krea, и референс дождя. Промпт описывает два шота: сначала камера показывает обувь крупным планом, затем девушку средним планом спереди, с добавлением описания стилистики (slow motion, синематик, капли дождя, эхо шагов). Так как используется промпт-энхансер, переменные в угловых скобках не прописываются — LLM сама их корректно оформит. Автор использует модель энхансера с 27 миллиардами параметров, квантованную до 3,6. Системный промпт составлен так, чтобы энхансер переводил исходный текст на английский, не изменяя сути, поскольку текстовый энкодер Qwen VL с 32 миллиардами параметров работает на английском языке качественнее, хотя понимает и русский. При смене разрешения или соотношения сторон LLM пересчитывает промпт заново. Генерация тестового видео велась в портретной ориентации 2:3 с разрешением 0,5 мегапикселя (960 на 540) и длительностью 6 секунд. Референсы при этом могут иметь ландшафтную ориентацию — модель адаптируется.

Производительность, оптимизация и анализ результата ⏱ 37:32

Время генерации одного шага составляет примерно 16,5 секунд, колеблясь от 14 до 17 секунд. Включение технологий Sage Attention и FP16 accumulation драматически ускоряет процесс: на примере генерации 10-секундного видео в 720p время на шаг сократилось со 108 секунд до 46 секунд — ускорение более чем в два раза. У других пользователей прирост составлял 40-45%, что зависит от свежести оборудования и эффективности Sage Attention на конкретных GPU. Автор тестировал workflow на старом компьютере с 32 ГБ ОЗУ и видеокартой GTX 280 Ti с 12 ГБ памяти. Генерация в разрешении 0,5 мегапикселя длительностью 6-7 секунд происходила очень медленно, полностью исчерпывая оперативную и видеопамять; модель крайне требовательна к ресурсам. Итоговое видео показало хорошее соответствие референсам: платье, парк и обувь совпали, хотя цвет каблуков (золотой по задумке) не воспроизвелся, вероятно, из-за низкого разрешения. В целом результат оценён как неплохой.

Сравнение MiniMax H3 и LTX на примерах Image-to-Video и Text-to-Video ⏱ 40:08

Далее автор переходит к практическому сравнению моделей MiniMax H3 и LTX. Первый тест проведён в режиме image-to-video, где стартовым кадром служила сцена общения девушки и монстра. На модели LTX генерация заняла 10 минут для Full HD разрешения длительностью 15 секунд. Результат MiniMax H3 при разрешении HD и длительности 13 секунд потребовал 35 минут: 27 минут ушло на сэмплинг, остальное время — на декодирование и прочие процессы. Для ускорения работы автор намеренно сокращал длительность видео в MiniMax, так как модель генерирует значительно дольше. По качеству изображения автор отмечает, что MiniMax выдаёт более живую и эмоциональную картинку — лучше проработана мимика, присутствует лёгкий экшен, вплоть до надутых вен на лице персонажа. Визуально побеждает MiniMax, но по звуковой части и тембру голоса выигрывает LTX. Ещё один тест в режиме image-to-video с тем же промптом демонстрирует схожие результаты — визуал MiniMax живее, но аудио опять уступает. Третий тест — text-to-video с серфером на дальнем плане. LTX генерировал 15 секунд в Full HD, но звук подрагивал и гудел, а панорама делала резкий скачок. MiniMax показал те же 15 секунд в HD, но с плавной стереопанорамой и более живой, хоть и менее постановочной, картинкой. Автор подчёркивает, что целью было не достижение идеального качества, а сравнение общей динамики и поведения моделей.

Промпты для липсинга, редактирования и экшен-сцен ⏱ 40:08

Автор подробно разбирает структуру промптов для разных задач. Для липсинга базовая инструкция подаётся лаконично: «Используя изображение 1 как первый кадр, заставь девушку с изображения 1 говорить/петь/выполнять вокальный перформанс, используя аудиодорожку». Главный принцип — не описывать сценарий, а давать модели чёткие инструкции: «Используй то-то, заставь субъекта делать то-то». Аналогичный подход применяется для переноса движения — например, «заставь девушку с изображения 1 танцевать как на видео 2», что работает подобно Flux 2, но для видео. В демонстрации липсинга автор подал собственный аудиореференс, отключив генерацию звука моделью — на выходе получилось чистое совпадение артикуляции с эталонной дорожкой. Редактирование показано на примере замены блейзера на чёрную кожаную куртку: все движения, ракурсы и камера сохранились, но видео стало чуть контрастнее и «выжженнее» — деградация, характерная для FL Context и подобных инструментов. В тесте экшен-сцены с двумя персонажами автор загрузил только референсы девушки и четырёхрукого монстра без дополнительных данных. Модель стабильно воспроизвела сложную анатомию монстра — четыре руки, мелкие кибернетические детали, электронные гаджеты, оковы, часы — то, с чем LTX не справлялся, замазывая лишние конечности. Девушка сохраняла похожий костюм и светлые волосы на протяжении всей сцены, хотя разрешение было 1376x768, длительность — 10 секунд, а сэмплинг шёл 25 шагов. Автор замечает, что при увеличении числа шагов морфинг уменьшается.

Итоговые впечатления, коммерческое применение и дальнейшие планы ⏱ 40:08

MiniMax H3 оценивается автором как эволюционный скачок, приближающийся по возможностям к Cidence 2.0. Модель позволяет генерировать динамичные и качественные видео локально, включая коммерческую рекламу, что является большим плюсом. Автор планирует продолжать использовать LTX для определённых задач благодаря его скорости (например, Full HD за 10 минут против 35 минут у MiniMax), но считает MiniMax более актуальной для будущего развития. Отдельно отмечается частичная поддержка NSFW, включая генерацию обнажённой натуры. Время генерации у MiniMax может быть улучшено различными ухищрениями, и автор надеется на скорое появление дополнительных инструментов. В заключение он рекламирует свой Boosty-канал: подписчики получают доступ к платным воркфлоу (включая данный), закрытому Telegram-каналу, Discord-серверу для обсуждений, записям стримов и дополнительным материалам. Всем досмотревшим видео автор выражает благодарность и призывает ставить лайки, писать комментарии и подписываться на канал, где выходят как закрытые, так и бесплатные воркфлоу.

Ключевые выводы

  • •MiniMax H3 — новая модель видеогенерации с открытыми весами, ранее доступная только по API, теперь скачивается и используется локально.
  • •Для запуска требуется установить отсутствующие зависимости в ComfyUI, обновить его до последней стабильной версии и активировать кастомную ноду Sage Attention, что ускоряет генерацию примерно на 10 секунд.
  • •Модель обеспечивает высокий контроль и низкую случайность, приближаясь к качеству I2V-пайплайнов, и позволяет задавать количество шагов, гайденс и разрешение до 1536x640 в портретном или ландшафтном режиме.
  • •Авторский гибкий воркфлоу поддерживает переключение режимов (референсы, первый кадр, последний кадр), загрузку до четырёх изображений и одного видео-референса с извлечением первого и последнего кадров.
  • •В тестах MiniMax H3 превзошла LTX в режимах image-to-video и text-to-video, показав более стабильную генерацию, лучшее следование промпту и реалистичную физику движений.
  • Заключение

    В видео представлен детальный обзор новой модели видеогенерации MiniMax H3 с открытыми весами, описание её настройки в ComfyUI и сравнение с LTX. Автор продемонстрировал возможности гибкого воркфлоу для генерации с референсами, липсинга и экшен-сцен, отметив улучшенный контроль, производительность и приближение к уровню коммерческих решений.

    이 영상에 대해 질문하기