MiniMax открыла веса видеомодели H3
Как и было обещано (https://t.me/ai_machinelearning_big_data/10631)на релизе в пятницу, китайская компания опубликовала (https://huggingface.co/MiniMaxAI/MiniMax-H3) модель H3, которая делает короткие ролики со звуком по текстовому описанию, картинкам, видео и аудио на входе.
Модель на 33 миллиарда параметров генерирует клипы длиной от 4 до 15 секунд, 24 кадра в секунду, со стереозвуком 32 килогерца, в пропорциях от широких 21:9 до вертикальных 9:16. Реплики персонажей поддерживаются на 11 языках, включая русский.
Полный конвейер H3 состоит из трёх частей:
🟠H3-Context-IR разбирает запрос пользователя со всем инпутом (картинки, видео, аудио) и переводит его во внутренний формат, с которым дальше работает модель.
🟢H3-Base по этому формату генерирует видео в разрешении 768p.
🟠H3-Regenerate-2K затем пересобирает сгенерированный ролик в 2K.
Но открыли не всю систему - только модуль, который отвечает непосредственно за генерацию. Закрытыми остались H3-Context-IR и H3-Regenerate-2K.
🟡H3-Base опубликована в 2-х вариантах
H3-Base-FL2VA (https://huggingface.co/MiniMaxAI/MiniMax-H3/tree/main/FL2VA) работает с первым и последним кадром. Без картинок на входе это генерация по тексту, с одной или двумя - достройка ролика от заданного кадра или между двумя кадрами.
H3-Base-Ref2VA (https://huggingface.co/MiniMaxAI/MiniMax-H3/tree/main/Ref2VA) принимает смешанный ввод - до 9 изображений, до 3 видео и до 3 аудиодорожек, но суммарно не больше 12 файлов. Звук без картинки или видео система не примет.
По рейтингу (https://x.com/ArtificialAnlys/status/2083042088338538594) Artificial Analysis, H3 занимает 1 место в редактировании видео, второе в генерации видео по тексту и третье - по изображению.
СomfyUI подготовили детальную инструкцию (https://docs.comfy.org/tutorials/video/minimax/minimax-h3) по использованию в своей среде и опубликовали базовые воркфлоу для генерации по тексту (https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_t2v.json) и референсу (https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_r2v.json).
Помимо СomfyUI есть кукбуки под SGLang (https://docs.sglang.io/cookbook/diffusion/MiniMax/MiniMax-H3), vLLM (https://recipes.vllm.ai/MiniMaxAI/MiniMax-H3)и diffusers (https://github.com/huggingface/diffusers/blob/minimax-h3/docs/source/en/api/pipelines/minimax_h3.md), а так же промпт-гайды под базу (https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md) и фулл-реф мод (https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_ref_en.md).
Лицензия разрешает дообучать модель на своих видео, персонажах или визуальном стиле. Официального кода для трейна пока нет.
⚠ Коммерческое использование допускается только для компаний с выручкой ниже 20 миллионов долларов.
📌Лицензирование: MiniMax H3 Community License
🟡Модель (https://huggingface.co/MiniMaxAI/MiniMax-H3)