Seedance 2.5: 30 секунд видео одним дублем. Разбираем, что там правда, а что дорисовали обзорщики

ByteDance выкатил новую версию своей видеомодели. Главная цифра релиза - тридцать секунд непрерывного видео за одну генерацию, без склейки кусков. Разбираемся, что это даёт на практике, где обзоры коллективно ошиблись и как попробовать модель на русском языке.

Что произошло

Seedance 2.5 показали 23 июня на конференции Volcano Engine FORCE в Пекине, а до пользователей она доехала 31 июля: сначала китайские Jimeng и Doubao Pro, следом Dreamina в приложении CapCut. Дальше доступ раскатывают волнами по партнёрским площадкам.

Забавная деталь: версий 2.1, 2.2, 2.3 и 2.4 не было вообще. ByteDance прыгнул с 2.0 сразу на 2.5, чтобы показать - это не мелкое обновление, а смена поколения.

Коротко, что нового по сравнению с 2.0:

• было 4-15 секунд, стало 30 секунд одним куском;

• было около 9 картинок и по 3 видео и аудио на вход, стало 50 файлов сразу: 30 изображений, 10 видеороликов, 10 звуковых дорожек;

• появилась правка готового ролика: по таймкоду, с заменой фона, с перекадровкой;

• появился приём 3D-болванки для управления камерой;

• ByteDance заявляет примерно на 20% более точное следование промпту.

Официальное демо ByteDance: 30,042 секунды одним дублем. Герой в чёрном пальто проходит шесть комнат, и каждая сделана в своём стиле - фетровая анимация, монохром, подводный мир, фейерверки.
Ночной неоновый город под дождём, толпа с зонтами, в финале крупный план андроида. Тридцать секунд, одна генерация, камера не прерывается.

Где её попробовать прямо сейчас

Чтобы не держать вас до конца статьи: Seedance 2.5 уже подключена в агрегаторе Cyber AI. Это бот, где генеративные модели собраны в одном месте, интерфейс русский, VPN и регистрация на китайских сервисах не нужны. По стоимости генерации это сейчас самое доступное предложение среди доступных в России.

Открыть: Telegram | MAX

Дальше - разбор того, что модель реально умеет, и где обзоры коллективно ошиблись.

Почему тридцать секунд - это не «просто в два раза длиннее»

Звучит как обычная прибавка. На деле меняется место, где живёт работа.

Раньше ролик на полминуты собирали из пяти-семи генераций по 4-8 секунд. И каждый стык был проблемой: лицо чуть-чуть уезжает, свет прыгает, текстура куртки внезапно другая. Монтажёр тратил время не на монтаж, а на маскировку швов. Экономия от быстрой генерации съедалась целиком.

Когда дубль непрерывный, склеивать нечего. И тут вылезает вторая причина, почему цифра именно тридцать: это готовая длина. Тридцать секунд - это рекламный ролик, это преролл, это полный вертикальный сюжет для соцсетей. Впервые то, что модель выдаёт нативно, совпадает с тем, что на самом деле нужно сдать заказчику.

Режиссёр рекламы Оливье Дрессен в своём разборе формулирует ещё жёстче: длинный дубль возвращает работу из монтажа обратно в препродакшн. Нельзя больше сгенерировать пачку кусков и решить всё «на монтаже» - надо заранее собрать референсы, продумать раскадровку и понять, чего ты хочешь от сцены. Для тех, кто пришёл из настоящего продакшна, это скорее плюс: дорого стоят как раз те ошибки, которые чинят на площадке, а не на бумаге.

Пятьдесят референсов - обновление, которое важнее длины

Про длину написали все. Про референсы почти никто, а зря.

Модель принимает в одну генерацию до 50 материалов: тридцать фотографий, десять видео и десять аудио. Тридцать фото - это достаточно, чтобы задать персонажа с разных ракурсов, зафиксировать точную геометрию товара, задать палитру и показать локацию. Одновременно.

На брендовых задачах вас убивает не то, что кадр плохо выглядит сам по себе. Вас убивает то, что бутылка в третьем кадре другой формы, чем в первом. Пачка жёстко зафиксированных референсов - это, по сути, та же референс-борда, с которой работает любой нормальный продакшн, просто теперь её понимает модель.

Показательный момент из практики: в hands-on от MindStudio целая короткометражка на две с лишним минуты держалась всего на трёх картинках - два портрета героев и один кадр бара. Никаких подробных чарактер-шитов не понадобилось.

Отдельно тестировали потолок: скормили модели целый гардероб одного персонажа и попросили менять одежду внутри одной генерации. Персонаж остался узнаваемым. То есть пятьдесят - это не маркетинговая цифра для слайда.

Встреча в аэропорту: тридцать секунд эмоций и мимики без единой склейки. Именно на таких сценах длинный дубль даёт больше всего.

Правка вместо перегенерации

Второй блок изменений - редактирование. Раньше любая правка заказчика означала новый бросок кубика: генерируешь заново и теряешь всё, что уже согласовали.

В 2.5 заявлены четыре режима:

1. Правка по таймкоду. Обращаешься к конкретному моменту ролика и меняешь именно его.

2. Замена фона. По сути встроенный хромакей.

3. Перекадровка. Пересобрать ракурс уже снятого дубля, а не снимать заново. Фактически это доснятая «покрышка», из которой и собирают монтаж.

4. Правка по референсу. Показываешь картинку, модель подгоняет фрагмент.

Плюс приём, из-за которого на релиз обратили внимание киношники: модель принимает на вход трёхмерную болванку - серую нетекстурированную геометрию из 3D-редактора, которой в обычном пайплайне задают положение камеры и расстановку актёров до всякого света и рендера. ByteDance называет это первой функцией 3D-превиза внутри видеомодели. На практике это значит, что движение камеры можно задать точно, а не надеяться, что модель сама придумает удачный проезд.

Про 4K, которого нет

Здесь надо остановиться, потому что ошибка разошлась очень широко.

В десятках обзоров Seedance 2.5 описана как модель с нативным 4K, а кое-где и с 10-битным цветом. Это не так. 4K на том июньском кейноуте объявили для Seedance 2.0 - апгрейд старшей версии показали на той же сцене буквально через несколько минут после анонса 2.5. Две новости слиплись, и характеристика переехала не туда.

Проверяется просто: в лончпосте по 2.5 от 31 июля разрешение не заявлено вообще, на продуктовой странице Dreamina для 2.5 слова «4K» нет ни в описании, ни в FAQ, а страница «Seedance 2.0 4K» лежит рядом отдельно.

Что видят те, кто уже снимал. В hands-on от MindStudio выдача была 720p, финальный материал доводили обычным апскейлером. PixVerse у себя отдаёт 480p и 720p.

Вывод трезвый: если 4K стоит у вас в требованиях к сдаче, смотреть надо на 2.0. Сила 2.5 в другом - в длине дубля, объёме референсов и управляемости.

Что ломается на практике

Обзор без списка проблем - это пресс-релиз. Вот что нашли те, кто уже поработал.

Морфинг в быстрых сценах. В экшене персонаж может «поплыть»: геометрия начинает дрожать и разъезжаться. Происходит это не по всему ролику, а кусками, и апскейлером не лечится вообще. У 2.0 после релиза была ровно та же болячка, её потом закрыли патчами, так что ждём того же.

Голоса живут своей жизнью. Если вы дали фото и не сказали, как персонаж говорит, модель придумает голос сама - по тому, как герой выглядит. У тестера персонаж без всяких указаний заговорил с британским акцентом. Помогло слово «American» в промпте, а вот «American English» не сработало: слово English снова утягивало произношение в британскую сторону. Мелочь, но показывает, насколько модель чувствительна к конкретным словам, а не к общему смыслу.

Старые промпты не переезжают. Промпт, который отлично работал на 2.0, на 2.5 может выдать глюки. И ещё модель не любит, когда в тридцать секунд пытаются запихнуть монтаж из односекундных нарезок. Сцене надо дать подышать - тогда результат заметно чище.

Доступ. Он всё ещё раскатывается. По части площадок API уже открыт, по части висит табличка «скоро». Если вы строите на этом пайплайн, лучше не планировать под дату, которую никто официально не подтвердил.

Как писать промпт под 2.5

Единственно верной формулы нет, но у практиков сложилась рабочая структура брифа из семи блоков:

Субъект - кто или что в кадре.

Действие - что меняется за время ролика.

Место - где происходит и какой там свет.

Визуальное направление - материалы, цвет, настроение.

Камера - общий план, крупный, проезд, наезд, съёмка с рук.

Звук - реплики, эмбиент, музыка, эффекты.

Референсы - что каждая приложенная картинка или дорожка должна зафиксировать.

Два правила поверх. Первое: длинный промпт не значит хороший, добавляйте только то, что реально меняет кадр. Второе: референсы - это не «чем больше, тем лучше». Маленький согласованный набор обычно работает лучше, чем свалка из тридцати файлов; расширяйте набор только когда тест показал, что новая картинка действительно улучшила результат.

И проверяйте результат по промпту, а не по красоте: попал ли субъект, случилось ли заявленное действие, сделала ли камера то движение, которое просили, совпал ли звук.

Реклама напитка, двадцать девять секунд. Действия и звук привязаны к таймкодам: пустыня, находка бутылки, нарастание, финал с брендом.
Солдат в окопе смотрит на фотографию. Крупный план держится всю сцену, лицо не разъезжается - традиционно слабое место видеомоделей.

Кому это правда нужно

Рекламным командам. Тридцать секунд плюс жёсткие референсы товара - это готовый ролик за одну генерацию, без сшивки и без «а почему бутылка другая».

Тем, кто делает короткие сериалы и скетчи. Длинный дубль хорошо держит диалог: героям нужно время произнести реплику и отреагировать, а не отработать четырёхсекундный бит.

Продюсерам на препродакшне. Можно показать заказчику сцену целиком до того, как что-то снимать.

Мультиязычным проектам. Липсинк заявлен для восьми с лишним языков, в официальном демо вокалист здоровается на разных языках подряд, и губы попадают в звук.

Кухня ресторана: открытый огонь, движение на заднем плане, шеф собирает блюдо. Сложная сцена с несколькими людьми в кадре.

Как попробовать без танцев с китайскими сервисами

Отдельная боль: Jimeng, Doubao и Dreamina - это китайские и международные площадки со своей регистрацией, своими требованиями и не всегда доступные из России.

Seedance 2.5 уже подключена в агрегаторе Cyber AI - боте, где генеративные модели собраны в одном месте и работают на русском языке. Никакого VPN и отдельных аккаунтов на каждом сервисе: заходите, выбираете модель, пишете промпт. Рядом там же лежат другие видеомодели, так что одну и ту же сцену удобно прогнать по нескольким и сравнить. И, как уже говорилось выше, по цене генерации Seedance 2.5 там сейчас обходится дешевле, чем где-либо ещё из доступного в России.

Попробовать: Telegram | MAX

Если не хочется собирать промпт с нуля - готовые лежат в галерее promptstudio.tools, там можно скопировать рабочий вариант и подставить своё.

Итог

Seedance 2.5 - это не «то же самое, но длиннее». Это попытка превратить генератор роликов в инструмент продакшна: длинный дубль, много референсов, правка без перегенерации, управление камерой через 3D-болванку.

Что подтверждено: тридцать секунд одним куском реально работают, стабильность персонажа на этой длине держится, референсы делают то, что обещано.

Что не подтверждено: 4K (его в 2.5 просто не заявляли), стабильность в быстром экшене, предсказуемость голосов и повторяемость результата от дубля к дублю. Независимых замеров пока нет ни у кого.

Правильная формулировка на сегодня - «очень многообещающе и очень сыро». Ровно та стадия, когда интереснее всего попробовать самому.

Материал основан на официальном анонсе ByteDance, разборах MindStudio, CineD, TestingCatalog, Nereo и designhero.tv.

3