«Сбер» представил обновлённую модель Kandinsky 6.0 для генерации видео — она может создавать ролики со звуком

Доступна в ИИ-помощнике GigaChat.

Источник здесь и далее: «Сбер»
  • Kandinsky 6.0 Video — мультимодальная модель, которая одновременно «видит и слышит то, что генерирует», рассказали в «Сбере». Она умеет создавать видео с параллельным звуком — диалоги, эффекты и фоновая музыка синхронизированы с картинкой, а губы героя движутся вместе с речью.
  • Для генерации видео нужно описать сцену текстом или загрузить первый кадр и добавить описание звукового ряда. Максимальная длительность ролика — пять секунд, со временем разработчики планируют её увеличить.
  • Kandinsky создаёт звук в широком диапазоне: от разговора и цифровых эффектов до шагов, шума ветра или звука проезжающей машины. Качество стандартное — 44 кГц. Если звук не нужен, можно попросить модель создать видео без него.
  • Нейросеть генерирует ролики в разрешении до Full HD. В GigaChat пользователи смогут выбрать нужное качество в окне ввода перед отправкой запроса: SD для более быстрой генерации, HD или Full HD для более чёткой и детализированной картинки.
  • Модель состоит из двух связанных модулей, которые отвечают за создание видео и звука. Звуковой обучили на более чем 20 млн видео со звуком.
  • Разработчикам новая модель доступна под лицензией MIT — её можно бесплатно интегрировать в собственные продукты.
1166
1144
11