«ГигаЧат» Сбера научился создавать видео с синхронным звуком
iXBT.com ·

Пользователи «ГигаЧата» получили возможность генерировать видеоролики с речью, музыкой и звуками окружающей среды. Новая возможность появилась благодаря модели Kandinsky 6.0 Video, разработанной Сбером. Для создания ролика достаточно описать сцену текстом или загрузить исходный кадр и указать, какие звуки должны сопровождать видео.
Пользователи «ГигаЧата» получили возможность генерировать видеоролики с речью, музыкой и звуками окружающей среды. Новая возможность появилась благодаря модели Kandinsky 6.0 Video, разработанной Сбером. Для создания ролика достаточно описать сцену текстом или загрузить исходный кадр и указать, какие звуки должны сопровождать видео.
Нейросеть создает видео в разрешении до Full HD, а максимальная продолжительность ролика со звуком сейчас составляет пять секунд. В «ГигаЧате» можно выбрать SD, HD или Full HD в зависимости от требуемого качества и скорости генерации.
Kandinsky 6.0 Video синхронизирует изображение и аудио: речь соответствует движениям губ персонажей, а музыка и звуки окружения — происходящему в кадре. Модель способна генерировать диалоги, шум шагов, ветер, движение автомобилей и другие звуковые эффекты. При необходимости ролик можно создать без звука.
Разработчики также улучшили передачу физики и движения объектов. По данным Сбера, люди, животные и техника стали выглядеть естественнее, особенно в динамичных сценах.
Для разработчиков модель доступна с открытым исходным кодом по лицензии MIT. Ее можно интегрировать в собственные продукты через популярные инструменты для работы с генеративными моделями.