CNY Бирж.12,676-0,58%↓BISVP10+0,1%↑MRKS0,481-1,13%↓IMOEX2 302,4-1,5%↓RTSI848,5-1,5%↓RGBI110,68-0,44%↓RGBITR761,38-0,39%↓

«Сбер» обновил ИИ-модель Kandinsky для создания видео со звуком

Алексей Орлов / Ведомости
Алексей Орлов / Ведомости

«Сбер» выпустил обновленную генеративную модель Kandinsky 6.0 Video., которая может автоматически добавлять аудиодорожку к видео. Об этом компания сообщила в пресс-релизе, который есть у «Ведомостей».

«Мы хотим, чтобы генеративный ИИ стал таким же естественным инструментом креатора, как сегодня текстовый редактор или камера телефона», – заявил старший вице-президент, руководитель блока «Развитие генеративного ИИ» «Сбера» Антон Фролов.

Модель может генерировать речь, музыку и звуки окружающей среды, соответствующие содержанию видео. Пользователю достаточно задать текстовый запрос или загрузить изображение, на основе которого нейросеть создаст ролик со звуком. Однако из-за значительных вычислительных затрат ролик больше пяти секунд сгенерировать не получится, но со временем разработчики планируют ее увеличить.

В новой версии Kandinsky улучшилась передача физики реального мира. Движения людей, животных и предметов в кадре должны выглядеть более естественно, а сами сцены – правдоподобнее.

10 сентября «Сбер» представил новую модель GigaChat 3.5 Reasoning с режимом рассуждений. Компания позиционирует новинку как единственную российскую открытую модель с режимом рассуждений.