RTSB2,805+1,08%↑CNY Бирж.12,802+0,37%↑IMOEX2 314,56-0,22%↓RTSI858,51-0,22%↓RGBI111,17-0,04%↓RGBITR764,09-0,01%↓

«Сбер» обновил ИИ-модель Kandinsky для создания видео со звуком

Алексей Орлов / Ведомости
Алексей Орлов / Ведомости

«Сбер» выпустил обновленную генеративную модель Kandinsky 6.0 Video., которая может автоматически добавлять аудиодорожку к видео. Об этом компания сообщила в пресс-релизе, который есть у «Ведомостей».

«Мы хотим, чтобы генеративный ИИ стал таким же естественным инструментом креатора, как сегодня текстовый редактор или камера телефона», – заявил старший вице-президент, руководитель блока «Развитие генеративного ИИ» «Сбера» Антон Фролов.

Модель может генерировать речь, музыку и звуки окружающей среды, соответствующие содержанию видео. Пользователю достаточно задать текстовый запрос или загрузить изображение, на основе которого нейросеть создаст ролик со звуком. Однако из-за значительных вычислительных затрат ролик больше пяти секунд сгенерировать не получится, но со временем разработчики планируют ее увеличить.

В новой версии Kandinsky улучшилась передача физики реального мира. Движения людей, животных и предметов в кадре должны выглядеть более естественно, а сами сцены – правдоподобнее.

10 сентября «Сбер» представил новую модель GigaChat 3.5 Reasoning с режимом рассуждений. Компания позиционирует новинку как единственную российскую открытую модель с режимом рассуждений.