Сбер представил новую модель Kandinsky 6.0 Video

Сбер представил новую модель Kandinsky 6.0 Video, которая позволяет пользователям GigaChat создавать короткие видео со звуком по текстовому описанию или загруженному первому кадру.

Антон Фролов, старший вице-президент, руководитель блока «Развитие генеративного ИИ» Сбера:

Мы хотим, чтобы генеративный ИИ стал таким же естественным инструментом креатора, как сегодня текстовый редактор или камера телефона.

Модель может генерировать речь, музыку и звуки окружающей среды, соответствующие содержанию видео. Пользователю достаточно задать текстовый запрос или загрузить изображение, на основе которого нейросеть создаст ролик со звуком. Однако из-за значительных вычислительных затрат ролик больше пяти секунд сгенерировать не получится, но со временем разработчики планируют ее увеличить.

В новой версии Kandinsky улучшилась передача физики реального мира. Движения людей, животных и предметов в кадре должны выглядеть более естественно, а сами сцены – правдоподобнее.

Напомним, в сентябре Сбер представил новую модель GigaChat 3.5 Reasoning с режимом рассуждений. Компания позиционирует новинку как единственную российскую открытую модель с режимом рассуждений.

Источник: Ведомости

(Голосов: 3, Рейтинг: 5)