
Сбер представил новую модель Kandinsky 6.0 Video, которая позволяет пользователям GigaChat создавать короткие видео со звуком по текстовому описанию или загруженному первому кадру.
Антон Фролов, старший вице-президент, руководитель блока «Развитие генеративного ИИ» Сбера:
Мы хотим, чтобы генеративный ИИ стал таким же естественным инструментом креатора, как сегодня текстовый редактор или камера телефона.
Модель может генерировать речь, музыку и звуки окружающей среды, соответствующие содержанию видео. Пользователю достаточно задать текстовый запрос или загрузить изображение, на основе которого нейросеть создаст ролик со звуком. Однако из-за значительных вычислительных затрат ролик больше пяти секунд сгенерировать не получится, но со временем разработчики планируют ее увеличить.
В новой версии Kandinsky улучшилась передача физики реального мира. Движения людей, животных и предметов в кадре должны выглядеть более естественно, а сами сцены – правдоподобнее.
Напомним, в сентябре Сбер представил новую модель GigaChat 3.5 Reasoning с режимом рассуждений. Компания позиционирует новинку как единственную российскую открытую модель с режимом рассуждений.
Источник: Ведомости