Нейросеть Kandinsky WM 1.0 сгенерировала ролики для обучения роботов

Служба новостей Автор статьи
Сбер представил модели Kandinsky WM 1.0 для ген...

AI Изображение создано с помощью ИИ и носит иллюстративный характер

В Сбере выпустили семейство генеративных моделей Kandinsky WM 1.0. Эти модели создают физически правдоподобные сцены для обучения роботов, беспилотного транспорта и систем Physical AI. Код и веса уже опубликованы под лицензией MIT и доступны бесплатно. Об этом сообщает портал N + 1.

Physical AI — это системы, взаимодействующие с физическим миром: автомобилями, пешеходами, роботами и промышленным оборудованием. Их обучают на больших массивах видеоданных. Собирать такие данные сложно и дорого, а некоторые сценарии нельзя записать в реальности — например, аварии, экстремальную погоду или отказ оборудования. Дообучать робота или беспилотник в процессе работы опасно.

Раньше применять для этого видео, сгенерированные нейросетями, мешали ошибки: искажались геометрия и перспектива, появлялись «мягкие» деформируемые объекты. Разработчики Сбера под руководством Дениса Димитрова решили проблему. Они создали модели на базе Kandinsky 5.0 Video Lite и дообучили их на миллионах видеозаписей с камер роботов, беспилотных автомобилей и промышленных процессов.

Модели Kandinsky WM генерируют физически достоверные видео длительностью около пяти секунд. В них есть отдельные действия: манипуляции с предметами, дорожные сцены, этапы производства. Такие ролики подходят для обучения систем компьютерного зрения и симуляторов беспилотного транспорта. Чтобы улучшить автомобильные эпизоды, разработчики применили обучение с подкреплением: Kandinsky WM генерировали видео, а другие нейросети оценивали сохранность формы, геометрию сцены и естественность движения.

Модели Kandinsky WM 1.0 выложили в открытый репозиторий проекта Kandinsky. Институт AIRI уже использует их в дорожном симуляторе. Центр робототехники Сбера применяет новые модели для обучения собственных роботов.