02.09.2026
Atlas объединяет в одной модели генерацию видео с управляемой камерой, восстановление трехмерных сцен и создание симуляций. Система принимает текст, изображения, видео и пространственные данные, а результат может экспортировать как облака точек и сцены 3D Gaussian Splatting.
Компания World Labs, основанная исследовательницей компьютерного зрения Фэй-Фэй Ли и ее коллегами, представила Atlas — единую модель для генерации, реконструкции и симуляции трехмерных миров. Разработчики называют ее мультимодальным авторегрессионным диффузионным трансформером: входные изображения, видео, положения камер и карты глубины объединяются в общий пространственный контекст.
Atlas генерирует новые ракурсы сцены по одному или нескольким изображениям, принимая траекторию камеры как геометрические данные. Модель способна создавать управляемые видеоролики продолжительностью до минуты с разрешением 1440p.
Для реконструкции реальных объектов и помещений Atlas может использовать от одного до нескольких десятков снимков. По утверждению World Labs, двух-трех изображений обычно достаточно для достоверного восстановления видимых частей сцены, а дополнительные кадры уменьшают объем деталей, которые модели приходится достраивать самостоятельно.
Результат можно получить не только в виде изображений или видео, но и как облако точек либо сцену на основе 3D Gaussian Splatting. В робототехнических сценариях Atlas реконструирует окружение и генерирует цветные изображения и карты глубины, которые получили бы датчики виртуального робота. Это позволяет создавать обучающие и тестовые симуляции с разными объектами, освещением и траекториями движения.
Atlas пока предоставляется отдельным партнерам в режиме раннего доступа. В дальнейшем модель станет основой новых версий продукта World Labs Marble и других сервисов компании.
Источник: worldlabs.ai